コンテンツ分野 1: ML と AI のためのデータの準備
タスク 1.1: データを収集して保存する。
スキル 1.1.1: データソース (Amazon S3、Amazon EBS、Amazon EFS、Amazon RDS、Amazon DynamoDB、Amazon OpenSearch Service など) からデータを抽出する。
スキル 1.1.2: コスト、パフォーマンス、データ構造、データコンプライアンスに基づいて、ストレージに関する考慮事項を決定し、ストレージサービスを設定する。
スキル 1.1.3: 容量とスケーラビリティに関係するデータ取り込みとストレージの問題をトラブルシューティングおよびデバッグする。
スキル 1.1.4: AWS のストリーミングデータソース (Amazon Kinesis、Apache Flink、Apache Kafka など) を使用してデータを取り込む。
スキル 1.1.5: データアクセスパターンに基づいて適切なデータ形式 (Apache Parquet、JSON、CSV、ORC など) を使用し、データの取り込みと書き込みを行う。
スキル 1.1.6: 複数のソースからデータをマージする (プログラミング手法、AWS Glue、Apache Spark の使用などによる)。
スキル 1.1.7: 仕様に基づいて AI アプリケーション用にスケーラブルなベクトルデータベース (OpenSearch Service、pgvector を使用する Amazon RDS、Amazon S3 など) を設定する。
スキル 1.1.8: AI と ML のアプリケーションのために、さまざまなデータタイプ (テキスト、画像、音声など) を取り込んで保存する。
スキル 1.1.9: SageMaker Feature Store にデータを取り込む。
タスク 1.2: データ変換、特徴量エンジニアリング、前処理を実行する。
スキル 1.2.1: AWS ツール (AWS Glue、AWS Glue DataBrew、Amazon EMR での Spark、SageMaker Data Wrangler など) を使用してデータを変換する。
スキル 1.2.2: AWS ツール (SageMaker Feature Store など) を使用して特徴量を作成および管理する。
スキル 1.2.3: ストリーミングデータを変換する (AWS Lambda、Spark の使用などによる)。
スキル 1.2.4: 特徴量エンジニアリングを実行する (スケーリング、標準化、特徴量分割、ビニング、ログ変換、正規化など)。
スキル 1.2.5: 埋め込みモデルを設定し使用して、テキストデータと画像データを数値表現に変換する。
スキル 1.2.6: 高度なテキスト前処理手法 (トークン化、ドメイン固有の拡張など) を適用する。
スキル 1.2.7: 検索拡張生成 (RAG) アプリケーションのためのドキュメント (チャンキング戦略、メタデータ抽出など) を準備する。
スキル 1.2.8: データをマスキング、編集、匿名化する。
スキル 1.2.9: FM のファインチューニング、継続的な事前トレーニング、モデル蒸留を行うためのデータを準備する。
タスク 1.3: データ品質を検証し、バイアスを管理する。
スキル 1.3.1: データ品質を検証する (DataBrew、AWS Glue Data Quality の使用などによる)。
スキル 1.3.2: データにラベルと注釈を付ける。
スキル 1.3.3: AWS のツールや手法 (データセットの分割、シャッフル、拡張など) を使用して、データのバイアスのソースを特定して軽減する。
スキル 1.3.4: 数値アセット、テキストアセット、画像アセットにバイアスメトリクスを適用して、マルチモーダルなデータ分布を最適化する。
スキル 1.3.5: 数値データセット、テキストデータセット、画像データセットのクラス不均衡を解決する。
スキル 1.3.6: AI トレーニングデータの整合性を検証する (プロンプトと応答のペアの検証、コンテンツの安全性のスクリーニングなど)。
スキル 1.3.7: データクリーニングを行う (外れ値の検出、欠損データの補完、重複排除などによる)。