

# 内容领域 1： ML 和 AI 的数据准备
<a name="machine-learning-engineer-associate-02-domain1"></a>

**Topics**
+ [任务 1.1： 收集和存储数据。](#machine-learning-engineer-associate-02-domain1-task1)
+ [任务 1.2： 执行数据转换、特征工程和预处理。](#machine-learning-engineer-associate-02-domain1-task2)
+ [任务 1.3： 验证数据质量并管理偏差。](#machine-learning-engineer-associate-02-domain1-task3)

## 任务 1.1： 收集和存储数据。
<a name="machine-learning-engineer-associate-02-domain1-task1"></a>
+ 技能 1.1.1： 从数据来源（例如，Amazon S3、Amazon EBS、Amazon EFS、Amazon RDS、Amazon DynamoDB、Amazon OpenSearch Service）中提取数据。
+ 技能 1.1.2： 根据成本、性能、数据结构和数据合规性要求，制定存储决策并配置存储服务。
+ 技能 1.1.3： 针对涉及容量和可扩展性的数据摄取和存储问题，进行故障排除和调试。
+ 技能 1.1.4： 使用 AWS 流式数据来源来摄取数据（例如，使用 Amazon Kinesis、Apache Flink、Apache Kafka）。
+ 技能 1.1.5： 根据数据访问模式，使用合适的数据格式（例如，Apache Parquet、JSON、CSV、ORC）进行摄取和写入。
+ 技能 1.1.6： 合并多个来源中的数据（例如，使用编程技术、AWS Glue、Apache Spark）。
+ 技能 1.1.7： 根据技术规范，为 AI 应用程序（例如，OpenSearch Service、搭配 pgvector 的 Amazon RDS、Amazon S3）配置可扩展向量数据库。
+ 技能 1.1.8： 为 AI 和 ML 应用程序摄取和存储不同的数据类型（例如文本、图像、音频）。
+ 技能 1.1.9： 将数据摄取到 SageMaker Feature Store 中。

## 任务 1.2： 执行数据转换、特征工程和预处理。
<a name="machine-learning-engineer-associate-02-domain1-task2"></a>
+ 技能 1.2.1： 使用 AWS 工具（例如 AWS Glue、AWS Glue DataBrew、Amazon EMR 上的 Spark、SageMaker Data Wrangler）转换数据。
+ 技能 1.2.2： 使用 AWS 工具（例如 SageMaker Feature Store）创建和管理特征。
+ 技能 1.2.3： 转换流式传输数据（例如，使用 AWS Lambda、Spark）。
+ 技能 1.2.4： 执行特征工程（例如，扩展、标准化、特征拆分、分箱、对数变换、规范化）。
+ 技能 1.2.5： 配置和使用嵌入模型，将文本和图像数据转换为数字表示。
+ 技能 1.2.6： 应用高级文本预处理技术（例如，词元化、领域特定的增强）。
+ 技能 1.2.7： 为检索增强生成 (RAG) 应用程序准备文档（例如，分块策略、元数据提取）。
+ 技能 1.2.8： 掩蔽、编辑和匿名化数据。
+ 技能 1.2.9： 为 FM 微调、持续预训练和模型蒸馏准备数据。

## 任务 1.3： 验证数据质量并管理偏差。
<a name="machine-learning-engineer-associate-02-domain1-task3"></a>
+ 技能 1.3.1： 验证数据质量（例如，使用 DataBrew 和 AWS Glue 数据质量自动监测功能）。
+ 技能 1.3.2： 标记和注释数据。
+ 技能 1.3.3： 使用 AWS 工具和技术（例如数据集拆分、随机排列和扩充）识别数据中的偏差来源并采取缓解措施。
+ 技能 1.3.4： 通过对数字、文本和图像资产应用偏差指标，优化多模态数据分布。
+ 技能 1.3.5： 解决数字、文本和图像数据集中的类别不平衡。
+ 技能 1.3.6： 验证 AI 训练数据的完整性（例如，提示-响应对验证、内容安全筛选）。
+ 技能 1.3.7： 清理数据（例如，检测异常值、输入缺失数据、删除重复数据）。