View a markdown version of this page

内容领域 1: ML 和 AI 的数据准备 - AWS Certified Machine Learning Engineer - Associate

内容领域 1: ML 和 AI 的数据准备

任务 1.1: 收集和存储数据。

  • 技能 1.1.1: 从数据来源(例如,Amazon S3、Amazon EBS、Amazon EFS、Amazon RDS、Amazon DynamoDB、Amazon OpenSearch Service)中提取数据。

  • 技能 1.1.2: 根据成本、性能、数据结构和数据合规性要求,制定存储决策并配置存储服务。

  • 技能 1.1.3: 针对涉及容量和可扩展性的数据摄取和存储问题,进行故障排除和调试。

  • 技能 1.1.4: 使用 AWS 流式数据来源来摄取数据(例如,使用 Amazon Kinesis、Apache Flink、Apache Kafka)。

  • 技能 1.1.5: 根据数据访问模式,使用合适的数据格式(例如,Apache Parquet、JSON、CSV、ORC)进行摄取和写入。

  • 技能 1.1.6: 合并多个来源中的数据(例如,使用编程技术、AWS Glue、Apache Spark)。

  • 技能 1.1.7: 根据技术规范,为 AI 应用程序(例如,OpenSearch Service、搭配 pgvector 的 Amazon RDS、Amazon S3)配置可扩展向量数据库。

  • 技能 1.1.8: 为 AI 和 ML 应用程序摄取和存储不同的数据类型(例如文本、图像、音频)。

  • 技能 1.1.9: 将数据摄取到 SageMaker Feature Store 中。

任务 1.2: 执行数据转换、特征工程和预处理。

  • 技能 1.2.1: 使用 AWS 工具(例如 AWS Glue、AWS Glue DataBrew、Amazon EMR 上的 Spark、SageMaker Data Wrangler)转换数据。

  • 技能 1.2.2: 使用 AWS 工具(例如 SageMaker Feature Store)创建和管理特征。

  • 技能 1.2.3: 转换流式传输数据(例如,使用 AWS Lambda、Spark)。

  • 技能 1.2.4: 执行特征工程(例如,扩展、标准化、特征拆分、分箱、对数变换、规范化)。

  • 技能 1.2.5: 配置和使用嵌入模型,将文本和图像数据转换为数字表示。

  • 技能 1.2.6: 应用高级文本预处理技术(例如,词元化、领域特定的增强)。

  • 技能 1.2.7: 为检索增强生成 (RAG) 应用程序准备文档(例如,分块策略、元数据提取)。

  • 技能 1.2.8: 掩蔽、编辑和匿名化数据。

  • 技能 1.2.9: 为 FM 微调、持续预训练和模型蒸馏准备数据。

任务 1.3: 验证数据质量并管理偏差。

  • 技能 1.3.1: 验证数据质量(例如,使用 DataBrew 和 AWS Glue 数据质量自动监测功能)。

  • 技能 1.3.2: 标记和注释数据。

  • 技能 1.3.3: 使用 AWS 工具和技术(例如数据集拆分、随机排列和扩充)识别数据中的偏差来源并采取缓解措施。

  • 技能 1.3.4: 通过对数字、文本和图像资产应用偏差指标,优化多模态数据分布。

  • 技能 1.3.5: 解决数字、文本和图像数据集中的类别不平衡。

  • 技能 1.3.6: 验证 AI 训练数据的完整性(例如,提示-响应对验证、内容安全筛选)。

  • 技能 1.3.7: 清理数据(例如,检测异常值、输入缺失数据、删除重复数据)。