View a markdown version of this page

콘텐츠 도메인 1: ML 및 AI를 위한 데이터 준비 - AWS Certified Machine Learning Engineer - Associate

콘텐츠 도메인 1: ML 및 AI를 위한 데이터 준비

작업 1.1: 데이터를 수집하고 저장합니다.

  • 기술 1.1.1: 데이터 소스(예: Amazon S3, Amazon EBS, Amazon EFS, Amazon RDS, Amazon DynamoDB, Amazon OpenSearch Service) 에서 데이터를 추출합니다.

  • 기술 1.1.2: 비용, 성능, 데이터 구조 및 데이터 규정 준수를 기반으로 스토리지 결정을 내리고 스토리지 서비스를 구성합니다.

  • 기술 1.1.3: 용량 및 확장성과 관련된 데이터 수집 및 저장 문제를 해결하고 디버깅합니다.

  • 기술 1.1.4: AWS 스트리밍 데이터 소스를 사용하여 데이터를 수집합니다(예: Amazon Kinesis, Apache Flink, Apache Kafka).

  • 기술 1.1.5: 데이터 액세스 패턴을 기반으로 적절한 데이터 형식(예: Apache Parquet, JSON, CSV, ORC)을 사용하여 데이터를 수집하고 씁니다.

  • 기술 1.1.6: 여러 소스의 데이터를 병합합니다(예: 프로그래밍 기법, AWS Glue, Apache Spark 사용).

  • 기술 1.1.7: 사양에 따라 AI 애플리케이션을 위한 확장 가능한 벡터 데이터베이스를 구성합니다(예: OpenSearch Service, pgvector 기반 Amazon RDS, Amazon S3).

  • 기술 1.1.8: AI 및 ML 애플리케이션을 위한 다양한 데이터 유형을 수집하고 저장합니다(예: 텍스트, 이미지, 오디오).

  • 기술 1.1.9: SageMaker Feature Store에 데이터를 수집합니다.

작업 1.2: 데이터 변환, 특성 추출 및 사전 처리를 수행합니다.

  • 기술 1.2.1: AWS 도구를 사용하여 데이터를 변환합니다(예: AWS Glue, AWS Glue DataBrew, Spark on Amazon EMR, SageMaker Data Wrangler).

  • 기술 1.2.2: AWS 도구를 사용하여 특성을 만들고 관리합니다(예: SageMaker Feature Store).

  • 기술 1.2.3: 스트리밍 데이터를 변환합니다(예: AWS Lambda, Spark 사용).

  • 기술 1.2.4: 특성 추출을 수행합니다(예: 스케일링, 표준화, 특성 분할, 비닝, 로그 변환, 정규화).

  • 기술 1.2.5: 임베딩 모델을 구성하고 사용하여 텍스트 및 이미지 데이터를 수치 표현으로 변환합니다.

  • 기술 1.2.6: 고급 텍스트 사전 처리 기법을 적용합니다(예: 토큰화, 도메인별 증강).

  • 기술 1.2.7: 검색 증강 생성(RAG) 애플리케이션에 사용할 문서를 준비합니다(예: 청킹 전략, 메타데이터 추출).

  • 기술 1.2.8: 데이터를 마스킹, 편집 및 익명화합니다.

  • 기술 1.2.9: FM 미세 조정, 지속적인 사전 훈련 및 모델 증류를 위한 데이터를 준비합니다.

작업 1.3: 데이터 품질을 검증하고 편향을 관리합니다.

  • 기술 1.3.1: 데이터 품질 유효성을 검사합니다(예: DataBrew 및 AWS Glue Data Quality 사용).

  • 기술 1.3.2: 데이터에 레이블을 지정하고 주석을 답니다.

  • 기술 1.3.3: AWS 도구와 기법(예: 데이터세트 분할, 셔플링, 증강)을 사용하여 데이터의 편향 원인을 파악하고 문제를 완화합니다.

  • 기술 1.3.4: 숫자, 텍스트 및 이미지 자산에 편향 지표를 적용하여 멀티모드 데이터 배포를 최적화합니다.

  • 기술 1.3.5: 숫자, 텍스트, 이미지 데이터세트의 클래스 불균형을 해결합니다.

  • 기술 1.3.6: AI 학습 데이터 무결성을 검증합니다(예: 프롬프트-응답 쌍 검증, 콘텐츠 안전 검사).

  • 기술 1.3.7: 데이터를 정리합니다(예: 이상값 감지, 누락된 데이터 입력, 중복 제거).