View a markdown version of this page

가용성 변경 설명 - Amazon SageMaker AI

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

가용성 변경 설명

참고

Amazon SageMaker Clarify는 더 이상 신규 고객에게 공개되지 않습니다. 기존 고객은 서비스를 정상적으로 계속 사용할 수 있습니다. AWS Clarify의 보안 및 가용성 개선에 계속 투자하지만 새로운 기능을 도입할 계획은 없습니다.

AWS에서 게시한 모니터링 솔루션, 표준화된 편향 지표, SHAP 및 Amazon Bedrock 평가

AWS게시된 오픈 소스 SageMaker AI 모니터링 솔루션의 조합, 표준화된 편향 지표 Clarify 보고서의 기본 계산, SageMaker Clarify 자체가 구축된 SHAP 라이브러리, Amazon SageMaker AI MLflow, Amazon CloudWatch, Amazon QuickSightAmazon Bedrock Evaluations는 Amazon SageMaker Clarify를 대체하는 역할을 합니다. 이 지침은 다음을 제공합니다.

  • AWS에서 게시한 참조 솔루션이 기반입니다. aws-samples GitHub 조직의 오픈 소스 Amazon SageMaker AI 모니터링 솔루션은 전적으로 AWS 관리형 서비스(Amazon SageMaker AI, SageMaker AI MLflow, Amazon Athena, AWS Lambda, Amazon EventBridge, Amazon SQS, Amazon SNS, Amazon QuickSight)를 기반으로 구축된 프로덕션 테스트 참조 아키텍처입니다. 이들은 자체 AWS 계정 내에서 실행되며 임시 스크립트가 아닌 end-to-end 관리형 파이프라인의 일부로 편향 및 설명 가능성 분석을 운영합니다. 이는 SageMaker Model Monitor 마이그레이션 지침에 사용되는 것과 동일한 참조 솔루션입니다.

  • 편향 지표는 라이브러리 종속성이 아닌 표준화된 산술입니다. Clarify의 훈련 전 및 훈련 후 편향 지표(DPL, DPPL, DI, CI 및 관련 측정치)는 레이블 수 및 혼동 매트릭스 값에서 계산된 업계 표준 공식으로 게시됩니다. 자체 파이프라인 내에서 pandas 및 scikit-learn, 소유한 코드, 테스트 및 버전을 사용하여 복제합니다.

  • SHAP는 Clarify가 사용하는 것과 동일한 엔진입니다. SageMaker Clarify는 내부적으로 SHAP 라이브러리를 사용하여 특성 속성을 계산합니다(Clarfy SHAP 값 설명서 참조). SHAP를 채택하면 Shapley-value 속성이 직접 생성됩니다.

  • 파운데이션 모델 전용 Amazon Bedrock 평가. Amazon Bedrock Evaluations 및 Amazon Bedrock Guardrails는 LLM 및 생성형 AI 평가를 위한 AWS관리형 경로입니다. Clarify의 파운데이션 모델 평가(FMEval) 기능을 대체합니다. 예측(테이블형/클래식 ML) 편향 감지 또는 설명 가능성을 대체하지 않습니다.

Clarify 제거

새 분석을 위한 Clarify 처리 작업 중단

워크플로에 SageMakerClarifyProcessor 클래스, clarify.BiasConfig / clarify.SHAPConfig 구성 또는 SageMaker Python SDK의 run_bias() / run_explainability() 메서드를 사용하여 SageMaker Clarify 처리 작업 실행이 포함된 경우 아래 대체 구성 섹션에 설명된 대안으로 전환합니다.

Clarify 출력 아티팩트 삭제 또는 유지(선택 사항)

Clarify Processing Jobs는 출력 아티팩트를 Amazon S3에 저장합니다.

  • 편향 분석 보고서: analysis.json, 훈련 전 및 훈련 후 편향 지표 포함

  • SHAP 설명: 인스턴스별 로컬 SHAP 값이 explanations_shap/out.csv있는

  • 글로벌 SHAP 값: 집계된 기능 중요도 점수

  • 부분 종속성 플롯(PDPs): 특성 효과 시각화

  • 제약 조건 파일: 모델 모니터에서 바이어스 드리프트 및 기능 속성 드리프트 기준에 사용

규정 준수, 규제 감사 추적 또는 기록 참조를 위해 이를 보존해야 하는 경우 S3에 그대로 두거나 S3 Glacier에 보관합니다. 더 이상 필요하지 않은 경우 S3 접두사를 삭제합니다.

SageMaker Pipelines에서 Clarify 제거(사용된 경우)

Clarify를 호출하는 ClarifyCheckStep 또는 ProcessingStep 단계가 포함된 SageMaker Pipelines이 있는 경우 AWS, 게시된 참조 솔루션이 SageMaker Pipelines 내에서 사용하는 것과 동일한 패턴에 따라 표준화된 지표 계산 및 SHAP를 ProcessingStep 실행하는 로 바꿉니다(아래 대체 구성 참조).

대체 구성

대체 경로는 panda 및 scikit-learn을 사용하여 직접 표준화된 편향 지표를 계산하고 SHAP(Clarfy가 사용하는 것과 동일한 엔진)를 사용하여 특성 속성을 계산합니다. AWS게시된 참조 솔루션 및 SageMaker Pipelines 내에서 이를 실행하여 결과를 SageMaker AI MLflow 앱에 로깅하므로 편향 및 설명 가능성 결과에는 훈련 실행과 동일한 계보, 버전 관리 및 거버넌스가 포함됩니다.

훈련 전 및 훈련 후 편향 감지 교체

Clarify의 훈련 전 지표는 레이블 수와 클래스 비율을 기반으로 표준화된 공식으로 게시됩니다. 이를 직접 계산하면 편향 검사가 간단하고, 팀이 소유하고, 테스트할 수 있으며, 모니터링 작업 내에서 AWS게시된 참조 솔루션이 수행하는 작업과 일관성을 유지할 수 있습니다.

구현이 Clarify의 출력과 일치하도록 각 지표의 정확한 공식은 Clarify 훈련 전 편향 지표 참조를 참조하세요.

Clarify의 훈련 후 지표는 그룹별 혼동 매트릭스 수의 표준화된 함수입니다. 예측 및 실측 정보에서 직접 계산하면 검사가 간단하고 팀이 소유하며 편향 드리프트에 대해 AWS게시된 참조 솔루션이 사용하는 세그먼트별 접근 방식과 일치합니다. 거버넌스 및 추세 추적을 위해 세그먼트별 결과를 SageMaker AI MLflow 앱에 로깅합니다.

지표의 정확한 공식은 훈련 후 편향 지표 확인 참조를 참조하세요.

모델 설명 가능성 대체(SHAP 기능 속성)

SHAP 라이브러리는 SageMaker Clarify의 설명 가능성을 높이는 것과 동일한 엔진입니다. 이를 직접 사용하면 유연성을 높일 수 있습니다.

pip install shap

프로덕션 용도의 AWS경우 게시된 참조 솔루션에는 글로벌 기능 중요도, 개별 예측 설명 및 배포된 모델에 대한 기능 상호 작용 분석을 생성하는 6_shap_explainability.ipynb 노트북이 포함되어 SageMaker AI MLflow 앱에 결과를 로깅합니다.

API 참조는 SHAP 설명서를 참조하세요.

바이어스 드리프트 및 기능 속성 드리프트 모니터링 교체

이 접근 방식은 Amazon SageMaker AI 모니터링 솔루션을 사용하여 거버넌스, 계보 및 알림과 함께 일정에 따라 동일한 표준화된 지표(직접 계산된 공정성 지표 및 SHAP 기능 중요도)를 운영합니다. 모델 모니터 마이그레이션 지침에서 데이터 및 모델 품질 드리프트에 사용하는 것과 동일한 EventBridge + Lambda + Athena(Iceberg) + MLflow + SNS + QuickSight 패턴을 사용하므로 바이어스 드리프트 및 기능 속성 드리프트는 별도의 시스템이 아닌 동일한 거버넌스 파이프라인에서 추가 지표가 됩니다.

파운데이션 모델(LLM) 평가 교체

옵션 1: fmeval 라이브러리(SageMaker 호스팅 모델의 경우 권장)

fmeval 라이브러리는 Clarify의 파운데이션 모델 평가가 구축된 것과 동일한 평가 엔진이며 Clarify 처리 작업과 독립적으로 사용할 수 있습니다.

pip install fmeval

fmeval 라이브러리는 텍스트 요약, 질문 답변, 분류, 개방형 세대, 사실적 지식, 유해성, 견고성(시맨틱 교란), 프롬프트 고정 관념화 평가를 지원합니다. SageMaker 엔드포인트에 대한 지속적인 프로덕션 내 LLM 품질 모니터링을 위해 Grafana 참조 솔루션을 사용하여 AWS게시된 LLM 추론 모니터링 및 LLM 품질 관찰성은 Amazon Bedrock 모델을 사용하여 MLflow 생성형 AI 평가(안전, 관련성, 유창성, 지침, 일관성)를 실행합니다. https://github.com/aws-samples/sample-aiops-on-amazon-sagemakerai/tree/main/monitoring/quality-monitoring-with-grafana

자세한 단계는 Fmeval 라이브러리를 사용하여 자동 평가 실행 Amazon SageMaker 관리형 MLflow 및 FMEval을 사용하여 LLM 모델 평가 추적을 참조하세요.

옵션 2: Amazon Bedrock 평가(관리형 서비스)

Amazon Bedrock Evaluations는 명확한 처리 작업 없이 파운데이션 모델 평가를 위한 관리형 대안을 제공합니다.

  1. Amazon Bedrock 콘솔을 엽니다.

  2. 왼쪽 탐색에서 평가를 선택합니다.

  3. 평가 작업 생성을 선택합니다.

  4. 평가 유형 선택:

    • 자동 평가: 정확도, 견고성, 유해성에 대해 사전 정의된 알고리즘

    • 인적 평가: 주관적 품질 평가를 위해 인적 작업자 가져오기

  5. 평가할 모델(JumpStart 모델, Bedrock 모델 또는 사용자 지정 엔드포인트)을 선택합니다.

  6. 기본 제공 데이터 세트를 선택하거나 사용자 지정 프롬프트 데이터 세트를 업로드합니다.

  7. 모델 간 비교 지표를 사용하여 평가 결과를 검토합니다.

Bedrock Evaluations는 필요한 형식으로 평가 데이터를 제공하는 한 Bedrock에서 호스팅되는 모델, 사용자 지정 모델 및 외부 모델(온프레미스 또는 멀티 클라우드 배포 포함) 평가를 지원합니다.

자세한 단계는 Amazon Bedrock 리소스의 성능 평가 및 Amazon Bedrock 평가를 사용하여 모델 또는 RAG 시스템 평가를 참조하세요.

옵션 3: Amazon Bedrock 가드레일(런타임 안전)

평가 시 SageMaker Clarify가 평가하는 런타임 콘텐츠 필터링(독성, PII, 유해 콘텐츠)의 경우 Amazon Bedrock Guardrails는 생성형 AI 애플리케이션에 대한 지속적인 런타임 보호를 제공합니다.

  • 콘텐츠 필터: 유해, 증오, 성적, 폭력적 또는 모욕적인 콘텐츠 차단

  • 거부된 주제: 특정 주제에 대한 모델 응답 방지

  • 민감한 정보 필터: PII(이름, 주소, SSN, 신용 카드) 감지 및 수정

  • 컨텍스트 근거 검사: 소스 데이터에 응답을 근거함으로써 할루시네이션 감소

  • 자동 추론 검사: 공식 추론을 사용하여 사실적 정확성 검증

자세한 단계는 Amazon Bedrock Guardrails를 사용하여 유해한 콘텐츠 감지 및 필터링을 참조하세요.