Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Scopri le opzioni per valutare modelli linguistici di grandi dimensioni con Clarify SageMaker
Importante
Per utilizzare SageMaker Clarify Foundation Model Evaluations, devi passare alla nuova esperienza di Studio. Al 30 novembre 2023, la precedente esperienza con Amazon SageMaker Studio è ora denominata Amazon SageMaker Studio Classic. La funzionalità di valutazione dei modelli di fondazione può essere utilizzata solo nell’esperienza aggiornata. Per informazioni su come aggiornare Studio, consulta Migrazione da Amazon SageMaker Studio Classic. Per informazioni sull’utilizzo dell’applicazione Studio Classic, consulta Amazon Studio Classic SageMaker.
Con Amazon SageMaker Clarify puoi valutare modelli linguistici di grandi dimensioni (LLM) creando processi di valutazione dei modelli. Un processo di valutazione dei modelli consente di valutare e confrontare le metriche di qualità e responsabilità dei modelli di base basati su testo provenienti da. JumpStart I lavori di valutazione dei modelli supportano anche l'uso di JumpStart modelli che sono già stati distribuiti su un endpoint.
Puoi creare un processo di valutazione del modello utilizzando tre approcci diversi.
-
Crea processi di valutazione automatica del modello in Studio: i processi di valutazione automatica del modello consentono di valutare rapidamente la capacità di un modello di eseguire un’attività. Puoi fornire il tuo set di dati dei prompt personalizzato che hai adattato a un caso d’uso specifico oppure puoi utilizzare un set di dati integrato disponibile.
-
Crea processi di valutazione del modello che utilizzano lavoratori umani in Studio: questi processi consentono di integrare il contributo umano nel processo di valutazione del modello. Questi possono essere dipendenti dell’azienda o un gruppo di soggetti esperti del settore.
-
Crea un processo di valutazione del modello automatizzato utilizzando la libreria
fmeval: la creazione di un processo confmevaloffre un controllo più granulare sui processi di valutazione del modello. Supporta inoltre l'uso di LLM esterni AWS o di modelli non JumpStart basati su altri servizi.
I processi di valutazione del modello supportano casi d’uso comuni per LLM come generazione di testo, classificazione del testo, domande e risposte e sintesi testuale.
-
Open-ended generazione — La produzione di risposte umane naturali a un testo che non ha una struttura predefinita.
-
Sintesi testuale: generazione di una sintesi concisa e condensata che conserva il significato e le informazioni chiave contenuti in un testo più esteso.
-
Risposta alle domande: generazione di una risposta pertinente e accurata a un prompt.
-
Classificazione: assegnazione di una categoria, ad esempio un’etichetta o un punteggio, al testo in base al suo contenuto.
Gli argomenti seguenti descrivono le attività di valutazione del modello disponibili e i tipi di metriche che è possibile utilizzare. Descrivono inoltre i set di dati integrati disponibili e come specificare il set di dati.