Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Livello 2: set approvato di modelli e strumenti di base
Man mano che le organizzazioni attraversano le prime fasi dell'adozione dell'IA generativa, si rendono presto conto che nessun modello singolo è in grado di affrontare tutti i casi d'uso in modo efficace. Modelli diversi eccellono in vari domini e attività e le aziende devono bilanciare capacità, costi e prestazioni per ogni applicazione specifica. Questa realtà determina la necessità di un approccio flessibile ma controllato all'accesso al modello di base.
Questa sezione contiene i seguenti argomenti:
Sperimentazione e personalizzazione dei modelli
Amazon Bedrock è progettato per aiutarti a sperimentare vari modelli di base e supporta implementazioni di produzione scalabili. Con Amazon Bedrock Knowledge Bases, hai una soluzione completamente gestita per creare flussi di lavoro end-to-end Retrieval Augmented Generation (RAG). Amazon Bedrock supporta anche agenti gestiti in grado di eseguire attività complesse senza codice, dalla prenotazione dei viaggi alla gestione dell'inventario. Poiché è serverless, Amazon Bedrock riduce i problemi di gestione dell'infrastruttura e si integra in modo sicuro con altri. Servizi AWS
Inoltre, puoi utilizzare Amazon Bedrock per personalizzare privatamente i modelli di base con i tuoi dati proprietari e renderli disponibili in modo sicuro agli utenti all'interno della tua organizzazione. Per ulteriori informazioni, consulta Personalizza il tuo modello per migliorarne le prestazioni per il tuo caso d'uso nella documentazione di Amazon Bedrock. Per la gestione degli accessi, AWS Identity and Access Management (IAM) si integra con Amazon Bedrock in modo da poter configurare un controllo granulare degli accessi. I controlli determinano quali utenti possono abilitare e accedere a modelli specifici. Per ulteriori informazioni sul tagging, consulta Livello 3: sicurezza e governance per piattaforme di intelligenza artificiale generativa su AWSin questa guida.
Valutazione del modello
Man mano che l'organizzazione passa dai prototipi di intelligenza artificiale generativa alla produzione, è essenziale stabilire processi di valutazione rigorosi per i modelli di base. Sebbene i benchmark aperti offrano informazioni generali sulle prestazioni del modello, spesso non riescono a determinare l'idoneità di un modello per esigenze aziendali specifiche. Le strategie di valutazione personalizzate aiutano gli utenti a selezionare il modello più appropriato in linea con i requisiti unici dell'organizzazione.
Obiettivi della valutazione del modello personalizzato
Un approccio di valutazione personalizzato aiuta le organizzazioni a fare quanto segue:
-
Valuta le prestazioni relative alle attività rilevanti per l'azienda: valuta in che modo i modelli gestiscono le attività direttamente correlate ai casi d'uso aziendali.
-
Identifica potenziali pregiudizi e limitazioni: individua le aree in cui i modelli potrebbero presentare pregiudizi o fallire in modo da assicurarti che il modello sia adatto all'implementazione nel mondo reale.
-
Confronta i modelli con le metriche pertinenti: confronta diversi modelli utilizzando metriche che allineano le priorità e gli obiettivi della tua organizzazione.
-
Effettua una selezione informata dei modelli: prendi decisioni basate sui dati sulla selezione dei modelli, la messa a punto e l'implementazione negli ambienti di produzione.
Scelta delle metriche di valutazione del modello
Una valutazione efficace del modello si basa su un mix di tecniche che forniscono una visione olistica delle prestazioni del modello. Con queste tecniche, le organizzazioni possono valutare non solo l'accuratezza tecnica di un modello, ma anche il suo allineamento alle esigenze specifiche dell'azienda. Per valutare un modello, si combinano metriche quantitative e qualitative per determinare le prestazioni, identificare i pregiudizi e scegliere un modello. Le organizzazioni dovrebbero utilizzare sia metriche basate sulla verità (con dati di riferimento) sia metriche flessibili (senza dati di riferimento) per ottenere una visione completa dell'idoneità del modello. Nell'intelligenza artificiale, la verità fondamentale si riferisce a dati reali che vengono omessi durante l'addestramento del modello in modo da poterli utilizzare per la valutazione del modello.
Utilizza metriche di base basate sulla verità se esistono dati di riferimento. Queste metriche forniscono valutazioni quantitative concrete. Nel frattempo, le tecniche prive di fondamento possono offrire flessibilità. Queste tecniche consentono di valutare i modelli in termini di leggibilità e completezza, anche quando non sono disponibili risposte corrette predefinite.
Metriche basate su dati fondati
Se sono disponibili dati di riferimento, metriche basate sulla verità possono fornire valutazioni quantitative. Le seguenti metriche forniscono valutazioni quantitative delle prestazioni:
-
Punteggio ROUGE-L — Understudy for Longest Common Substudy for Longest Common Sequence (ROUGE) orientato al richiamo, noto anche come ROUGE-L, misura la sottosequenza comune più lunga tra i testi generati e quelli di riferimento. La metrica valuta la coerenza e la sovrapposizione dei contenuti.
-
Somiglianza del coseno: questa metrica valuta la somiglianza semantica tra i testi. Fornisce informazioni sulla comprensione contestuale del modello.
-
Punteggio METEOR: la metrica per la valutazione della traduzione con ordinamento esplicito (METEOR) combina l'allineamento delle parole e la corrispondenza semantica per fornire una valutazione equilibrata dell'accuratezza e del significato dei contenuti.
-
Somiglianza binaria: questa metrica verifica le corrispondenze esatte, rendendola particolarmente utile per le attività che richiedono risultati precisi, come la generazione di comandi.
-
LLM-as-a-judge punteggio: questa metrica utilizza un altro modello linguistico di grandi dimensioni (LLM) per valutare la somiglianza su una scala definita. Offre una valutazione dettagliata della qualità.
Amazon SageMaker Clarify e Amazon Bedrock includono funzionalità per aiutarti a valutare i modelli. Possono automatizzare i processi di valutazione dei modelli in modo da poter quantificare i rischi del modello e la qualità delle risposte. Per ulteriori informazioni, consulta Valutare, spiegare e rilevare distorsioni nei modelli e Valutare le prestazioni delle risorse Amazon Bedrock.
Metriche senza dati fondati
Quando i dati di riferimento non sono disponibili o come approccio complementare, puoi utilizzare la LLM-as-a-judge tecnica. Utilizza un modello separato per valutare i risultati di una soluzione di intelligenza artificiale generativa in base a dimensioni importanti per l'azienda. Questa tecnica offre la flessibilità necessaria per valutare varie qualità del modello. Per ulteriori informazioni, consulta Valutare le prestazioni del modello utilizzando un altro LLM come giudice nella documentazione di Amazon Bedrock.
Puoi utilizzare parametri calcolati per valutare l’efficacia con cui un sistema di generazione potenziata da recupero dati (RAG) ottiene le informazioni pertinenti dalle origini dati e l’efficacia delle risposte generate nel rispondere alle domande. I risultati di una valutazione RAG consentono di confrontare diverse Knowledge Base per Amazon Bedrock e altre origini RAG e quindi di scegliere la Knowledge Base o il sistema RAG più adatto alla tua applicazione. Per ulteriori informazioni, consulta Valutare le prestazioni delle sorgenti RAG nella documentazione di Amazon Bedrock.
Tecniche di valutazione dei modelli in pratica
Per abbinare efficacemente le esigenze aziendali alle funzionalità del modello, utilizzate un solido set di criteri di valutazione per indirizzare il processo di valutazione del modello. Questi criteri coprono una serie di priorità, dalla correttezza e completezza alla fattualità e alla gestione dei dati sensibili. Ogni criterio si allinea a tecniche specifiche per fornire informazioni fruibili. Ad esempio, quando l'accuratezza dei fatti è fondamentale, metriche come il punteggio ROUGE-L o la somiglianza del coseno forniscono parametri di riferimento concreti e quantificabili. Al contrario, utilizzate tecniche come la valutazione della leggibilità e della freschezza. LLM-as-a-judge Queste tecniche offrono approfondimenti flessibili e qualitativi adattati agli standard organizzativi. Le dimensioni chiave per la valutazione dei modelli includono:
-
Correttezza: convalida l'accuratezza delle informazioni fornite
-
Completezza: verifica la profondità e la copertura delle risposte
-
Leggibilità: valuta la chiarezza e la facilità di comprensione
-
Freschezza delle informazioni: verifica che i contenuti siano pertinenti e aggiornati
-
Soppressione dei dati sensibili: verifica la corretta gestione delle informazioni riservate
-
Precisione: misura l'allineamento con le informazioni fattuali
-
Coerenza: esamina il flusso logico e la coerenza
-
Fattualità: verifica la veridicità del contenuto
-
Completezza: valuta la portata e la completezza della copertura
Ancorando le tecniche di valutazione dei modelli a questi criteri chiari, è possibile esaminare a fondo i modelli per i loro scopi specifici. Questo approccio strutturato allinea i modelli agli obiettivi aziendali, ai requisiti di conformità e alle aspettative degli utenti. Inoltre, pone una solida base per l'implementazione di applicazioni di intelligenza artificiale generativa su larga scala negli ambienti di produzione.
Consigli di implementazione
Per stabilire una strategia modello di base efficace, prendi in considerazione le seguenti raccomandazioni:
-
Formate un comitato di governance modello con ruoli, responsabilità e processi decisionali chiari.
-
Sviluppa criteri di valutazione e meccanismi di punteggio per la valutazione dei modelli di base prima che siano disponibili per l'uso in tutta l'organizzazione.
-
Ricorda che il modello di base più grande non è necessariamente sempre il modello migliore per il tuo caso d'uso. Iniziate proof-of-concept lo sviluppo con modelli di alto livello per convalidare il valore aziendale, quindi valutate sistematicamente i modelli più piccoli per l'ottimizzazione dei costi.
-
Sviluppa dashboard per tenere traccia delle metriche chiave, come la latenza dell'inferenza, la velocità effettiva, i tassi di errore e il costo per inferenza.
-
Fornisci indicazioni chiare ai team su come selezionare il modello giusto per il loro caso d'uso, compresi i processi di sperimentazione e i criteri di valutazione.