View a markdown version of this page

Suite Pre-Training et Mid-Training - Amazon Nova

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Suite Pre-Training et Mid-Training

Note

Une documentation détaillée est fournie une fois inscrit

Nova Forge CPT offre des fonctionnalités avancées allant au-delà du CPT standard, notamment l'accès à des points de contrôle intermédiaires et le mélange de données avec le corpus de pré-entraînement de Nova. Ces fonctionnalités permettent une adaptation de domaine plus efficace et une meilleure préservation des capacités générales du modèle.

Que sont les points de contrôle intermédiaires et pourquoi sont-ils nécessaires ?

Les points de contrôle intermédiaires sont des instantanés du modèle Amazon Nova enregistrés à différentes étapes de la pré-formation, avant que le modèle n'atteigne son état final de mise en production. Au cours du développement du modèle, Amazon Nova est soumise à plusieurs phases de formation : pré-formation initiale avec un taux d'apprentissage constant, réduction du taux d'apprentissage, formation par extension du contexte, et enfin formation à l'alignement et à la sécurité après les instructions. Pour le CPT, les points de contrôle intermédiaires sont souvent préférables au point de contrôle final de Prod car ils sont plus plastiques et plus réceptifs à l'adaptation du domaine. Le point de contrôle Prod a fait l'objet d'une formation approfondie en matière d'alignement et de sécurité, qui optimise le modèle pour une utilisation conversationnelle générale, mais peut le rendre résistant à l'apprentissage de nouveaux modèles spécifiques à un domaine pendant le CPT. En revanche, les points de contrôle contenant uniquement du texte partiellement et entièrement préentraîné conservent les caractéristiques de pré-apprentissage du modèle. Ils n'ont pas été fortement orientés vers des comportements spécifiques, ce qui en fait des points de départ plus efficaces pour l'adaptation au domaine. Lors de l'exécution d'un CPT à grande échelle (> 10 milliards de jetons), le fait de partir de points de contrôle intermédiaires entraîne généralement une convergence plus rapide, une meilleure stabilité de l'entraînement et une acquisition de connaissances dans le domaine plus efficace. Cependant, pour les CPT à petite échelle (jetons <10 B), ou lorsque les capacités de suivi des instructions doivent être préservées, le point de contrôle Prod peut être plus approprié car il permet l'adaptation du domaine tout en conservant les capacités conversationnelles du modèle.

Plusieurs points de contrôle intermédiaires sont nécessaires pour le CPT car ils offrent différents niveaux de plasticité du modèle qui influent sur l'efficacité avec laquelle le modèle peut absorber de nouvelles connaissances dans le domaine. Le point de contrôle final de Prod a fait l'objet d'une formation approfondie en matière d'alignement et de sécurité, qui l'optimise pour une utilisation conversationnelle générale mais le rend résistant à l'apprentissage de nouveaux modèles spécifiques au domaine. En d'autres termes, il a été renforcé après la formation. En revanche, les points de contrôle antérieurs conservent les caractéristiques de pré-entraînement du modèle et n'ont pas été fortement orientés vers des comportements spécifiques, ce qui les rend plus plastiques et plus réceptifs à l'adaptation au domaine.

Pour optimiser l'efficacité de l'entraînement, plusieurs points de contrôle intermédiaires sont prévus.

Quels sont les points de contrôle disponibles ?

Nouveau 1.0

La famille Amazon Nova 1.0 comprend trois modèles (Micro, Lite, Pro) et trois points de contrôle sont disponibles pour chaque modèle.

  • PRE-TRAINED - [nova-<micro/lite/pro>/pretraining-text-partial] : Il s'agit du point de contrôle après la phase à taux d'apprentissage constant de la pré-formation d'Amazon Nova, au cours de laquelle le modèle est entraîné sur des milliards de jetons de texte.

  • MID-TRAINED - [nova-<micro/lite/pro>/pretraining-text-full] : Il s'agit du point de contrôle réservé au texte une fois que toutes les étapes de la pré-formation et de la mi-formation d'Amazon Nova avec des milliards de jetons de texte sont terminées. Utilisez-les si le modèle en particulier ne devrait pas avoir détecté de données multimodales.

  • MID-TRAINED - [nova-<lite/pro>/pretraining-mm-full] : Il s'agit du point de contrôle après le traitement de toutes les étapes de la pré-formation et de la mi-formation d'Amazon Nova, y compris les données multimodales, avec des milliards de jetons.

  • POST-TRAINED - [nova-<micro/lite/pro>/prod] : Il s'agit du point de contrôle final entièrement aligné du modèle qui a franchi toutes les étapes avant et après la formation.

Nouveau 2.0

Il existe trois points de contrôle Amazon Nova Lite 2.0.

  • PRE-TRAINED - [nova-lite-2/pretraining-text-RD] : Il s'agit du point de contrôle après le taux d'apprentissage constant et les étapes de réduction de la pré-formation d'Amazon Nova, au cours desquelles le modèle est entraîné sur des milliards de jetons.

  • MID-TRAINED - [nova-lite-2/pretraining-text-CE] : Ce point de contrôle permet d'introduire des volumes intermédiaires de données non structurées avec un taux d'apprentissage plus modéré qu'avant la formation, en absorbant les connaissances spécifiques au domaine tout en évitant un oubli catastrophique.

  • POST-TRAINED - [nova-lite-2/prod] : Il s'agit du point de contrôle final entièrement aligné du modèle qui a suivi toutes les étapes correspondantes et post-formation.

Le tableau suivant détaille les différentes conditions de pré-entraînement et de mi-formation.

Type de données

Exécuter

Avec Checkpoint

Large-scale données de domaine brutes non structurées (documents, journaux, articles, code, etc.)

Suite Pre-Training

Pre-Trained

Large-scale données de domaine brutes non structurées (documents, journaux, articles, code, etc.)

Mid-Training

Pre-Trained

Petits volumes de données brutes non structurées. Traces de raisonnement structurées/données CoT

Mid-Training

Mid-Trained

Démonstrations structurées (paires d'entrées-sorties de haute qualité, instructions de tâches organisées, dialogues à plusieurs tours)

Complet Fine-Tuning

Mid-Trained

Démonstrations structurées (paires d'entrées-sorties de haute qualité, instructions de tâches organisées, dialogues à plusieurs tours)

Paramètre efficace Fine-Tuning

Post-Trained

Quel point de contrôle utiliser ?

Les points de contrôle contenant uniquement du texte partiellement pré-entraîné et du texte uniquement entièrement pré-entraîné convergent généralement plus rapidement et nécessitent moins d'étapes de formation pour l'adaptation du domaine. Cependant, ils n'ont aucun réglage des instructions et devraient suivre des étapes après la formation pour être en mesure d'effectuer des tâches utiles et de suivre les instructions. Le point de contrôle GA peut nécessiter des étapes d'adaptation supplémentaires, mais il constitue un point de départ plus sûr pour les expériences à petite échelle et conservera certaines de ses capacités après la formation, même après la formation au CPT.

En général, avec de grands ensembles de données d'entraînement (>10 B de jetons), commencez par des points de contrôle avec du texte partiellement pré-entraîné uniquement ou avec du texte entièrement pré-entraîné uniquement pour un entraînement plus efficace et plus stable, car la base de connaissances du modèle sera considérablement modifiée. Avec de petits ensembles de données (<10 B jetons), utilisez le point de contrôle GA pour préserver les capacités de suivi des instructions tout en vous adaptant au domaine.

Comment utiliser le mixage des données pour les modèles 1.0 ou 2.0 ?

Lorsque vous effectuez un CPT avec de nouvelles données de domaine, il est très avantageux de mélanger les nouvelles données avec certaines des données utilisées précédemment lors de la phase de pré-apprentissage du modèle. Le mélange d'anciennes données avec de nouvelles données de domaine permet de résoudre deux problèmes :

  • Oublier le contrôle : prévient l'oubli catastrophique en préservant les compétences et les connaissances existantes du modèle. Sans mélange de données, l'entraînement exclusivement sur des données de domaine restreint entraîne le remplacement des fonctionnalités générales par le modèle. Par exemple, un modèle formé uniquement à partir de documents juridiques peut perdre sa capacité à coder ou à faire des calculs. Le mélange des ensembles de données du domaine général préserve ces compétences générales lors de l'acquisition du nouveau domaine.

  • Stabilité d'optimisation : maintient la stabilité de l'entraînement en ancrant les représentations internes du modèle. Au cours du CPT, les caractéristiques apprises du modèle sont modifiées et le mélange des données fournit des gradients provenant de diverses sources qui guident cette adaptation en douceur. Sans cela, l'entraînement sur des distributions étroites peut provoquer une instabilité du gradient, entraînant une modification trop radicale des représentations du modèle, entraînant une divergence d'entraînement, des pics de pertes ou un effondrement des capacités existantes. Il s'agit du compromis entre stabilité et plasticité : le modèle doit être suffisamment plastique pour permettre d'acquérir de nouvelles connaissances dans le domaine, mais suffisamment stable pour ne pas briser ce qu'il connaît déjà.

Capacités de mixage de données Nova CPT

L'accès aux données de pré-formation et aux points de contrôle d'Amazon Nova est l'une des principales offres de la personnalisation d'Amazon Nova CPT. La personnalisation d'Amazon Nova CPT permet de mélanger facilement les données de domaine avec le corpus de pré-formation d'Amazon Nova. En outre, le ratio d'échantillonnage des catégories de données Amazon Nova spécifiques (code, mathématiques, raisonnement, etc.) peut être modifié et leurs proportions contrôlées pour compléter les données du domaine. Cela permet de renforcer les fonctionnalités qui correspondent au cas d'utilisation tout en adaptant le modèle au domaine spécifique.

Trouver le rapport de mélange optimal

Le ratio optimal entre les données Amazon Nova et les données de domaine dépend du domaine de l'ensemble de données, de sa complexité, de sa taille, de sa qualité et de l'importance de conserver les fonctionnalités générales. Ce ratio doit être découvert par l'expérimentation. Un cadre expérimental permettant de décider de la quantité de données Amazon Nova à mélanger est le suivant.

Sélectionnez un sous-ensemble représentatif de données de domaine (par exemple, des jetons 5B) et maintenez cette constante pour tous les essais expérimentaux.

Réalisez des expériences CPT à petite échelle en faisant varier uniquement la quantité de données Amazon Nova mélangées :

  • Pas de mixage : domaine 100 % → domaine 5B uniquement (total 5B)

  • Mélange de lumière : domaine 90 % → domaine 5B + ~0,56 B Amazon Nova (total ~5,56 B)

  • Mélange moyen : domaine 70 % → domaine 5B + ~2,14 B Amazon Nova (total ~7,14 B)

  • Mixage intensif : domaine 50 % → domaine 5B + Amazon Nova 5B (total 10B)

Évaluez chaque point de contrôle sur les benchmarks internes et généraux du domaine. Évaluez également le point de départ (point de contrôle Amazon Nova avant tout entraînement).

  • Les performances du domaine client restent-elles à peu près constantes d'une série à l'autre ? Cela devrait généralement être le cas, car chaque exécution a vu le même nombre de jetons de domaine. Si les performances du domaine s'améliorent avec davantage de mixage, les données Amazon Nova fournissent une régularisation utile.

  • Les scores de référence généraux s'améliorent-ils à mesure que le mixage augmente ?

    • Le comportement attendu est que les fonctionnalités générales devraient s'améliorer de façon monotone à mesure que de nouvelles données Amazon Nova sont ajoutées.

    • Mesurez plusieurs repères généraux : MMLU (connaissances générales), HumanEval (codage), GSM8K (mathématiques) ou des repères spécifiques qui vous intéressent.

  • Sélectionnez le ratio de mélange qui préserve les performances du domaine tout en offrant des fonctionnalités générales acceptables pour les cas d'utilisation. Tenez compte du coût supplémentaire de la formation en mélangeant davantage les données.

Une fois que le rapport de mélange optimal a été identifié, exécutez le CPT à grande échelle en utilisant l'ensemble de données du domaine complet avec le rapport de mélange sélectionné.

Dissection des catégories de mixage de données

Ci-dessous, nous analysons chaque catégorie disponible dans Data Mixing, afin que vous puissiez prendre la meilleure décision quant aux catégories de données qu'il est le plus logique de représenter dans votre combinaison de données globale.

Comment activer le mixage des données

Ajoutez la data_mixing section à votre recette avec la distribution en pourcentage appropriée entre les catégories de jeux de données. La somme des nova_data pourcentages doit être égale à 100.

Configuration Nova 1.0 avec mixage de données

run: name: "cpt-job-name" # A descriptive name for your training job model_type: "amazon.nova-lite-v1:0:300k" # Model variant specification, do not change model_name_or_path: "nova-lite/prod" replicas: 4 data_s3_path: "s3://path/to/data/xyz.jsonl" output_s3_path: "s3://path/to/output/checkpoint" skip_recipe_validation: true training_config: max_length: 32768 global_batch_size: 64 trainer: max_steps: 5000 model: hidden_dropout: 0.1 attention_dropout: 0.1 ffn_dropout: 0.1 optim: lr: 1.5e-05 name: distributed_fused_adam adam_w_mode: true eps: 1.0e-06 weight_decay: 0.05 betas: - 0.9 - 0.999 sched: warmup_steps: 500 constant_steps: 0 min_lr: 1.5e-06 data_mixing: dataset_catalog: cpt_text_lite sources: nova_data: en-entertainment: 0.11% en-factual: 4.83% en-legal: 0.48% en-long-form-text: 6.26% en-mined: 16.79% en-other: 1.79% en-scientific: 10.53% en-social: 12.43% en-techqa: 13.95% code: 7.50% high-util-lang: 8.05% low-util-lang: 6.51% math: 8.76% en-finance: 1% tables: 1% customer_data: percent: 90

Que signifient ces catégories

Nom de la catégorie Détail de l'information
en-entertainment Contenu multimédia et de divertissement, y compris des transcriptions vidéo, des dialogues de jeux et des discussions axées sur le divertissement.
en-factual Le matériel de référence, le contenu encyclopédique, les ressources pédagogiques et la documentation factuelle étaient axés sur la transmission d'informations précises.
en-finance Textes financiers, y compris des rapports de marché, des analyses économiques, des stratégies d'investissement, des articles d'actualité financière, des rapports sur les bénéfices et d'autres contenus liés à la finance qui aident le modèle à comprendre les concepts économiques et la terminologie financière.
en-legal Documents juridiques, procédures judiciaires, contrats, lois, règlements et textes d'analyse juridique.
en-long-form-text Écrits étendus, y compris des livres, des articles universitaires, de longs articles et d'autres documents textuels importants.
en-mined Données textuelles extraites de diverses sources Web, y compris des forums, des commentaires, des discussions et du contenu Web général, puis réécrites pour garantir des performances de formation élevées.
en-other Contenu divers en langue anglaise qui ne correspond pas clairement aux autres catégories.
en-scientific Articles scientifiques, documents de recherche, rapports techniques et discussions scientifiques dans divers domaines.
en-social Publications sur les réseaux sociaux, conversations, discussions et autres formes de communication sociale.
en-techqa Documentation technique, guides d'utilisation, pages FAQ, forums techniques et contenu Q lié à la technologie.
code Code source de programmation, documentation et discussions techniques à partir de divers langages de programmation et plateformes.
high-util-lang Contenu textuel dans des langues contenant de grandes quantités de données de formation disponibles, notamment l'allemand (DE), l'italien (IT), l'espagnol (ES), le français (FR), l'hindi (HI), le japonais (JP), l'arabe (AR) et le portugais (PT)
low-util-lang Contenu textuel dans d'autres langues parlées avec de plus petites quantités de données de formation disponibles.
math Contenu mathématique comprenant des manuels, des problèmes, des solutions et des discussions mathématiques.
tables Données structurées au format tabulaire, notamment des feuilles de calcul, des bases de données, des fichiers CSV, des tableaux statistiques, des rapports financiers et d'autres informations organisées en lignes et colonnes qui aident le modèle à comprendre et à utiliser les relations et les modèles de données structurés.

Configuration Nova 2.0 avec mélange de données

# Note: # This recipe can run on p5.48xlarge # Run config display_name: "Nova Lite Pretrain on P5 GPU" versions: ["2.0"] instance_types: ["ml.p5.48xlarge"] run: name: "my-cpt-run" # A descriptive name for your training job model_type: "amazon.nova-2-lite-v1:0:256k" # Model variant specification, do not change model_name_or_path: "nova-lite-2/prod" # Base model path, do not change replicas: 8 # Number of compute instances for training, allowed values are 4, 8, 16, 32 data_s3_path: "" # Customer data paths validation_data_s3_path: "" # Customer validation data paths output_s3_path: "" # Output artifact path, SageMaker HyperPod job-specific configuration - not compatible with standard SageMaker Training jobs ## Training specific configs training_config: task_type: cpt max_length: 8192 # Maximum context window size (tokens) global_batch_size: 64 # Global batch size, allowed values are 32, 64, 128, 256. trainer: max_steps: 10 # The number of training steps to run total val_check_interval: 10 # The number of steps between running validation limit_val_batches: 2 # Batches of the validation set to use each trigger model: hidden_dropout: 0.0 # Dropout for hidden states, must be between 0.0 and 1.0 attention_dropout: 0.0 # Dropout for attention weights, must be between 0.0 and 1.0 optim: optimizer: adam lr: 1e-5 # Learning rate name: distributed_fused_adam # Optimizer algorithm, do not change adam_w_mode: true # Enable AdamW mode eps: 1e-06 # Epsilon for numerical stability weight_decay: 0.0 # L2 regularization strength, must be between 0.0 and 1.0 adam_beta1: 0.9 # Beta1 for Adam optimizer adam_beta2: 0.95 # Beta2 for Adam optimizer sched: warmup_steps: 10 # Learning rate warmup steps constant_steps: 0 # Steps at constant learning rate min_lr: 1e-6 # Minimum learning rate, must be lower than lr data_mixing: dataset_catalog: cpt_text_lite sources: nova_data: # percent inputs for Nova data must sum to 100%; use 0% if you want to exclude a data grouping agents: 20 business-and-finance: 4 scientific: 10 code: 5 factual-and-news: 5 longform-text: 6 health-and-medicine: 1 humanities-and-education: 1 legal: 1 math: 9 additional-languages: 15 social-and-personal-interest: 11 entertainment: 0.5 reasoning: 10 other: 0.5 tables: 1 customer_data: # percent input of customer data. 100 = use only customer data, 0 = use only the nova_data mix above percent: 25

Que signifient ces catégories

Remarque  : Nova 2.0 inclut des catégories supplémentaires spécifiques au raisonnement (par exemple, reasoning-codereasoning-math,reasoning-instruction-following) qui ne sont pas disponibles dans Nova 1.0.

Résumé des catégories et des étiquettes d'information :

Nom de la catégorie Détail de l'information
agents Données de formation axées sur la prise de décision autonome, l'exécution de tâches et le comportement axé sur les objectifs dans les systèmes d'IA
baseline Données linguistiques fondamentales axées sur la compréhension générale, la communication de base et les capacités linguistiques de base
chat Des échanges conversationnels démontrant un flux de dialogue naturel, le maintien du contexte et des interactions sociales appropriées
code Code source de programmation, documentation et discussions techniques à partir de divers langages de programmation et plateformes.
factuality Matériaux de référence et informations vérifiées axés sur l'exactitude, la validation des sources et l'évaluation de la véracité
identity Cadres de personnalité et modèles comportementaux axés sur des traits de caractère, des valeurs et des styles d'interaction cohérents
long-context Des textes étendus et des récits complexes axés sur le maintien de la cohérence et de la pertinence lors de longs échanges
math Contenu mathématique comprenant des manuels, des problèmes, des solutions et des discussions mathématiques.
rai Cas et scénarios mettant l'accent sur les principes éthiques de l'IA, les considérations de sécurité et le déploiement responsable de technologies
instruction-following Exemples d'exécution précise de tâches en fonction de différents niveaux d'instructions et de directives de l'utilisateur
stem Contenu technique couvrant la science, la technologie, l'ingénierie et les mathématiques, y compris la résolution de problèmes et les concepts théoriques
planning Séquences illustrant la réflexion stratégique, la répartition des tâches étape par étape et l'allocation efficace des ressources
reasoning-chat Scénarios de dialogue analytiques axés sur une discussion logique et des flux de conversation structurés
reasoning-code Défis de programmation et problèmes algorithmiques axés sur le développement systématique de solutions
reasoning-factuality Scénarios d'évaluation des informations axés sur les processus critiques d'évaluation et de vérification
reasoning-instruction-following Analyse des tâches complexes axée sur l'interprétation systématique et l'exécution méthodique
reasoning-math Scénarios mathématiques de résolution de problèmes axés sur la progression logique et les stratégies de résolution
reasoning-planning Scénarios de prise de décisions stratégiques axés sur une approche systématique de la réalisation des objectifs
reasoning-rag Scénarios de recherche et de synthèse d'informations axés sur la compréhension contextuelle et l'application pertinente
reasoning-rai Scénarios de prise de décisions éthiques axés sur l'évaluation systématique de la sécurité et de l'équité de l'IA
reasoning-stem Scénarios scientifiques de résolution de problèmes axés sur l'analyse méthodique et le développement de solutions
rag Exemples de combinaison efficace des connaissances externes récupérées avec les réponses générées pour fournir des informations contextuelles précises
translation Multi-language des paires de contenus présentant une traduction précise tout en préservant le contexte, le ton et les nuances culturelles

Guide des paramètres

  • dataset_catalog : La seule valeur est cpt_text_lite pour le moment, jusqu'à ce que nous activions la formation multimodale.

  • nova_data : pourcentage des différentes catégories de données Nova lorsqu'elles sont mélangées. Leur somme doit être égale à 1,0.

  • customer_data  : pourcentage des données du client mélangées aux données Nova.

Le nombre total de jetons utilisés lors de l'entraînement peut être calculé à partir de max_length * global_batch_size * max_steps

Limitations

Le CPT actuel ne prend en charge que les données texte et ne prend en charge aucun ensemble de données multimodales client.