View a markdown version of this page

Fortsetzung und Pre-Training Mid-Training - Amazon Nova

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Fortsetzung und Pre-Training Mid-Training

Anmerkung

Eine ausführliche Dokumentation wird nach dem Abonnement bereitgestellt

Nova Forge CPT bietet erweiterte Funktionen, die über das Standard-CPT hinausgehen, einschließlich des Zugriffs auf Zwischenkontrollpunkte und der Datenmischung mit Novas Vortrainingskorpus. Diese Funktionen ermöglichen eine effizientere Domänenanpassung und eine bessere Erhaltung der allgemeinen Fähigkeiten des Modells.

Was sind Zwischenkontrollpunkte und warum werden sie benötigt?

Zwischenprüfpunkte sind Schnappschüsse des Amazon Nova-Modells, die in verschiedenen Phasen des Vortrainings gespeichert wurden, bevor das Modell seinen endgültigen produktionsreifen Zustand erreicht. Während der Modellentwicklung durchläuft Amazon Nova mehrere Trainingsphasen: anfängliches Vortraining mit konstanter Lernrate, Senkung der Lernrate, Schulung zur Kontexterweiterung und schließlich Schulung in Bezug auf Ausrichtung und Sicherheit anhand der Anweisungen. Beim CPT sind Zwischenprüfpunkte oft dem letzten Prod-Checkpoint vorzuziehen, da sie plastischer sind und für Domänenanpassungen empfänglicher sind. Der Prod-Checkpoint wurde einem umfassenden Ausrichtungs- und Sicherheitstraining unterzogen, wodurch das Modell zwar für allgemeine Konversationszwecke optimiert wird, es jedoch resistent gegen das Erlernen neuer domänenspezifischer Muster während des CPT sein kann. Im Gegensatz dazu behalten Checkpoints, die nur teilweise und vollständig mit Text trainiert wurden, die Merkmale des Modells vor dem Training bei. Sie wurden nicht stark auf bestimmte Verhaltensweisen ausgerichtet, was sie zu effizienteren Ausgangspunkten für die Domänenanpassung macht. Bei der Durchführung umfangreicher CPT (>10 B-Tokens) führt der Beginn an Zwischenkontrollpunkten in der Regel zu einer schnelleren Konvergenz, einer besseren Trainingsstabilität und einem effektiveren Erwerb von Fachwissen. Für kleine CPT (<10 B-Token) oder wenn die Fähigkeit, Anweisungen zu befolgen, erhalten bleiben muss, ist der Prod-Checkpoint jedoch möglicherweise besser geeignet, da er eine Domänenanpassung ermöglicht und gleichzeitig die Konversationsfähigkeit des Modells beibehält.

Für CPT sind mehrere Zwischenprüfpunkte erforderlich, da sie unterschiedliche Ebenen der Modellplastizität bieten, die sich darauf auswirken, wie effizient das Modell neues Domänenwissen aufnehmen kann. Der letzte Prod-Checkpoint wurde einem umfangreichen Ausrichtungs- und Sicherheitstraining unterzogen. Dadurch ist er zwar für allgemeine Konversationszwecke optimiert, aber resistent gegen das Erlernen neuer domänenspezifischer Muster. Mit anderen Worten: Es wurde durch das Training nach dem Training gefestigt. Im Gegensatz dazu haben frühere Checkpoints die Eigenschaften des Modells vor dem Training beibehalten und wurden nicht stark auf bestimmte Verhaltensweisen ausgerichtet, wodurch sie plastischer und empfänglicher für die Anpassung an bestimmte Bereiche wurden.

Um die beste Trainingseffizienz zu erreichen, sind mehrere Zwischenkontrollpunkte vorgesehen.

Welche Checkpoints sind verfügbar?

Nova 1.0

Die Amazon Nova 1.0-Familie umfasst drei Modelle (Micro, Lite, Pro). Für jedes Modell stehen drei Checkpoints zur Verfügung.

  • PRE-TRAINED - [nova-<micro/lite/pro>/pretraining-text-partial]: Dies ist der Checkpoint nach der Phase des Amazon Nova-Vortrainings mit konstanter Lernrate, in der das Modell mit Billionen von Text-Tokens trainiert wird.

  • MID-TRAINED - [nova-<micro/lite/pro>/pretraining-text-full]: Dies ist der reine Text-Checkpoint, nachdem alle Phasen des Amazon Nova-Trainings vor und während des Trainings mit Billionen von Text-Tokens abgeschlossen sind. Verwenden Sie diese, wenn das Modell speziell keine multimodalen Daten hätte sehen sollen.

  • MID-TRAINED - [nova-<lite/pro>/pretraining-mm-full]: Dies ist der Checkpoint, nachdem alle Phasen des Amazon Nova-Trainings vor und während des Trainings, einschließlich multimodaler Daten, mit Billionen von Tokens verarbeitet wurden.

  • POST-TRAINED - [nova-<micro/lite/pro>/prod]: Dies ist der vollständig abgestimmte letzte Checkpoint des Modells, das alle Schritte vor und nach dem Training durchlaufen hat.

Nova 2.0

Es gibt drei Amazon Nova Lite 2.0-Checkpoints.

  • PRE-TRAINED - [nova-lite-2/pretraining-text-RD]: Dies ist der Checkpoint nach der konstanten Lernrate und den Rampdown-Phasen des Amazon Nova-Vortrainings, in denen das Modell mit Billionen von Tokens trainiert wird.

  • MID-TRAINED - [nova-lite-2/pretraining-text-CE]: Dieser Checkpoint ermöglicht es, Zwischenmengen unstrukturierter Daten mit einer konservativeren Lernrate als vor dem Training einzuführen, wodurch domänenspezifisches Wissen aufgenommen und gleichzeitig ein katastrophales Vergessen vermieden wird.

  • POST-TRAINED - [nova-lite-2/prod]: Dies ist der letzte Kontrollpunkt des Modells, der alle Schritte vor und nach dem Training durchlaufen hat.

In der folgenden Tabelle werden die verschiedenen Bedingungen für das Training vor und während des Trainings näher erläutert.

Datentyp

Durchführen

Mit Checkpoint

Large-scale unstrukturierte Domain-Rohdaten (Dokumente, Protokolle, Artikel, Code usw.)

Fortsetzung Pre-Training

Pre-Trained

Large-scale unstrukturierte Domain-Rohdaten (Dokumente, Protokolle, Artikel, Code usw.)

Mid-Training

Pre-Trained

Kleinere Mengen unstrukturierter Rohdaten. Spuren strukturierter Argumentation//CoT-Daten

Mid-Training

Mid-Trained

Strukturierte Demonstrationen (hochwertige Input-Output-Paare, kuratierte Aufgabenanweisungen, Dialoge mit mehreren Runden)

Vollständig Fine-Tuning

Mid-Trained

Strukturierte Demonstrationen (hochwertige Input-Output-Paare, kuratierte Aufgabenanweisungen, Dialoge mit mehreren Runden)

Parameter Effizient Fine-Tuning

Post-Trained

Welcher Checkpoint soll verwendet werden?

Checkpoints, die nur teilweise vortrainierter Text und vollständig vortrainierter Text enthalten, laufen in der Regel schneller zusammen und erfordern weniger Trainingsschritte für die Domänenanpassung. Allerdings müssen sie die Anweisungen nicht anpassen und müssten nach dem Training weitere Schritte durchlaufen, um nützliche Aufgaben ausführen und Anweisungen befolgen zu können. Der GA-Checkpoint erfordert zwar mehr Anpassungsschritte, bietet aber einen sichereren Ausgangspunkt für Experimente in kleinem Maßstab und einige der Fähigkeiten nach dem Training bleiben auch nach dem Training erhalten.

Im Allgemeinen sollten Sie bei großen Trainingsdatensätzen (>10 B-Tokens) mit Checkpoints beginnen, die nur teilweise vortrainierten Text oder nur vollständig vortrainierten Text enthalten, um ein effizienteres und stabileres Training zu gewährleisten, da die Wissensbasis des Modells erheblich geändert wird. Verwenden Sie bei kleinen Datensätzen (<10 B Tokens) den GA-Checkpoint, um die Fähigkeit, Anweisungen zu befolgen, beizubehalten und sich gleichzeitig an die Domäne anzupassen.

Wie verwendet man die Datenmischung für 1.0- oder 2.0-Modelle?

Wenn Sie CPT mit Daten aus einer neuen Domäne durchführen, ist es von großem Vorteil, die neuen Daten mit einigen der Daten zu mischen, die zuvor in der Vortrainingsphase des Modells verwendet wurden. Das Mischen alter Daten mit neuen Domänendaten löst zwei Probleme:

  • Kontrolle vergessen: Beugt katastrophalem Vergessen vor, indem vorhandene Fähigkeiten und Kenntnisse des Modells erhalten bleiben. Wenn die Daten nicht vermischt werden, führt das Training ausschließlich mit Daten aus einem engen Bereich dazu, dass das Modell allgemeine Funktionen überschreibt. Beispielsweise könnte ein Modell, das nur anhand von Rechtsdokumenten trainiert wurde, seine Fähigkeit zum Programmieren oder Rechnen verlieren. Durch das Mischen der allgemeinen Domänendatensätze bleiben diese allgemeinen Fähigkeiten beim Erwerb der neuen Domäne erhalten.

  • Optimierungsstabilität: Die Stabilität des Trainings wird aufrechterhalten, indem die internen Repräsentationen des Modells verankert werden. Während des CPT werden die erlernten Merkmale des Modells modifiziert, und durch das Mischen der Daten entstehen Gradienten aus verschiedenen Quellen, die diese Anpassung reibungslos steuern. Ohne sie kann das Training mit engen Verteilungen zu einer Instabilität des Gradienten führen, wodurch sich die Repräsentationen des Modells zu drastisch ändern, was zu Trainingsdivergenz, Verlustspitzen oder zum Zusammenbruch vorhandener Fähigkeiten führt. Das ist der Kompromiss zwischen Stabilität und Plastizität: Das Modell sollte plastisch genug sein, um neues Domänenwissen zu erlernen, aber stabil genug, um Bestehendes nicht zu zerstören.

Funktionen zum Mischen von Daten bei Nova CPT

Der Zugriff auf Amazon Nova-Daten und Checkpoints vor dem Training ist eines der Kernangebote der Amazon Nova CPT-Anpassung. Die CPT-Anpassung von Amazon Nova ermöglicht das einfache Mischen von Domain-Daten mit dem Korpus von Amazon Nova vor dem Training. Darüber hinaus kann das Stichprobenverhältnis der spezifischen Amazon Nova-Datenkategorien (z. B. Code, Mathematik, Argumentation usw.) geändert und ihre Proportionen so gesteuert werden, dass sie die Domänendaten ergänzen. Dies ermöglicht die Stärkung von Funktionen, die auf den Anwendungsfall abgestimmt sind, und gleichzeitig das Modell an den spezifischen Bereich anzupassen.

Finden des optimalen Mischungsverhältnisses

Das optimale Verhältnis zwischen Amazon Nova-Daten und Domain-Daten hängt von der Domäne, Komplexität, Größe und Qualität des Datensatzes ab und davon, wie wichtig es ist, die allgemeinen Funktionen aufrechtzuerhalten. Dieses Verhältnis muss durch Experimente herausgefunden werden. Ein Versuchsrahmen, um zu entscheiden, wie viele Amazon Nova-Daten gemischt werden sollen, lautet wie folgt.

Wählen Sie eine repräsentative Teilmenge von Domänendaten (z. B. 5B-Token) aus und halten Sie diese bei allen experimentellen Durchläufen konstant.

Führen Sie kleine CPT-Experimente durch und variieren Sie nur die Menge der eingemischten Amazon Nova-Daten:

  • Kein Mischen: 100% Domain → nur 5B-Domain (insgesamt 5B)

  • Lichtmischung: 90% Domäne → 5B-Domäne + ~0,56 B Amazon Nova (insgesamt ~5,56 B)

  • Mittlere Mischung: 70% Domain → 5B Domain + ~2,14 B Amazon Nova (insgesamt ~7,14 B)

  • Starkes Mischen: 50% Domain → 5 B Domain + 5 B Amazon Nova (insgesamt 10 B)

Bewerten Sie jeden Checkpoint anhand von internen und allgemeinen Domain-Benchmarks. Evaluieren Sie auch den Start-Checkpoint (Amazon Nova-Checkpoint vor jedem Training).

  • Bleibt die Performance im Kundenbereich bei allen Durchläufen ungefähr konstant? In der Regel sollte dies der Fall sein, da bei jedem Durchlauf die gleiche Anzahl von Domain-Token verwendet wurde. Wenn sich die Domain-Leistung bei stärkerer Mischung verbessert, bieten die Daten von Amazon Nova eine nützliche Regularisierung.

  • Verbessern sich die allgemeinen Benchmark-Ergebnisse, wenn das Mischen zunimmt?

    • Erwartungsgemäß sollten sich die allgemeinen Funktionen monoton verbessern, je mehr Amazon Nova-Daten hinzukommen.

    • Messen Sie mehrere allgemeine Benchmarks: MMLU (Allgemeinwissen), HumanEval (Codierung), GSM8K (Mathematik) oder spezifische Benchmarks von Interesse.

  • Wählen Sie das Mischungsverhältnis, das die Domänenleistung beibehält und gleichzeitig akzeptable allgemeine Funktionen für die jeweiligen Anwendungsfälle bietet. Berücksichtigen Sie die zusätzlichen Kosten für Schulungen bei einer stärkeren Datenmischung.

Sobald das optimale Mischungsverhältnis ermittelt wurde, führen Sie das CPT in vollem Maßstab aus und verwenden Sie dabei den vollständigen Domänendatensatz mit dem ausgewählten Mischungsverhältnis.

Analyse der Kategorien für die Datenmischung

Im Folgenden analysieren wir jede verfügbare Kategorie in Data Mixing, damit Sie am besten entscheiden können, welche Datenkategorien für Ihre gesamte Datenmischung am sinnvollsten sind.

Wie aktiviere ich die Datenmischung

Fügen Sie Ihrem Rezept den data_mixing Abschnitt mit der entsprechenden prozentualen Verteilung auf die Datensatzkategorien hinzu. Die Summe der nova_data Prozentsätze muss 100 ergeben.

Nova 1.0-Konfiguration mit Datenmischung

run: name: "cpt-job-name" # A descriptive name for your training job model_type: "amazon.nova-lite-v1:0:300k" # Model variant specification, do not change model_name_or_path: "nova-lite/prod" replicas: 4 data_s3_path: "s3://path/to/data/xyz.jsonl" output_s3_path: "s3://path/to/output/checkpoint" skip_recipe_validation: true training_config: max_length: 32768 global_batch_size: 64 trainer: max_steps: 5000 model: hidden_dropout: 0.1 attention_dropout: 0.1 ffn_dropout: 0.1 optim: lr: 1.5e-05 name: distributed_fused_adam adam_w_mode: true eps: 1.0e-06 weight_decay: 0.05 betas: - 0.9 - 0.999 sched: warmup_steps: 500 constant_steps: 0 min_lr: 1.5e-06 data_mixing: dataset_catalog: cpt_text_lite sources: nova_data: en-entertainment: 0.11% en-factual: 4.83% en-legal: 0.48% en-long-form-text: 6.26% en-mined: 16.79% en-other: 1.79% en-scientific: 10.53% en-social: 12.43% en-techqa: 13.95% code: 7.50% high-util-lang: 8.05% low-util-lang: 6.51% math: 8.76% en-finance: 1% tables: 1% customer_data: percent: 90

Was bedeuten diese Kategorien

Name der Kategorie Detail der Informationen
en-entertainment Medien- und Unterhaltungsinhalte wie Video-Transkripte, Spieldialoge und unterhaltsame Diskussionen.
en-factual Referenzmaterial, enzyklopädische Inhalte, Bildungsressourcen und sachliche Dokumentationen konzentrierten sich auf die Vermittlung genauer Informationen.
en-finance Finanztexte wie Marktberichte, Wirtschaftsanalysen, Anlagestrategien, Finanznachrichten, Ergebnisberichte und andere finanzbezogene Inhalte, die dem Modell helfen, wirtschaftliche Konzepte und Finanzterminologie zu verstehen.
en-legal Juristische Dokumente, Gerichtsverfahren, Verträge, Gesetze, Vorschriften und Texte zur Rechtsanalyse.
en-long-form-text Umfangreiche Schriften, darunter Bücher, wissenschaftliche Arbeiten, lange Artikel und andere umfangreiche Textdokumente.
en-mined Textdaten, die aus verschiedenen Webquellen wie Foren, Kommentaren, Diskussionen und allgemeinen Webinhalten extrahiert und neu geschrieben wurden, um eine hohe Trainingsleistung zu gewährleisten.
en-other Verschiedene englischsprachige Inhalte, die nicht eindeutig in andere Kategorien passen.
en-scientific Wissenschaftliche Arbeiten, Forschungsdokumente, technische Berichte und wissenschaftliche Diskussionen in verschiedenen Bereichen.
en-social Beiträge, Konversationen, Diskussionen und andere Formen der sozialen Kommunikation in sozialen Netzwerken.
en-techqa Technische Dokumentation, Benutzerhandbücher, FAQ-Seiten, technische Foren und Q-Inhalte zum Thema Technologie.
code Programmierungsquellcode, Dokumentation und technische Diskussionen aus verschiedenen Programmiersprachen und Plattformen.
high-util-lang Textinhalte in Sprachen mit großen Mengen verfügbarer Trainingsdaten, darunter Deutsch (DE), Italienisch (IT), Spanisch (ES), Französisch (FR), Hindi (HI), Japanisch (JP), Arabisch (AR) und Portugiesisch (PT)
low-util-lang Textinhalte in weiteren gesprochenen Sprachen mit kleineren Mengen verfügbarer Trainingsdaten.
math Mathematische Inhalte wie Lehrbücher, Probleme, Lösungen und mathematische Diskussionen.
tables Strukturierte Daten im Tabellenformat, einschließlich Tabellenkalkulationen, Datenbanken, CSV-Dateien, statistischen Tabellen, Finanzberichten und anderen in Zeilen und Spalten organisierten Informationen, die dem Modell helfen, strukturierte Datenbeziehungen und Muster zu verstehen und mit ihnen zu arbeiten.

Nova 2.0-Konfiguration mit Datenmischung

# Note: # This recipe can run on p5.48xlarge # Run config display_name: "Nova Lite Pretrain on P5 GPU" versions: ["2.0"] instance_types: ["ml.p5.48xlarge"] run: name: "my-cpt-run" # A descriptive name for your training job model_type: "amazon.nova-2-lite-v1:0:256k" # Model variant specification, do not change model_name_or_path: "nova-lite-2/prod" # Base model path, do not change replicas: 8 # Number of compute instances for training, allowed values are 4, 8, 16, 32 data_s3_path: "" # Customer data paths validation_data_s3_path: "" # Customer validation data paths output_s3_path: "" # Output artifact path, SageMaker HyperPod job-specific configuration - not compatible with standard SageMaker Training jobs ## Training specific configs training_config: task_type: cpt max_length: 8192 # Maximum context window size (tokens) global_batch_size: 64 # Global batch size, allowed values are 32, 64, 128, 256. trainer: max_steps: 10 # The number of training steps to run total val_check_interval: 10 # The number of steps between running validation limit_val_batches: 2 # Batches of the validation set to use each trigger model: hidden_dropout: 0.0 # Dropout for hidden states, must be between 0.0 and 1.0 attention_dropout: 0.0 # Dropout for attention weights, must be between 0.0 and 1.0 optim: optimizer: adam lr: 1e-5 # Learning rate name: distributed_fused_adam # Optimizer algorithm, do not change adam_w_mode: true # Enable AdamW mode eps: 1e-06 # Epsilon for numerical stability weight_decay: 0.0 # L2 regularization strength, must be between 0.0 and 1.0 adam_beta1: 0.9 # Beta1 for Adam optimizer adam_beta2: 0.95 # Beta2 for Adam optimizer sched: warmup_steps: 10 # Learning rate warmup steps constant_steps: 0 # Steps at constant learning rate min_lr: 1e-6 # Minimum learning rate, must be lower than lr data_mixing: dataset_catalog: cpt_text_lite sources: nova_data: # percent inputs for Nova data must sum to 100%; use 0% if you want to exclude a data grouping agents: 20 business-and-finance: 4 scientific: 10 code: 5 factual-and-news: 5 longform-text: 6 health-and-medicine: 1 humanities-and-education: 1 legal: 1 math: 9 additional-languages: 15 social-and-personal-interest: 11 entertainment: 0.5 reasoning: 10 other: 0.5 tables: 1 customer_data: # percent input of customer data. 100 = use only customer data, 0 = use only the nova_data mix above percent: 25

Was bedeuten diese Kategorien

Hinweis: Nova 2.0 enthält zusätzliche Kategorien, die für Überlegungen spezifisch sind (z. B.,reasoning-code,reasoning-instruction-following)reasoning-math, die in Nova 1.0 nicht verfügbar sind.

Zusammenfassung der Kategorien und Informationsbeschriftungen:

Name der Kategorie Detail der Informationen
agents Die Trainingsdaten konzentrierten sich auf die autonome Entscheidungsfindung, die Erledigung von Aufgaben und zielorientiertes Verhalten in KI-Systemen
baseline Grundlegende Sprachdaten konzentrierten sich auf das allgemeine Verständnis, die grundlegende Kommunikation und die sprachlichen Kernkompetenzen
chat Konversationsaustausch, der den natürlichen Dialogfluss, die Aufrechterhaltung des Kontextes und angemessene soziale Interaktionen demonstriert
code Programmierungsquellcode, Dokumentation und technische Diskussionen aus verschiedenen Programmiersprachen und Plattformen.
factuality Referenzmaterialien und verifizierte Informationen, die sich auf Genauigkeit, Quellenvalidierung und Wahrheitsbeurteilung konzentrierten
identity Persönlichkeitsrahmen und Verhaltensmuster konzentrierten sich auf konsistente Charaktereigenschaften, Werte und Interaktionsstile
long-context Erweiterte Texte und komplexe Erzählungen konzentrierten sich auf die Wahrung von Kohärenz und Relevanz über einen langen Austausch hinweg
math Mathematische Inhalte wie Lehrbücher, Probleme, Lösungen und mathematische Diskussionen.
rai Fälle und Szenarien, in denen ethische KI-Prinzipien, Sicherheitsüberlegungen und verantwortungsvoller Technologieeinsatz im Vordergrund stehen
instruction-following Beispiele für die präzise Ausführung von Aufgaben auf der Grundlage von Benutzeraufforderungen und Anweisungen auf unterschiedlichem Niveau
stem Technische Inhalte aus den Bereichen Wissenschaft, Technologie, Ingenieurwesen und Mathematik, einschließlich Problemlösung und theoretischer Konzepte
planning Sequenzen, die strategisches Denken, eine schrittweise Aufschlüsselung der Aufgaben und eine effiziente Ressourcenallokation demonstrieren
reasoning-chat Analytische Dialogszenarien konzentrierten sich auf logische Diskussionen und strukturierte Gesprächsabläufe
reasoning-code Programmierprobleme und algorithmische Probleme konzentrierten sich auf die systematische Lösungsentwicklung
reasoning-factuality Die Szenarien zur Informationsbewertung konzentrierten sich auf kritische Bewertungs- und Verifizierungsprozesse
reasoning-instruction-following Die komplexe Aufgabenanalyse konzentrierte sich auf die systematische Interpretation und methodische Ausführung
reasoning-math Mathematische Problemlösungsszenarien konzentrierten sich auf logische Progressions- und Lösungsstrategien
reasoning-planning Strategische Entscheidungsszenarien konzentrierten sich auf einen systematischen Ansatz zur Zielerreichung
reasoning-rag Szenarien zum Abrufen und zur Synthese von Informationen konzentrierten sich auf das kontextuelle Verständnis und die entsprechende Anwendung
reasoning-rai Ethische Entscheidungsszenarien konzentrierten sich auf die systematische Bewertung von KI-Sicherheit und Fairness
reasoning-stem Wissenschaftliche Problemlösungsszenarien konzentrierten sich auf methodische Analyse und Lösungsentwicklung
rag Beispiele für die effektive Kombination von abgerufenem externem Wissen mit generierten Antworten, um genaue, kontextbezogene Informationen bereitzustellen
translation Multi-language Inhaltspaare, die eine genaue Übersetzung aufweisen und gleichzeitig Kontext, Tonalität und kulturelle Nuancen beibehalten

Parameter-Leitfaden

  • dataset_catalog: Der einzige Wert ist vorerst cpt_text_lite, bis wir das multimodale Training aktivieren.

  • nova_data: Prozentsatz der einzelnen Kategorien von Nova-Daten, wenn sie gemischt werden. Sie sollten zusammen 1,0 ergeben.

  • customer_data: Der Prozentsatz der Kundendaten, die in die Nova-Daten eingemischt wurden.

Die Gesamtzahl der im Training verwendeten Tokens kann anhand von max_length * * berechnet werden global_batch_size max_steps

Einschränkungen

Das aktuelle CPT unterstützt nur Textdaten und keine multimodalen Kundendatensätze.