

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

# Fortsetzung und Pre-Training Mid-Training
<a name="nova-forge-cpt"></a>

**Anmerkung**  
Eine ausführliche Dokumentation wird nach dem Abonnement bereitgestellt

Nova Forge CPT bietet erweiterte Funktionen, die über das Standard-CPT hinausgehen, einschließlich des Zugriffs auf Zwischenkontrollpunkte und der Datenmischung mit Novas Vortrainingskorpus. Diese Funktionen ermöglichen eine effizientere Domänenanpassung und eine bessere Erhaltung der allgemeinen Fähigkeiten des Modells.

## Was sind Zwischenkontrollpunkte und warum werden sie benötigt?
<a name="nova-forge-cpt-checkpoints"></a>

Zwischenprüfpunkte sind Schnappschüsse des Amazon Nova-Modells, die in verschiedenen Phasen des Vortrainings gespeichert wurden, bevor das Modell seinen endgültigen produktionsreifen Zustand erreicht. Während der Modellentwicklung durchläuft Amazon Nova mehrere Trainingsphasen: anfängliches Vortraining mit konstanter Lernrate, Senkung der Lernrate, Schulung zur Kontexterweiterung und schließlich Schulung in Bezug auf Ausrichtung und Sicherheit anhand der Anweisungen. Beim CPT sind Zwischenprüfpunkte oft dem letzten Prod-Checkpoint vorzuziehen, da sie plastischer sind und für Domänenanpassungen empfänglicher sind. Der Prod-Checkpoint wurde einem umfassenden Ausrichtungs- und Sicherheitstraining unterzogen, wodurch das Modell zwar für allgemeine Konversationszwecke optimiert wird, es jedoch resistent gegen das Erlernen neuer domänenspezifischer Muster während des CPT sein kann. Im Gegensatz dazu behalten Checkpoints, die nur teilweise und vollständig mit Text trainiert wurden, die Merkmale des Modells vor dem Training bei. Sie wurden nicht stark auf bestimmte Verhaltensweisen ausgerichtet, was sie zu effizienteren Ausgangspunkten für die Domänenanpassung macht. Bei der Durchführung umfangreicher CPT (>10 B-Tokens) führt der Beginn an Zwischenkontrollpunkten in der Regel zu einer schnelleren Konvergenz, einer besseren Trainingsstabilität und einem effektiveren Erwerb von Fachwissen. Für kleine CPT (<10 B-Token) oder wenn die Fähigkeit, Anweisungen zu befolgen, erhalten bleiben muss, ist der Prod-Checkpoint jedoch möglicherweise besser geeignet, da er eine Domänenanpassung ermöglicht und gleichzeitig die Konversationsfähigkeit des Modells beibehält.

Für CPT sind mehrere Zwischenprüfpunkte erforderlich, da sie unterschiedliche Ebenen der Modellplastizität bieten, die sich darauf auswirken, wie effizient das Modell neues Domänenwissen aufnehmen kann. Der letzte Prod-Checkpoint wurde einem umfangreichen Ausrichtungs- und Sicherheitstraining unterzogen. Dadurch ist er zwar für allgemeine Konversationszwecke optimiert, aber resistent gegen das Erlernen neuer domänenspezifischer Muster. Mit anderen Worten: Es wurde durch das Training nach dem Training gefestigt. Im Gegensatz dazu haben frühere Checkpoints die Eigenschaften des Modells vor dem Training beibehalten und wurden nicht stark auf bestimmte Verhaltensweisen ausgerichtet, wodurch sie plastischer und empfänglicher für die Anpassung an bestimmte Bereiche wurden.

Um die beste Trainingseffizienz zu erreichen, sind mehrere Zwischenkontrollpunkte vorgesehen.

## Welche Checkpoints sind verfügbar?
<a name="nova-forge-cpt-available"></a>

**Nova 1.0**  
Die Amazon Nova 1.0-Familie umfasst drei Modelle (Micro, Lite, Pro). Für jedes Modell stehen drei Checkpoints zur Verfügung.
+ PRE-TRAINED - [`nova-<micro/lite/pro>/pretraining-text-partial`]: Dies ist der Checkpoint nach der Phase des Amazon Nova-Vortrainings mit konstanter Lernrate, in der das Modell mit Billionen von Text-Tokens trainiert wird.
+ MID-TRAINED - [`nova-<micro/lite/pro>/pretraining-text-full`]: Dies ist der reine Text-Checkpoint, nachdem alle Phasen des Amazon Nova-Trainings vor und während des Trainings mit Billionen von Text-Tokens abgeschlossen sind. Verwenden Sie diese, wenn das Modell speziell keine multimodalen Daten hätte sehen sollen.
+ MID-TRAINED - [`nova-<lite/pro>/pretraining-mm-full`]: Dies ist der Checkpoint, nachdem alle Phasen des Amazon Nova-Trainings vor und während des Trainings, einschließlich multimodaler Daten, mit Billionen von Tokens verarbeitet wurden.
+ POST-TRAINED - [`nova-<micro/lite/pro>/prod`]: Dies ist der vollständig abgestimmte letzte Checkpoint des Modells, das alle Schritte vor und nach dem Training durchlaufen hat.

**Nova 2.0**  
Es gibt drei Amazon Nova Lite 2.0-Checkpoints.
+ PRE-TRAINED - [`nova-lite-2/pretraining-text-RD`]: Dies ist der Checkpoint nach der konstanten Lernrate und den Rampdown-Phasen des Amazon Nova-Vortrainings, in denen das Modell mit Billionen von Tokens trainiert wird.
+ MID-TRAINED - [`nova-lite-2/pretraining-text-CE`]: Dieser Checkpoint ermöglicht es, Zwischenmengen unstrukturierter Daten mit einer konservativeren Lernrate als vor dem Training einzuführen, wodurch domänenspezifisches Wissen aufgenommen und gleichzeitig ein katastrophales Vergessen vermieden wird.
+ POST-TRAINED - [`nova-lite-2/prod`]: Dies ist der letzte Kontrollpunkt des Modells, der alle Schritte vor und nach dem Training durchlaufen hat.

In der folgenden Tabelle werden die verschiedenen Bedingungen für das Training vor und während des Trainings näher erläutert.


| Datentyp | Durchführen | Mit Checkpoint | 
| --- |--- |--- |
| Large-scale unstrukturierte Domain-Rohdaten (Dokumente, Protokolle, Artikel, Code usw.) | Fortsetzung Pre-Training | Pre-Trained | 
| Large-scale unstrukturierte Domain-Rohdaten (Dokumente, Protokolle, Artikel, Code usw.) | Mid-Training | Pre-Trained | 
| Kleinere Mengen unstrukturierter Rohdaten. Spuren strukturierter Argumentation//CoT-Daten | Mid-Training | Mid-Trained | 
| Strukturierte Demonstrationen (hochwertige Input-Output-Paare, kuratierte Aufgabenanweisungen, Dialoge mit mehreren Runden) | Vollständig Fine-Tuning | Mid-Trained | 
| Strukturierte Demonstrationen (hochwertige Input-Output-Paare, kuratierte Aufgabenanweisungen, Dialoge mit mehreren Runden) | Parameter Effizient Fine-Tuning | Post-Trained | 

## Welcher Checkpoint soll verwendet werden?
<a name="nova-forge-cpt-which"></a>

Checkpoints, die nur teilweise vortrainierter Text und vollständig vortrainierter Text enthalten, laufen in der Regel schneller zusammen und erfordern weniger Trainingsschritte für die Domänenanpassung. Allerdings müssen sie die Anweisungen nicht anpassen und müssten nach dem Training weitere Schritte durchlaufen, um nützliche Aufgaben ausführen und Anweisungen befolgen zu können. Der GA-Checkpoint erfordert zwar mehr Anpassungsschritte, bietet aber einen sichereren Ausgangspunkt für Experimente in kleinem Maßstab und einige der Fähigkeiten nach dem Training bleiben auch nach dem Training erhalten.

Im Allgemeinen sollten Sie bei großen Trainingsdatensätzen (>10 B-Tokens) mit Checkpoints beginnen, die nur teilweise vortrainierten Text oder nur vollständig vortrainierten Text enthalten, um ein effizienteres und stabileres Training zu gewährleisten, da die Wissensbasis des Modells erheblich geändert wird. Verwenden Sie bei kleinen Datensätzen (<10 B Tokens) den GA-Checkpoint, um die Fähigkeit, Anweisungen zu befolgen, beizubehalten und sich gleichzeitig an die Domäne anzupassen.

## Wie verwendet man die Datenmischung für 1.0- oder 2.0-Modelle?
<a name="nova-forge-cpt-mixing"></a>

Wenn Sie CPT mit Daten aus einer neuen Domäne durchführen, ist es von großem Vorteil, die neuen Daten mit einigen der Daten zu mischen, die zuvor in der Vortrainingsphase des Modells verwendet wurden. Das Mischen alter Daten mit neuen Domänendaten löst zwei Probleme:
+ Kontrolle vergessen: Beugt katastrophalem Vergessen vor, indem vorhandene Fähigkeiten und Kenntnisse des Modells erhalten bleiben. Wenn die Daten nicht vermischt werden, führt das Training ausschließlich mit Daten aus einem engen Bereich dazu, dass das Modell allgemeine Funktionen überschreibt. Beispielsweise könnte ein Modell, das nur anhand von Rechtsdokumenten trainiert wurde, seine Fähigkeit zum Programmieren oder Rechnen verlieren. Durch das Mischen der allgemeinen Domänendatensätze bleiben diese allgemeinen Fähigkeiten beim Erwerb der neuen Domäne erhalten.
+ Optimierungsstabilität: Die Stabilität des Trainings wird aufrechterhalten, indem die internen Repräsentationen des Modells verankert werden. Während des CPT werden die erlernten Merkmale des Modells modifiziert, und durch das Mischen der Daten entstehen Gradienten aus verschiedenen Quellen, die diese Anpassung reibungslos steuern. Ohne sie kann das Training mit engen Verteilungen zu einer Instabilität des Gradienten führen, wodurch sich die Repräsentationen des Modells zu drastisch ändern, was zu Trainingsdivergenz, Verlustspitzen oder zum Zusammenbruch vorhandener Fähigkeiten führt. Das ist der Kompromiss zwischen Stabilität und Plastizität: Das Modell sollte plastisch genug sein, um neues Domänenwissen zu erlernen, aber stabil genug, um Bestehendes nicht zu zerstören.

**Funktionen zum Mischen von Daten bei Nova CPT**  
Der Zugriff auf Amazon Nova-Daten und Checkpoints vor dem Training ist eines der Kernangebote der Amazon Nova CPT-Anpassung. Die CPT-Anpassung von Amazon Nova ermöglicht das einfache Mischen von Domain-Daten mit dem Korpus von Amazon Nova vor dem Training. Darüber hinaus kann das Stichprobenverhältnis der spezifischen Amazon Nova-Datenkategorien (z. B. Code, Mathematik, Argumentation usw.) geändert und ihre Proportionen so gesteuert werden, dass sie die Domänendaten ergänzen. Dies ermöglicht die Stärkung von Funktionen, die auf den Anwendungsfall abgestimmt sind, und gleichzeitig das Modell an den spezifischen Bereich anzupassen.

**Finden des optimalen Mischungsverhältnisses**  
Das optimale Verhältnis zwischen Amazon Nova-Daten und Domain-Daten hängt von der Domäne, Komplexität, Größe und Qualität des Datensatzes ab und davon, wie wichtig es ist, die allgemeinen Funktionen aufrechtzuerhalten. Dieses Verhältnis muss durch Experimente herausgefunden werden. Ein Versuchsrahmen, um zu entscheiden, wie viele Amazon Nova-Daten gemischt werden sollen, lautet wie folgt.

Wählen Sie eine repräsentative Teilmenge von Domänendaten (z. B. 5B-Token) aus und halten Sie diese bei allen experimentellen Durchläufen konstant.

Führen Sie kleine CPT-Experimente durch und variieren Sie nur die Menge der eingemischten Amazon Nova-Daten:
+ Kein Mischen: 100% Domain → nur 5B-Domain (insgesamt 5B)
+ Lichtmischung: 90% Domäne → 5B-Domäne \+ \~0,56 B Amazon Nova (insgesamt \~5,56 B)
+ Mittlere Mischung: 70% Domain → 5B Domain \+ \~2,14 B Amazon Nova (insgesamt \~7,14 B)
+ Starkes Mischen: 50% Domain → 5 B Domain \+ 5 B Amazon Nova (insgesamt 10 B)

Bewerten Sie jeden Checkpoint anhand von internen und allgemeinen Domain-Benchmarks. Evaluieren Sie auch den Start-Checkpoint (Amazon Nova-Checkpoint vor jedem Training).
+ Bleibt die Performance im Kundenbereich bei allen Durchläufen ungefähr konstant? In der Regel sollte dies der Fall sein, da bei jedem Durchlauf die gleiche Anzahl von Domain-Token verwendet wurde. Wenn sich die Domain-Leistung bei stärkerer Mischung verbessert, bieten die Daten von Amazon Nova eine nützliche Regularisierung.
+ Verbessern sich die allgemeinen Benchmark-Ergebnisse, wenn das Mischen zunimmt?
  + Erwartungsgemäß sollten sich die allgemeinen Funktionen monoton verbessern, je mehr Amazon Nova-Daten hinzukommen.
  + Messen Sie mehrere allgemeine Benchmarks: MMLU (Allgemeinwissen), HumanEval (Codierung), GSM8K (Mathematik) oder spezifische Benchmarks von Interesse.
+ Wählen Sie das Mischungsverhältnis, das die Domänenleistung beibehält und gleichzeitig akzeptable allgemeine Funktionen für die jeweiligen Anwendungsfälle bietet. Berücksichtigen Sie die zusätzlichen Kosten für Schulungen bei einer stärkeren Datenmischung.

Sobald das optimale Mischungsverhältnis ermittelt wurde, führen Sie das CPT in vollem Maßstab aus und verwenden Sie dabei den vollständigen Domänendatensatz mit dem ausgewählten Mischungsverhältnis.

## Analyse der Kategorien für die Datenmischung
<a name="nova-forge-cpt-data-mixing-categories"></a>

Im Folgenden analysieren wir jede verfügbare Kategorie in Data Mixing, damit Sie am besten entscheiden können, welche Datenkategorien für Ihre gesamte Datenmischung am sinnvollsten sind.

### Wie aktiviere ich die Datenmischung
<a name="nova-forge-cpt-enable-mixing"></a>

Fügen Sie Ihrem Rezept den `data_mixing` Abschnitt mit der entsprechenden prozentualen Verteilung auf die Datensatzkategorien hinzu. Die Summe der `nova_data` Prozentsätze muss 100 ergeben.

#### Nova 1.0-Konfiguration mit Datenmischung
<a name="nova-forge-cpt-nova1-config"></a>

```
run:
  name: "cpt-job-name"             # A descriptive name for your training job
  model_type: "amazon.nova-lite-v1:0:300k"  # Model variant specification, do not change
  model_name_or_path: "nova-lite/prod"
  replicas: 4 
  data_s3_path: "s3://path/to/data/xyz.jsonl"
  output_s3_path: "s3://path/to/output/checkpoint"
  
skip_recipe_validation: true
training_config:
  max_length: 32768
  global_batch_size: 64
  trainer:
    max_steps: 5000
  model:
    hidden_dropout: 0.1
    attention_dropout: 0.1
    ffn_dropout: 0.1
    optim:
      lr: 1.5e-05
      name: distributed_fused_adam
      adam_w_mode: true
      eps: 1.0e-06
      weight_decay: 0.05
      betas:
      - 0.9
      - 0.999
      sched:
        warmup_steps: 500
        constant_steps: 0
        min_lr: 1.5e-06
        
data_mixing:
  dataset_catalog: cpt_text_lite
  sources:
    nova_data:
      en-entertainment: 0.11%
      en-factual: 4.83%
      en-legal: 0.48%
      en-long-form-text: 6.26%
      en-mined: 16.79%
      en-other: 1.79%
      en-scientific: 10.53%
      en-social: 12.43%
      en-techqa: 13.95%
      code: 7.50%
      high-util-lang: 8.05%
      low-util-lang: 6.51%
      math: 8.76%
      en-finance: 1%
      tables: 1%
    customer_data:
      percent: 90
```

**Was bedeuten diese Kategorien **


| Name der Kategorie | Detail der Informationen | 
| --- | --- | 
| en-entertainment | Medien- und Unterhaltungsinhalte wie Video-Transkripte, Spieldialoge und unterhaltsame Diskussionen. | 
| en-factual | Referenzmaterial, enzyklopädische Inhalte, Bildungsressourcen und sachliche Dokumentationen konzentrierten sich auf die Vermittlung genauer Informationen. | 
| en-finance | Finanztexte wie Marktberichte, Wirtschaftsanalysen, Anlagestrategien, Finanznachrichten, Ergebnisberichte und andere finanzbezogene Inhalte, die dem Modell helfen, wirtschaftliche Konzepte und Finanzterminologie zu verstehen. | 
| en-legal | Juristische Dokumente, Gerichtsverfahren, Verträge, Gesetze, Vorschriften und Texte zur Rechtsanalyse. | 
| en-long-form-text | Umfangreiche Schriften, darunter Bücher, wissenschaftliche Arbeiten, lange Artikel und andere umfangreiche Textdokumente. | 
| en-mined | Textdaten, die aus verschiedenen Webquellen wie Foren, Kommentaren, Diskussionen und allgemeinen Webinhalten extrahiert und neu geschrieben wurden, um eine hohe Trainingsleistung zu gewährleisten. | 
| en-other | Verschiedene englischsprachige Inhalte, die nicht eindeutig in andere Kategorien passen. | 
| en-scientific | Wissenschaftliche Arbeiten, Forschungsdokumente, technische Berichte und wissenschaftliche Diskussionen in verschiedenen Bereichen. | 
| en-social | Beiträge, Konversationen, Diskussionen und andere Formen der sozialen Kommunikation in sozialen Netzwerken. | 
| en-techqa | Technische Dokumentation, Benutzerhandbücher, FAQ-Seiten, technische Foren und Q-Inhalte zum Thema Technologie. | 
| code | Programmierungsquellcode, Dokumentation und technische Diskussionen aus verschiedenen Programmiersprachen und Plattformen. | 
| high-util-lang | Textinhalte in Sprachen mit großen Mengen verfügbarer Trainingsdaten, darunter Deutsch (DE), Italienisch (IT), Spanisch (ES), Französisch (FR), Hindi (HI), Japanisch (JP), Arabisch (AR) und Portugiesisch (PT) | 
| low-util-lang | Textinhalte in weiteren gesprochenen Sprachen mit kleineren Mengen verfügbarer Trainingsdaten. | 
| math | Mathematische Inhalte wie Lehrbücher, Probleme, Lösungen und mathematische Diskussionen. | 
| tables | Strukturierte Daten im Tabellenformat, einschließlich Tabellenkalkulationen, Datenbanken, CSV-Dateien, statistischen Tabellen, Finanzberichten und anderen in Zeilen und Spalten organisierten Informationen, die dem Modell helfen, strukturierte Datenbeziehungen und Muster zu verstehen und mit ihnen zu arbeiten. | 

#### Nova 2.0-Konfiguration mit Datenmischung
<a name="nova-forge-cpt-nova2-config"></a>

```
# Note:
# This recipe can run on p5.48xlarge

# Run config
display_name: "Nova Lite Pretrain on P5 GPU"
versions: ["2.0"]
instance_types: ["ml.p5.48xlarge"]

run:
  name: "my-cpt-run"     # A descriptive name for your training job
  model_type: "amazon.nova-2-lite-v1:0:256k" # Model variant specification, do not change
  model_name_or_path: "nova-lite-2/prod" # Base model path, do not change
  replicas: 8       # Number of compute instances for training, allowed values are 4, 8, 16, 32
  data_s3_path: ""       # Customer data paths
  validation_data_s3_path: ""        # Customer validation data paths
  output_s3_path: ""   # Output artifact path, SageMaker HyperPod job-specific configuration - not compatible with standard SageMaker Training jobs

## Training specific configs
training_config:
  task_type: cpt
  max_length: 8192              # Maximum context window size (tokens)
  global_batch_size: 64        # Global batch size, allowed values are 32, 64, 128, 256.

  trainer:
    max_steps: 10               # The number of training steps to run total
    val_check_interval: 10      # The number of steps between running validation
    limit_val_batches: 2        # Batches of the validation set to use each trigger

  model:
    hidden_dropout: 0.0           # Dropout for hidden states, must be between 0.0 and 1.0
    attention_dropout: 0.0        # Dropout for attention weights, must be between 0.0 and 1.0

  optim:
    optimizer: adam
    lr: 1e-5                      # Learning rate
    name: distributed_fused_adam  # Optimizer algorithm, do not change
    adam_w_mode: true             # Enable AdamW mode
    eps: 1e-06                    # Epsilon for numerical stability
    weight_decay: 0.0             # L2 regularization strength, must be between 0.0 and 1.0
    adam_beta1: 0.9               # Beta1 for Adam optimizer
    adam_beta2: 0.95              # Beta2 for Adam optimizer
    sched:
      warmup_steps: 10            # Learning rate warmup steps
      constant_steps: 0           # Steps at constant learning rate
      min_lr: 1e-6                # Minimum learning rate, must be lower than lr

data_mixing:
  dataset_catalog: cpt_text_lite
  sources:
    nova_data:   # percent inputs for Nova data must sum to 100%; use 0% if you want to exclude a data grouping
      agents: 20
      business-and-finance: 4
      scientific: 10
      code: 5
      factual-and-news: 5
      longform-text: 6
      health-and-medicine: 1
      humanities-and-education: 1
      legal: 1
      math: 9
      additional-languages: 15
      social-and-personal-interest: 11
      entertainment: 0.5
      reasoning: 10
      other: 0.5
      tables: 1
    customer_data: # percent input of customer data. 100 = use only customer data, 0 = use only the nova_data mix above
      percent: 25
```

**Was bedeuten diese Kategorien **

**Hinweis**: Nova 2.0 enthält zusätzliche Kategorien, die für Überlegungen spezifisch sind (z. B.,`reasoning-code`,`reasoning-instruction-following`)`reasoning-math`, die in Nova 1.0 nicht verfügbar sind.

Zusammenfassung der Kategorien und Informationsbeschriftungen:


| Name der Kategorie | Detail der Informationen | 
| --- | --- | 
| agents | Die Trainingsdaten konzentrierten sich auf die autonome Entscheidungsfindung, die Erledigung von Aufgaben und zielorientiertes Verhalten in KI-Systemen | 
| baseline | Grundlegende Sprachdaten konzentrierten sich auf das allgemeine Verständnis, die grundlegende Kommunikation und die sprachlichen Kernkompetenzen | 
| chat | Konversationsaustausch, der den natürlichen Dialogfluss, die Aufrechterhaltung des Kontextes und angemessene soziale Interaktionen demonstriert | 
| code | Programmierungsquellcode, Dokumentation und technische Diskussionen aus verschiedenen Programmiersprachen und Plattformen. | 
| factuality | Referenzmaterialien und verifizierte Informationen, die sich auf Genauigkeit, Quellenvalidierung und Wahrheitsbeurteilung konzentrierten | 
| identity | Persönlichkeitsrahmen und Verhaltensmuster konzentrierten sich auf konsistente Charaktereigenschaften, Werte und Interaktionsstile | 
| long-context | Erweiterte Texte und komplexe Erzählungen konzentrierten sich auf die Wahrung von Kohärenz und Relevanz über einen langen Austausch hinweg | 
| math | Mathematische Inhalte wie Lehrbücher, Probleme, Lösungen und mathematische Diskussionen. | 
| rai | Fälle und Szenarien, in denen ethische KI-Prinzipien, Sicherheitsüberlegungen und verantwortungsvoller Technologieeinsatz im Vordergrund stehen | 
| instruction-following | Beispiele für die präzise Ausführung von Aufgaben auf der Grundlage von Benutzeraufforderungen und Anweisungen auf unterschiedlichem Niveau | 
| stem | Technische Inhalte aus den Bereichen Wissenschaft, Technologie, Ingenieurwesen und Mathematik, einschließlich Problemlösung und theoretischer Konzepte | 
| planning | Sequenzen, die strategisches Denken, eine schrittweise Aufschlüsselung der Aufgaben und eine effiziente Ressourcenallokation demonstrieren | 
| reasoning-chat | Analytische Dialogszenarien konzentrierten sich auf logische Diskussionen und strukturierte Gesprächsabläufe | 
| reasoning-code | Programmierprobleme und algorithmische Probleme konzentrierten sich auf die systematische Lösungsentwicklung | 
| reasoning-factuality | Die Szenarien zur Informationsbewertung konzentrierten sich auf kritische Bewertungs- und Verifizierungsprozesse | 
| reasoning-instruction-following | Die komplexe Aufgabenanalyse konzentrierte sich auf die systematische Interpretation und methodische Ausführung | 
| reasoning-math | Mathematische Problemlösungsszenarien konzentrierten sich auf logische Progressions- und Lösungsstrategien | 
| reasoning-planning | Strategische Entscheidungsszenarien konzentrierten sich auf einen systematischen Ansatz zur Zielerreichung | 
| reasoning-rag | Szenarien zum Abrufen und zur Synthese von Informationen konzentrierten sich auf das kontextuelle Verständnis und die entsprechende Anwendung | 
| reasoning-rai | Ethische Entscheidungsszenarien konzentrierten sich auf die systematische Bewertung von KI-Sicherheit und Fairness | 
| reasoning-stem | Wissenschaftliche Problemlösungsszenarien konzentrierten sich auf methodische Analyse und Lösungsentwicklung | 
| rag | Beispiele für die effektive Kombination von abgerufenem externem Wissen mit generierten Antworten, um genaue, kontextbezogene Informationen bereitzustellen | 
| translation | Multi-language Inhaltspaare, die eine genaue Übersetzung aufweisen und gleichzeitig Kontext, Tonalität und kulturelle Nuancen beibehalten | 

#### Parameter-Leitfaden
<a name="nova-forge-cpt-param-guide"></a>
+ **dataset\_catalog: ** Der einzige Wert ist vorerst cpt\_text\_lite, bis wir das multimodale Training aktivieren.
+ **nova\_data: ** Prozentsatz der einzelnen Kategorien von Nova-Daten, wenn sie gemischt werden. Sie sollten zusammen 1,0 ergeben.
+ **customer\_data**: Der Prozentsatz der Kundendaten, die in die Nova-Daten eingemischt wurden.

Die Gesamtzahl der im Training verwendeten Tokens kann anhand von `max_length` \* \* berechnet werden `global_batch_size` `max_steps`

**Einschränkungen**  
Das aktuelle CPT unterstützt nur Textdaten und keine multimodalen Kundendatensätze.