View a markdown version of this page

Unterstützung für FlashAttention - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Unterstützung für FlashAttention

Die Unterstützung für FlashAttention ist eine Funktion der Bibliothek, die nur für das verteilte Transformer-Modell gilt. Dabei handelt es sich um ein Transformer-Modell, das smp.DistributedModel() für modellparalleles Training vorgesehen ist. Diese Funktion ist auch mit Tensor-Parallelität kompatibel.

Die FlashAttention Bibliothek unterstützt nur Modelle, wenn sie auf einen attention_head_size Wert gesetzt sind, der ein Vielfaches von 8 und kleiner als 128 ist. Wenn Sie also einen dezentralen Transformator trainieren und sicherstellen, dass er ordnungsgemäß FlashAttention funktioniert, sollten Sie die Parameter so anpassen, dass die Größe des Kontaktkopfs den Anforderungen entspricht. Weitere Informationen finden Sie auch unter Installation und Funktionen im FlashAttention GitHub Repository.

Nehmen wir z. B. an, Sie konfigurieren ein Transformator-Modell mit hidden_width=864 und num_heads=48. Die Kopfgröße von FlashAttention wird berechnet alsattention_head_size = hidden_width / num_heads = 864 / 48 = 18. Um dies zu aktivieren FlashAttention, müssen Sie den num_heads Parameter so einstellen54, dassattention_head_size = hidden_width / num_heads = 864 / 54 = 16, was ein Vielfaches von 8 ist.