Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Supporto per FlashAttention
Il supporto per FlashAttention è una funzionalità della libreria applicabile solo al modello a trasformatore distribuito, che è un modello Transformer incluso per l'addestramento parallelo al modello. smp.DistributedModel()
La FlashAttention attention_head_size è impostata su un valore multiplo di 8 e inferiore a 128. Pertanto, quando si addestra un trasformatore distribuito e ci si assicura che FlashAttention funzioni correttamente, è necessario regolare i parametri in modo che le dimensioni della testa di attenzione soddisfino i requisiti. Per ulteriori informazioni, consulta anche Installazione e funzionalità
Ad esempio, supponiamo di configurare un modello Transformer con hidden_width=864 e num_heads=48. La dimensione della testa di FlashAttention viene calcolata comeattention_head_size = hidden_width / num_heads = 864 / 48 = 18. Per abilitarlo FlashAttention, è necessario regolare il num_heads parametro su54, in modo che attention_head_size = hidden_width / num_heads = 864
/ 54 = 16 sia un multiplo di 8.