Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Meilleures pratiques en matière de voix agentiques
Amazon Connect Agentic Voice associe la reconnaissance vocale avancée (ASR) à des voix expressives et naturelles pour offrir une expérience d'IA vocale complète. L'ASR avancé permet une prise de parole naturelle et à faible latence dans les conversations en temps réel, tandis que le moteur vocal diffuse des discours réalistes dans plus de 50 régions. Ensemble, ces composants permettent des interactions fluides et humaines entre les appelants et les agents Amazon Connect AI. Ce guide couvre la configuration et les meilleures pratiques pour les deux composants, afin que vous puissiez tirer le meilleur parti de l'expérience vocale complète des agents.
Note
Pour utiliser les fonctionnalités vocales agentiques d'Amazon Connect, assurez-vous qu'Amazon Connect Customer est activé pour votre instance. Amazon Connect Agentic Voice est le fournisseur de services vocaux par défaut pour Amazon Connect Customer.
Ce guide couvre les points suivants :
Syntaxe des attributs de session pour les contrôles ASR.
Barge-in comportement (interruption) et quand le désactiver.
End-of-turn réglage pour Advanced ASR.
Conseils linguistiques pour la reconnaissance vocale multilingue.
Gestion des appels d'outils de longue durée.
Meilleures pratiques de mise en forme du texte pour la sortie vocale.
Tags de commande vocale pour un contrôle vocal précis.
Invitations du système pour les agents Amazon Connect AI.
Exemples de centres d'appels.
Configuration vocale multilingue pour une prise en charge multilingue.
Meilleures pratiques en matière de reconnaissance vocale avancée (ASR)
La préférence de modèle vocal Advanced ASR est un outil de reconnaissance de diffusion en continu conçu pour une prise de parole naturelle et à faible latence lors de conversations en temps réel. Au lieu de se fier uniquement à une fenêtre de silence fixe, il évalue le discours de l'appelant pendant qu'il parle et prédit quand l'appelant a terminé, c'est-à-dire la fin de son tour (EOT).
Syntaxe des attributs de session
Les contrôles de cette section sont définis avec des attributs de session Lex V2 standard dans l'x-amz-lexespace de noms. Vous les définissez lorsque vous démarrez une conversation et vous pouvez les modifier dans une fonction Lambda (par exemple, pour assouplir la détection uniquement lors de la collecte d'une valeur sensible).
Étendez chaque attribut à une intention et à un créneau :
x-amz-lex:audio:<setting>:<intentName>:<slotToElicit>
*Utilisez-le comme intention ou nom d'emplacement pour définir une valeur par défaut qui s'applique partout.Tout paramètre spécifique à une intention ou à un emplacement a priorité sur un paramètre par défaut.
*
Faire :
Définissez des valeurs prudentes uniquement pour les emplacements qui en ont besoin (par exemple, un emplacement contenant un numéro de compte) et laissez tout le reste sur les valeurs par défaut.
Réinitialisez les valeurs relâchées pour le prochain créneau une fois qu'une collecte sensible est terminée.
Ne pas :
Appliquez une seule
*:*valeur par défaut agressive à l'échelle mondiale pour corriger un emplacement : le rythme change à chaque tour du bot.
Barge-in (comportement d'interruption)
Barge-in permet à l'appelant d'interrompre une invite que le bot est en train de jouer. Il est activé par défaut, ce qui est généralement ce que vous souhaitez pour une conversation naturelle. Vous le contrôlez avec :
x-amz-lex:allow-interrupt:<intentName>:<slotToElicit>
Valeur par défaut : true
Désactivez barge-in (false) lorsque :
Utiliser un langage juridique, de conformité ou de divulgation d'enregistrements qui doit être entendu dans son intégralité.
Relecture d'une confirmation indiquant que l'appelant ne doit pas parler.
Maintenez l'option Barge-In activée dans les cas suivants :
L'appelant souhaiterait peut-être corriger ou raccourcir le message du bot au milieu de l'invite, ce qui est normal dans une conversation.
Exemple
Pour un agent d'IA en libre-service, laissez Barge-in activé partout par défaut. Désactivez-la uniquement lorsqu'une invite doit être entendue dans son intégralité, par exemple, une clause de non-responsabilité légale ou de conformité. Définissez les attributs lorsque vous démarrez la conversation. Activez la valeur par défaut avec une *:* entrée et désactivez l'entrée uniquement dans le but de diffuser la clause de non-responsabilité :
{ "sessionState": { "sessionAttributes": { "x-amz-lex:allow-interrupt:*:*": "true", "x-amz-lex:allow-interrupt:Disclaimer:*": "false" } } }
L'entrée spécifique à l'intention et à l'emplacement a priorité sur l'entrée *:* par défaut, de sorte que l'appelant peut interrompre partout sauf pendant que l'Disclaimerintention parle. Si vous définissez plutôt l'attribut d'avertissement dans une fonction Lambda, définissez-le avant la lecture de l'invite d'avertissement. Réinitialisez-le à « true après » pour que le reste de la conversation reste interruptible.
Note
Une nouvelle invite déclenchée par un délai d'attente n'est pas une véritable incursion. Un point de confusion courant : si un appelant passe au silence et que la fonction de repli de fin de tour se déclenche, le bot peut mettre fin au tour ou lancer une nouvelle demande de son propre chef. Cela peut ressembler à une interruption, mais c'est la détection de fin de tour qui se déclenche, et non l'appel qui fait irruption. Le correctif consiste presque toujours à régler les paramètres de fin de tour, et non l'indicateur d'autorisation-interruption.
End-of-turn réglage
Advanced ASR met fin à un tour lorsque l'une des conditions est d'abord remplie :
End-of-turn seuil de confiance : le modèle est suffisamment sûr que l'appelant a terminé. Il s'agit du signal principal et c'est ce qui rend le son naturel lors de la prise de tour.
End-of-turn délai d'expiration du silence : l'appelant est resté silencieux pendant la durée configurée. Il s'agit de la solution de repli (un appelant est à la traîne ou devient silencieux).
| Paramètre | Attribut de session | Par défaut | Range |
|---|---|---|---|
| End-of-turn seuil de confiance | x-amz-lex:audio:end-confidence-threshold |
0.7 | 0,5 à 0,9 |
| End-of-turn délai d'expiration du silence | x-amz-lex:audio:end-timeout-ms |
5 000 ms | 500 à 10 000 ms |
Des valeurs plus élevées font attendre le bot plus longtemps et les virages finaux sont plus prudents (moins de coupures prématurées, un peu plus de latence). Des valeurs plus faibles mettent fin aux tours plus tôt (latence plus faible, plus de chances d'interrompre un appelant qui fait une pause). Le seuil de confiance est le principal levier ; le délai de silence n'est important que lorsque la confiance n'est pas encore terminée.
Out-of-range comportement :
end-confidence-thresholdoutside 0.5—0.9 est rejeté en raison d'une erreur d'attribut de session non valide.end-timeout-msinférieure à 500 ou supérieure à 10 000 est bloquée silencieusement à la valeur prise en charge la plus proche.
Choix des valeurs
| Scénario | Paramètres recommandés | Remarques |
|---|---|---|
| Conversation naturelle | Valeurs par défaut (0,7/5 000 ms) | Conçu pour une prise de virage réactive et polyvalente. |
| Saisie sensible ou dictée (OTP, numéro de compte) | seuil : 0,9, délai d'attente : 6 000 à 8 000 ms | Tolère les pauses. Réinitialisez pour le prochain créneau après la collecte. |
| Échanges courts (yes/no, un seul mot) | seuil : ~0,5, délai d'attente : ~500 ms | Des virages plus rapides. Testez d'abord pour détecter les seuils prématurés. |
Exemple
Détection prudente de fin de virage pour le AccountNumber créneau de l'VerifyIdentityintention :
{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:end-confidence-threshold:VerifyIdentity:AccountNumber": "0.9", "x-amz-lex:audio:end-timeout-ms:VerifyIdentity:AccountNumber": "7000" } } }
Une seule valeur par défaut pour chaque intention et chaque créneau :
{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:end-confidence-threshold:*:*": "0.8", "x-amz-lex:audio:end-timeout-ms:*:*": "800" } } }
Conseils de langue pour la reconnaissance multilingue
Advanced ASR reconnaît plusieurs langues au cours d'une même conversation sans savoir à quelles langues s'attendre. Il détecte la langue dans le discours de l'appelant, ce qui permet à celui-ci de commencer en anglais et de passer à l'espagnol et la transcription suit. Il s'agit du comportement par défaut et ne nécessite aucune configuration.
Si vous connaissez déjà les langues utilisées par vos appelants, vous pouvez biaiser la reconnaissance en leur faveur grâce à des conseils linguistiques. Les astuces sont particulièrement utiles lorsque deux langues ont un son similaire. Ils sont également utiles lorsque des énoncés courts (un seul mot, un chiffre, a yes/no ) ne permettent pas au modèle de fonctionner correctement. Vous les définissez avec :
x-amz-lex:audio:locale-override:<intentName>:<slotToElicit>
Par défaut : aucune indication — Advanced ASR détecte la langue de manière autonome.
Définissez la portée de l'attribut de la même manière que les autres contrôles de cette section. *:*Utilisez-le pour biaiser chaque étape de la conversation, ou nommez une intention et un créneau pour biaiser uniquement les moments où vous connaissez la langue attendue.
Format de valeur
Définissez la valeur en fonction des codes de langue vers lesquels vous souhaitez biaiser, probablement en premier. Utilisez une liste séparée par des virgules, éventuellement entourée de crochets et de guillemets si cela est plus facile à produire à partir de votre flux ou de votre fonction Lambda. Advanced ASR ignore les espaces environnants et traite les traits de soulignement comme des tirets, donc équivalents. pt_BR pt-BR
Le tableau suivant présente des exemples de valeurs d'attributs et les langues vers lesquelles chacun oriente Advanced ASR.
| Valeur de l'attribut | Languages Advanced ASR est biaisé en faveur de |
|---|---|
| Attribut non défini | Aucune. L'ASR avancé détecte la langue à partir du discours de l'appelant. |
es,en-US |
Espagnol, puis anglais américain |
["ja"] |
Japonais |
[ "es" , "en" ] |
Espagnol, puis anglais |
fr, de , it |
français, puis allemand, puis italien |
Validation
Chaque entrée doit correspondre à un code de langue valide. Utilisez un code de base à deux ou trois lettres, éventuellement suivi d'un tiret et d'une sous-étiquette de région
es, par exemple,en-USou.pt-BRLes entrées qui ne correspondent pas à ce formulaire sont supprimées et les entrées valides restantes sont toujours appliquées. S'il ne reste aucune entrée valide, la conversation se poursuit sans aucun indice au lieu d'échouer.
Advanced ASR transmet et ignore un code bien formé qu'il ne reconnaît pas. Le code ne génère pas d'erreur, mais il ne biaise pas non plus la reconnaissance. Vérifiez donc les codes que vous envoyez.
Advanced ASR supprime les doublons. Il applique au maximum 10 indices et ignore ceux qui dépassent le dixième.
Exemple
L'exemple suivant biaise la reconnaissance d'une ligne dont les appelants parlent espagnol ou anglais, l'espagnol étant la langue la plus courante :
{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:locale-override:*:*": "es,en-US" } } }
Faire
Laissez l'attribut non défini, sauf si vous avez une raison spécifique de biaiser la reconnaissance. La détection gère la plupart des conversations multilingues.
Indiquez uniquement les langues que parlent réellement vos appelants, probablement en premier.
Ne le faites pas
Dressez la liste des langues que vos appelants parlent réellement. Une longue liste atténue le biais et supprime tout avantage lié à la définition d'indices.
Envoyez un seul indice pour verrouiller la conversation dans une seule langue. Un indice biaise la reconnaissance ; il ne la restreint pas. Pour restreindre les langues dans lesquelles l'agent IA répond, consultezRestreindre à des langues spécifiques.
Astuce
Les indices de langue biaisent la reconnaissance vocale, c'est-à-dire ce que le bot entend. Ils ne modifient pas la langue parlée par le bot. Pour la langue de réponse, utilisez l'invite du système d'agent AI et une voix multilingue. Consultez Configuration vocale multilingue.
Gestion des appels d'outils de longue durée
Lorsqu'un agent IA ou Lambda effectue un appel d'outil de longue durée (une recherche dans le backend, une API externe, un appel de modèle) avant que le bot ne soit prêt à écouter, l'appelant reste silencieux. L'appelant peut avoir l'impression que le bot est bloqué ou qu'il lui a parlé lorsqu'il répond finalement.
Atténuations :
Terminez le travail de longue haleine avant que le bot n'ouvre le micro. Terminez l'appel à l'outil avant que le bot n'accède au prochain emplacement.
Émettez une invite de mise en attente ou de saisie (« Un moment pendant que je tire ça vers le haut... ») pour que l'appelant ne reste pas assis en silence.
Activez les sons de remplissage pendant les appels d'outils ou étape par étape.
Maintenez l'option Barge-In activée tout au long de ces étapes afin que, si l'appelant parle pendant une invite de saisie, il puisse faire avancer les choses.
Astuce
Validez la latence de bout en bout avec vos appels d'outils réels. L'objectif est que l'appelant ne soit jamais laissé dans l'impasse en attente sur le backend.
Référence rapide des attributs de session ASR
| Attribut | Par défaut | Remarques |
|---|---|---|
x-amz-lex:allow-interrupt:<intent>:<slot> |
true | Barge-in. Paramétré false pour les clauses de non-responsabilité. |
x-amz-lex:audio:end-confidence-threshold:<intent>:<slot> |
0.7 | Signal EOT principal. Plage de 0,5 à 0,9. Out-of-range rejeté. |
x-amz-lex:audio:end-timeout-ms:<intent>:<slot> |
5 000 ms | Solution de repli EOT. Plage de 500 à 10 000 ms. Out-of-range serré. |
x-amz-lex:audio:locale-override:<intent>:<slot> |
Non défini | La langue suggère une reconnaissance biaisée. Comma-separated codes, maximum 10. |
Erreurs ASR courantes
| Erreur | Pourquoi c'est mauvais | Corriger |
|---|---|---|
| Seuil de confiance faible lors de la collecte des chiffres dictés | Le bot coupe la communication à l'appelant entre les groupes | Augmentez la confiance et le délai d'attente sur cet emplacement, puis réinitialisez. |
| Désactiver l'interception à l'échelle mondiale | L'appelant ne peut corriger le bot nulle part | Désactivez uniquement lorsque disclaimer/compliance vous y êtes invité. |
Appliquer une *:* valeur par défaut pour corriger un emplacement |
Modifie le rythme pour l'ensemble du bot | Étendez l'attribut à une valeur spécifique intent/slot. |
| Réglage du seuil en dehors de 0,5 à 0,9 | La demande est rejetée avec une erreur | Gardez-le à portée. Se end-timeout-ms serre uniquement en silence. |
| Laisser la fenêtre de saisie ouverte pendant un long appel à l'outil | L'appelant est assis en plein air | Terminez d'abord l'appel à l'outil ou lancez une invite de saisie. |
| Traiter une nouvelle invite EOT comme une véritable intrusion | Mauvais correctif appliqué pour autoriser et interrompre | Réglez plutôt les paramètres de fin de virage. |
Liste de nombreuses langues dans locale-override |
Dilue le biais qu'il a été défini pour fournir | Indiquez uniquement les langues parlées par les appelants, probablement en premier. |
Meilleures pratiques en matière de voix
Amazon Connect Agentic Voice diffuse une synthèse vocale expressive et naturelle dans plus de 50 régions. Le moteur normalise automatiquement le texte écrit en langage naturel. Dans la plupart des cas, vous pouvez transmettre le texte tel quel et obtenir d'excellents résultats sans aucune mise en forme particulière.
Formatage du texte
Règles générales
Transmettez un texte naturel et bien ponctué. Les phrases complètes avec une majuscule et une ponctuation normales produisent le meilleur rythme et la meilleure intonation.
Faire :
Utilisez des phrases complètes avec une ponctuation terminale (. ? !).
Utilisez une majuscule normale.
Conservez les chiffres, les dates et les formats courants sous forme écrite conventionnelle.
Limitez chaque génération à au moins une phrase ou une phrase complète. Les fragments très courts ont tendance à paraître moins naturels.
Ne pas :
Supprimez la ponctuation ou forcez TOUT EN MAJUSCULES.
Incluez du markdown, du JSON brut, des emoji ou des caractères spéciaux.
Envoyez des chiffres, des caractères alphanumériques ou des balises orthographiques sans contexte complet.
Mettez le texte en gras ou en italique. Le moteur essaiera de prononcer les astérisques.
Utilisez des parenthèses, des crochets, des accolades, des crochets angulaires et des guillemets.
Normalisation automatique
Le moteur lit les formats écrits courants sous forme de discours naturel. La plupart du temps, il n'est pas nécessaire de les reformater :
| Type | Transmets-le | Le moteur se lit comme |
|---|---|---|
| Chiffres importants | 1 234 567 | « un million deux cent trente-quatre mille... » |
| Numéros de téléphone | (415) 555-1212 | Rythme naturel des numéros de téléphone |
| Adresses e-mail | utilisateur@exemple.com | « utilisateur sur example point com » |
| Dates | 04/20/2025 | Locale-appropriate lecture de la date |
| Times | 19 H 00 | « 19 heures » |
| Acronymes | NASA, ÉTATS-UNIS | Parlé comme prévu |
| Pourcentages | 12 % | « douze pour cent » |
Astuce
Les adresses e-mail se lisent bien sous forme écrite. Vous pouvez également demander à votre agent de sortir directement le formulaire vocal (par exemple, « user at example point com ») si vous souhaitez un contrôle précis.
Tags de commande vocale
Le moteur vocal déduit automatiquement le rythme et les émotions appropriés à partir du contenu de la transcription. Utilisez des balises de contrôle uniquement pour des cas d'utilisation spécifiques auxquels la valeur par défaut n'est pas satisfaisante. Toutes les balises sont placées directement dans la transcription.
Vitesse
Contrôlez le débit de parole. Plage : 0,6 (lent) à 1,5 (rapide). Par défaut : 1.0.
<speed ratio="0.85"/>This call may be recorded for quality purposes.
| Value | À utiliser lorsque |
|---|---|
| 0.8 | Lire des informations importantes ou un langage juridique |
| 1.0 | Par défaut : vitesse de conversation naturelle |
| 1.2 | Faster-paced dialogue |
Pour rétablir la vitesse après avoir ralenti, procédez comme suit :
<speed ratio="0.85"/>Important notice.<speed ratio="1.0"/>Now, how can I help?
Volume
Contrôlez le volume. Plage : 0,5 (silencieux) à 2,0 (fort). Par défaut : 1.0.
<volume ratio="0.5"/>I'll speak softly for this part.
Pauses
Insérez des pauses. Spécifiez la durée en secondes (s) ou en millisecondes (ms).
Your balance is $1,234.<break time="500ms"/>Your next payment is due June 15th.
Utilisez des pauses pour :
Rythme entre les différentes informations.
Avant le langage légal ou de conformité.
Entre les options de menu d'un IVR.
Note
La ponctuation naturelle devrait être le premier outil de pause. Une virgule ou un point produit généralement la bonne pause. Il est préférable de réserver les balises Break aux silences explicites d'une durée spécifique.
Épeler
Forcez la lecture caractère par caractère des codes, des identifiants, des numéros de téléphone ou de toute chaîne devant être prononcée lettre par lettre.
Your confirmation code is <spell>TKT4829XB</spell>.
Pour les longues séquences, ajoutez un espace à l'intérieur de la balise orthographique pour insérer des pauses :
Your phone number is <spell>(415)</spell><break time="200ms"/><spell>5551212</spell>.
Formats alternatifs (sans balises) :
Space-delimited: A B C 1 2 3
Regroupés par des virgules : A, B, C, 1, 2, 3.
Ralenti et énoncé : A, B, C, 1, 2, 3
Note
Le modèle traite le texte EN MAJUSCULES de la même manière que s'il était enveloppé dans des <spell>balises : il sera lu lettre par lettre. Par exemple, « ACME BANK » serait prononcé comme « A-C-M-E B-A-N-K. » Pour que le modèle le prononce sous forme de mot, utilisez une majuscule standard : « Acme Bank ».
Émotion
Le modèle déduit naturellement le ton émotionnel du contenu : aucune balise n'est nécessaire dans la plupart des cas. Les balises d'émotion sont une fonctionnalité bêta et fonctionnent de manière plus fiable lorsque l'émotion correspond à la transcription.
<emotion value="sympathetic"/>I understand this is frustrating. Let me investigate that for you.
Émotions primaires : neutral angryexcited,content,sad, etscared.
Rire
Insérez [laughter] pour produire un rire naturel.
Oh, I've actually heard that one before! [laughter] Alright, let's get this sorted out.
Référence de l'étiquette
| Balise | Ce qu'il fait | Exemple |
|---|---|---|
<speed ratio="X"/> |
Taux de parole (0,6 à 1,5) | <speed ratio="0.85"/> |
<volume ratio="X"/> |
Niveau sonore (0,5 à 2,0) | <volume ratio="1.5"/> |
<break time="Xs"/> |
Pause (secondes ou ms) | <break time="500ms"/> |
<spell>...</spell> |
Character-by-character lecture | <spell>AB12CD</spell> |
<emotion value="X"/> |
Tonalité émotionnelle | <emotion value="content"/> |
[laughter] |
Rire naturel | [laughter] |
Tags mal formés
Well-formed les balises incluses dans la correspondance
<...>sont traitées correctement par le moteur.Les balises mal formées ou non fermées ne seront pas supprimées en silence : le moteur prononcera le texte mal formé à haute voix.
Les wrappers SSML non pris en charge ne
<speak>...</speak>sont pas obligatoires et ne doivent pas être inclus.
Astuce
Si le moteur rencontre une balise qu'il ne peut pas analyser, il essaiera de lire le texte brut, y compris les fragments de balises. Vérifiez toujours que vos étiquettes sont bien formées.
Configuration vocale multilingue
Amazon Connect agentic Voice inclut des voix multilingues qui peuvent parler plusieurs langues et passer facilement de l'une à l'autre en cours de conversation. Un appelant peut commencer en anglais, passer à l'espagnol et l'agent le suit : aucun changement de flux ni aucune interruption ne sont nécessaires. Dans le bloc Set Voice, ces voix sont étiquetées comme des voix polyglottes. Ce guide utilise le terme « voix multilingues » pour les décrire. Cette section explique comment configurer les voix multilingues et les points à surveiller.
Voix multilingues
Les voix multilingues basculent de manière native entre les langues prises en charge au cours d'une même conversation. Utilisez une voix multilingue lorsque votre centre d'appels doit gérer des appelants qui parlent différentes langues ou qui changent de langue en cours d'appel.
| Voix | Gender | Langues prises en charge |
|---|---|---|
| Katie | Féminin | anglais, allemand, espagnol, français, hindi, italien, japonais, norvégien, portugais, russe |
| Blake | Masculin | anglais, allemand, espagnol, français, hindi, italien, japonais, norvégien, portugais, russe |
| Brooke | Féminin | anglais, allemand, espagnol, français, hindi, italien, japonais, norvégien, portugais, russe |
| Ronald | Masculin | anglais, allemand, espagnol, français, hindi, italien, japonais, norvégien, portugais, russe |
| Gemma | Féminin | anglais, allemand, espagnol, français, hindi, italien, japonais, norvégien, portugais, russe |
Configuration
Étape 1 : créez votre bot Amazon Lex dans les paramètres régionaux de la voix multilingue
Si vous utilisez une voix multilingue, vous n'avez besoin que d'une seule langue pour le bot Amazon Lex. Créez votre bot dans la langue qui correspond à la voix multilingue (par exemple, en-US ou en-GB). Il n'est pas nécessaire d'ajouter toutes les langues prises en charge par la voix multilingue en tant que langue distincte dans Amazon Lex.
Faire :
Créez votre bot en anglais (ou en anglais si vous utilisez une voix multilingue en anglais britannique).
Utilisez un seul paramètre régional. L'agent IA et la voix multilingue gèrent les conversations multilingues sans paramètres régionaux Amazon Lex supplémentaires.
Ne pas :
Ajoutez des paramètres régionaux pour robots Amazon Lex distincts pour chaque langue prise en charge par la voix multilingue. Cela n'est pas nécessaire : l'agent IA gère le changement de langue par le biais de l'invite.
Si vous devez prendre en charge une langue qui ne figure pas dans la liste des langues prises en charge par la voix multilingue (par exemple, le thaï ou le tagalog), créez un bot distinct pour cette langue et utilisez une voix spécifique à la langue locale. Consultez Utilisation d'une voix d'agence non multilingue dans une langue autre que l'anglais.
Étape 2 : faites correspondre les paramètres régionaux du bot Lex au bloc Set Voice
L'attribut de langue défini dans le bloc Set Voice doit correspondre aux paramètres régionaux de votre robot Lex. S'ils ne correspondent pas, le bloc Get Customer Input renvoie une erreur. Mettez à jour la langue du bloc de commande vocale pour qu'elle corresponde aux paramètres régionaux de votre bot.
Pour les voix multilingues créées à partir d'une langue anglaise :
Dans le bloc Set Voice, sélectionnez la voix multilingue (par exemple, Brooke) et réglez la langue sur l'anglais (États-Unis).
Votre bot Lex doit avoir en-US comme paramètre régional intégré.
First-turn salutation
Au premier tour, l'agent IA n'a reçu aucune entrée de l'appelant. Sans saisie, l'agent ne peut pas détecter la langue de l'appelant. La voix prononce le texte d'accueil configuré dans le bloc Get Customer Input. Si vous souhaitez que le bot accueille l'appelant dans une langue spécifique, assurez-vous que le message d'accueil de ce bloc est écrit dans cette langue.
Par exemple, si votre base d'appels principale parle espagnol, configurez le message d'accueil Get Customer Input en espagnol :
Hola, gracias por llamar. ¿Cómo puedo ayudarle hoy?
Après le premier tour, l'agent IA prend le relais, détecte et suit la langue de l'appelant pendant le reste de la conversation.
Étape 3 : ajouter des instructions de gestion de la langue à l'invite du système d'agent AI
Ajoutez une section de gestion de la langue à l'invite système de votre agent IA. Cette section définit le comportement multilingue. L'agent IA détecte la langue de l'appelant à partir de la transcription et répond dans cette langue.
Modèle (à personnaliser selon votre cas d'utilisation) :
You are connected to a multilingual voice that supports the following languages: English, German, Spanish, French, Hindi, Italian, Japanese, Norwegian, Portuguese, and Russian. Language handling rules: Detect the language of the caller's input from the transcription. If the caller speaks in one of the supported languages listed above, respond in that same language. If the caller speaks a language not in the supported list, respond in English and politely let them know you can assist in the supported languages. Always respond in one language at a time. Do not mix languages in a single response unless the caller mixes first. If the caller switches languages mid-conversation, follow their lead immediately. When responding in any non-English language, always use proper accent marks, diacritics, and locale-appropriate formatting (for example, é, ñ, ü, ç). This ensures the voice engine produces natural pronunciation. Keep English brand names, product names, codes, and identifiers in English. Do not translate them.
Astuce
Indiquez uniquement les langues que votre voix multilingue prend réellement en charge dans l'invite. La liste des langues non prises en charge amène l'agent à prétendre qu'il peut aider, mais le TTS produit un résultat anormal.
Utilisation d'une voix d'agence non multilingue dans une langue autre que l'anglais
Si vous utilisez une voix d'agent qui n'est pas multilingue (par exemple, une voix thaïlandaise, coréenne ou portugaise), vous devez définir explicitement l'attribut de langue afin que le système soit redirigé vers le moteur ASR approprié.
Option A : définir le bloc vocal
Sélectionnez votre voix non anglaise (par exemple, une voix thaïlandaise pour la dernière locale).
Définissez la langue sur la langue correspondante (par exemple, Th-th).
Créez votre bot Lex avec une locale correspondante (TH-th).
Option B : définir le bloc Attributs de contact
Si le bloc Définir la voix n'expose pas le paramètre de langue de votre configuration, vous pouvez définir la langue à l'aide du bloc Définir les attributs du contact avant le bloc Obtenir les informations du client :
Type — Système
Attribut — Langue
Valeur : code local (par exemple, TL-pH pour le tagalog, th-TH pour le thaï)
Restreindre à des langues spécifiques
Si votre centre d'appels ne prend en charge qu'un sous-ensemble de langues, simplifiez l'invite :
You support English and Spanish on this line only. Detect the language of the caller's input. If the caller speaks English or Spanish, respond in that language. If the caller speaks any other language, respond in English: I apologize, but I can only assist in English or Spanish. How can I help you today? If the caller switches between English and Spanish, follow their lead. Use proper accent marks when responding in Spanish (á, é, í, ó, ú, ñ, ü). Keep brand names and codes in English.
Invite système pour les agents Amazon Connect AI
Lorsque les agents Amazon Connect AI génèrent du texte qui sera prononcé, ajoutez ces instructions de mise en forme vocale à l'invite système de votre agent. Copiez et collez le bloc ci-dessous directement dans votre configuration rapide.
Note
Ces instructions sont des modèles qui vous aideront à démarrer. Modifiez-les en fonction de votre cas d'utilisation, de votre ton et de vos besoins commerciaux spécifiques.
Astuce
Pour obtenir des conseils sur l'optimisation de l'invite de votre agent IA en termes de performances vocales et de latence, consultezMeilleures pratiques d'ingénierie rapides pour les agents d'IA.
Invite de formatage de la sortie vocale
Speech Output Formatting Everything you output will be spoken aloud by text-to-speech. Follow these rules: GENERAL FORMATTING Use full sentences with normal capitalization. Always end with . ? or ! Use conventional written forms for numbers, dates, acronyms, symbols. Do NOT use markdown, bullet points, headers, bold, raw JSON, emoji, or special characters. Write plain prose only. SPELLING OUT CODES AND IDS For codes or IDs that must be read character-by-character, except for phone numbers, wrap in <spell> tags: Example: Your confirmation code is <spell>TKT4829XB</spell>. Was that the account ending in <spell>1234</spell>? THINGS TO AVOID Do not output bullet points, numbered lists, or structured formatting. Do not use asterisks, hashtags, or markdown syntax. Do not include internal thoughts, reasoning, or meta-commentary. Do not use parentheses, brackets, curly braces, or quotation marks. NATURALNESS Respond as if speaking directly to the caller. Keep responses concise. Avoid long monologues. Use natural transitions like: Let me check that for you. Or: Here is what I found.
Module complémentaire multilingue
Si votre bot utilise une voix multilingue, ajoutez ce qui suit à l'invite de votre système pour activer les réponses multilingues :
Language Handling You are connected to a multilingual voice that supports: English, German, Spanish, French, Hindi, Italian, Japanese, Norwegian, Portuguese, and Russian. Detect the language of the caller input from the transcription. If the caller speaks in one of the supported locales, respond in that language. If the caller speaks a language not in the supported list, respond in English and politely let them know you can assist in English. Always respond in one language at a time. Do not mix multiple languages in a single response. If the caller switches languages mid-conversation, follow their lead and switch your responses to match. When responding in a non-English language, always use proper accent marks, diacritics, and locale-appropriate formatting. This ensures the voice engine produces natural, native-sounding pronunciation.
Exemples de centres d'appels
Message d'accueil IVR
Hi, thanks for calling. How can I help you today?
Aucun tag n'est nécessaire : le moteur gère naturellement les messages d'accueil conversationnels.
Avertissement légal (ralenti)
<speed ratio="0.85"/>This call may be recorded for quality assurance purposes. By continuing, you consent to recording.
Paire avec barge-in désactivée au niveau du débit.
Relecture d'un numéro de compte
Avec balises orthographiques :
Your account number is <spell>1234</spell> <spell>5678</spell> <spell>9012</spell>.
Sans balises orthographiques :
Your account number is 1 2 3 4, 5 6 7 8, 9 0 1 2.
Confirmation avec code de référence
I've created your ticket. Your reference number is <spell>TKT4829XB</spell>. Is there anything else I can help with?
Options de menu
Press 1 for billing.<break time="500ms"/>Press 2 for technical support.<break time="500ms"/>Press 3 to speak with an agent.
Orthographe du nom d'un client
Let me confirm — your last name is Smith, spelled <spell>SMITH</spell>. Is that correct?
Erreurs de synthèse vocale courantes
| Erreur | Pourquoi c'est mauvais | Corriger |
|---|---|---|
| Supprimer la ponctuation | Ruine le rythme et l'intonation | Conservez la ponctuation naturelle. |
| Texte en MAJUSCULES | Modifie la façon dont le moteur lit | Utilisez une majuscule normale. |
| Y compris le markdown | Le moteur parle pour formater les caractères | Dépouillez-vous avant de l'envoyer, ou demandez à l'agent d'éviter. |
| Streaming de tags incomplets | Les balises sont lues à haute voix sous forme de texte | Mettez en mémoire tampon les valeurs complètes des balises avant de les envoyer. |
| Émotion et contenu incompatibles | Produit une production non naturelle | Alignez les émotions avec le contenu, ou omettez. |
| Over-engineering le prompt | Peut réduire le caractère naturel | Commencez simplement : ajoutez des balises uniquement lorsque cela est nécessaire. |
| Non-multilingual voix pour plusieurs langues | La voix conserve l'accent local principal | Utilisez une voix multilingue pour la prononciation native. |
| Emballer le texte en caractères de démarquage, en gras ou en italique | Le moteur prononce les astérisques à haute voix | Supprimez tout le formatage Markdown. |
| Envoi de tags mal formés ou non fermés | Le moteur lit le texte brut des balises | Les balises de validation sont bien formées avec les crochets correspondants. |