View a markdown version of this page

Mejores prácticas de voz para agencias - Amazon Connect Customer

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Mejores prácticas de voz para agencias

La voz agencial de Amazon Connect combina el reconocimiento de voz avanzado (ASR) con voces expresivas y naturales para ofrecer una experiencia de IA de voz completa. El ASR avanzado proporciona una toma de turnos natural y de baja latencia en las conversaciones en tiempo real, mientras que el motor de voz ofrece una voz realista en más de 50 lugares. En conjunto, estos componentes permiten interacciones fluidas y similares a las humanas entre las personas que llaman y los agentes de inteligencia artificial de Amazon Connect. Esta guía describe la configuración y las prácticas recomendadas para ambos componentes, de modo que pueda aprovechar al máximo la experiencia completa de voz de una agencia.

nota

Para usar las funciones de voz para agencias de Amazon Connect, asegúrate de que Amazon Connect Customer esté habilitada para tu instancia. La voz de agencia de Amazon Connect es el proveedor de voz predeterminado para los clientes de Amazon Connect.

Esta guía aborda los siguientes temas:

  • Sintaxis de los atributos de sesión para los controles de ASR.

  • Barge-in comportamiento de (interrupción) y cuándo deshabilitarlo.

  • End-of-turn ajuste para Advanced ASR.

  • Sugerencias lingüísticas para el reconocimiento de voz multilingüe.

  • Gestión de llamadas a herramientas de larga duración.

  • Mejores prácticas de formateo de texto para la salida de voz.

  • Etiquetas de control de voz para un control de voz detallado.

  • Indicaciones del sistema para los agentes de IA de Amazon Connect.

  • Ejemplos de centros de contacto.

  • Configuración de voz multilingüe para soporte en varios idiomas.

Mejores prácticas de reconocimiento de voz avanzado (ASR)

El modelo de voz ASR avanzado prefiere un reconocedor de streaming diseñado para la toma de turnos natural y de baja latencia en conversaciones en tiempo real. En lugar de confiar únicamente en un intervalo fijo de silencio, evalúa la voz de la persona que llama mientras habla y predice cuándo la persona que llama ha terminado, es decir, el final del turno (EOT).

Sintaxis de los atributos de sesión

Los controles de esta sección se configuran con los atributos de sesión estándar de Lex V2 en el espacio de x-amz-lex nombres. Los configuras al iniciar una conversación y puedes anularlos en una función de Lambda (por ejemplo, para relajar la detección solo mientras se recopila un valor sensible).

Limita cada atributo a una intención y un espacio:

x-amz-lex:audio:<setting>:<intentName>:<slotToElicit>
  • *Utilízalo como el nombre de la intención o del espacio para establecer un valor predeterminado que se aplique a todas partes.

  • Cualquier configuración específica por intención o espacio tiene prioridad sobre la predeterminada. *

Haz:

  • Establezca valores conservadores solo en las ranuras que los necesiten (por ejemplo, una ranura para números de cuenta) y deje todo lo demás en los valores predeterminados.

  • Restablece valores relajados para el siguiente espacio una vez que hayas completado una recopilación confidencial.

No hagas lo siguiente:

  • Aplica una única *:* opción agresiva por defecto en todo el mundo para fijar un espacio, ya que cambia el ritmo en cada turno del bot.

Barge-in (comportamiento de interrupción)

Barge-in permite que la persona que llama interrumpa un mensaje que está reproduciendo el bot. Está activado de forma predeterminada, lo que normalmente es lo que quieres para una conversación natural. Lo controlas con:

x-amz-lex:allow-interrupt:<intentName>:<slotToElicit>

Valor predeterminado: true

Desactiva barge-in (false) cuando:

  • Reproduce un lenguaje legal, de cumplimiento o de divulgación de grabaciones que debe escucharse en su totalidad.

  • Volver a leer una confirmación de que la persona que llama no debe hablar.

Mantén la entrada automática habilitada cuando:

  • Es posible que la persona que llama quiera corregir o acortar el bot a mitad de la pregunta, lo que es lo normal en una conversación.

Ejemplo

En el caso de un agente de IA de autoservicio, deja que irrumpa en todas partes de forma predeterminada. Desactívala solo cuando la solicitud deba escucharse en su totalidad, por ejemplo, en un aviso legal o de cumplimiento. Establece los atributos al iniciar la conversación. Mantén la opción predeterminada en una *:* entrada y desactiva la intromisión solo para la intención que reproduzca el aviso legal:

{ "sessionState": { "sessionAttributes": { "x-amz-lex:allow-interrupt:*:*": "true", "x-amz-lex:allow-interrupt:Disclaimer:*": "false" } } }

La entrada específica por intención y espacio tiene prioridad sobre la *:* predeterminada, por lo que la persona que llama puede interrumpir en cualquier momento excepto cuando la intención está hablando. Disclaimer Si, por el contrario, estableces el atributo de descargo de responsabilidad en una función de Lambda, configúralo antes de que se reproduzca el mensaje de descargo de responsabilidad. Restablézcalo como after para true que el resto de la conversación se pueda interrumpir.

nota

Una repetición impulsada por el tiempo de espera no es una verdadera irrupción. Un punto común de confusión: si la persona que llama se queda en silencio y se activa la opción alternativa al final del turno, el bot podría terminar el turno o volver a avisar por sí solo. Esto puede parecer una interrupción, pero es la detección al final del turno la que se activa, no la persona que llama irrumpe. La solución es casi siempre ajustar los ajustes de final de turno, no el indicador de permitir interrupciones.

End-of-turn afinación

El ASR avanzado finaliza un turno cuando se cumple primero una de las condiciones:

  • End-of-turn umbral de confianza: el modelo tiene la confianza suficiente para que la persona que llama haya terminado. Esta es la señal principal y es lo que hace que tomar turnos suene natural.

  • End-of-turn tiempo de espera de silencio: la persona que llama ha permanecido en silencio durante el tiempo configurado. Este es el modo alternativo (la persona que llama se queda en silencio o se queda en silencio).

End-of-turn ajustes
Opción Atributos de sesión Predeterminado Range
End-of-turn umbral de confianza x-amz-lex:audio:end-confidence-threshold 0.7 0,5—0,9
End-of-turn tiempo de espera de silencio x-amz-lex:audio:end-timeout-ms 5000 ms 500 a 10 000 ms

Los valores más altos hacen que el bot espere más tiempo y que los turnos finalicen de forma más conservadora (menos cortes prematuros, algo más de latencia). Los valores más bajos terminan los turnos antes (menor latencia, mayor probabilidad de impedir que la persona que llama haga una pausa). El umbral de confianza es la palanca principal; el tiempo de espera del silencio solo importa cuando la confianza aún no ha terminado el turno.

Out-of-range comportamiento:

  • end-confidence-thresholdfuera de 0.5—0.9 se rechaza por un error de atributo de sesión no válido.

  • end-timeout-mspor debajo de 500 o por encima de 10 000 se fija silenciosamente al valor admitido más cercano.

Elección de valores

Elegir valores de final de turno
Escenario Configuración recomendada Notas
Conversación natural Valores predeterminados (0,7/5000 ms) Ajustado para tomar turnos responsivos y de uso general.
Entrada confidencial o dictada (OTP, número de cuenta) umbral: 0.9, tiempo de espera: 6.000 a 8.000 ms Tolera las pausas. Reinicia para el siguiente espacio después de la recolección.
Intercambios breves (yes/node una sola palabra) umbral: ~0,5, tiempo de espera: ~500 ms Giros más rápidos. Compruebe primero si hay cortes prematuros.

Ejemplo

Detección conservadora al final del turno para la AccountNumber franja de la intención: VerifyIdentity

{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:end-confidence-threshold:VerifyIdentity:AccountNumber": "0.9", "x-amz-lex:audio:end-timeout-ms:VerifyIdentity:AccountNumber": "7000" } } }

Un único valor predeterminado para cada intento y espacio:

{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:end-confidence-threshold:*:*": "0.8", "x-amz-lex:audio:end-timeout-ms:*:*": "800" } } }

Consejos lingüísticos para el reconocimiento multilingüe

El ASR avanzado reconoce varios idiomas en la misma conversación sin que se le diga qué idiomas esperar. Detecta el idioma a partir del discurso de la persona que llama, de modo que la persona que llama puede empezar en inglés y pasar al español y, a continuación, la transcripción. Este es el comportamiento predeterminado y no necesita configuración.

Si ya sabe qué idiomas usan las personas que llaman, puede inclinar el reconocimiento hacia ellos con sugerencias lingüísticas. Las sugerencias son más útiles cuando dos idiomas suenan de manera similar. También ayudan cuando los enunciados cortos (una sola palabra, un dígito, un yes/no ) dan poco con qué trabajar al modelo. Las configuras de la siguiente manera:

x-amz-lex:audio:locale-override:<intentName>:<slotToElicit>

Predeterminado: sin sugerencias: el ASR avanzado detecta el idioma por sí solo.

Establezca el alcance del atributo de la misma manera que los demás controles de esta sección. Utilízalo *:* para sesgar cada turno de la conversación, o nombra una intención y un espacio para sesgar solo los turnos en los que sabes el idioma esperado.

Formato de valores

Establezca el valor en los códigos de idioma que desea preferir, lo más probable es que primero. Usa una lista separada por comas, opcionalmente entre corchetes y comillas si es más fácil generarla a partir de tu función de flujo o de Lambda. El ASR avanzado ignora los espacios en blanco circundantes y trata los guiones bajos como guiones, por lo que son equivalentes. pt_BR pt-BR

La siguiente tabla muestra ejemplos de valores de atributos y los idiomas hacia los que cada uno inclina el ASR avanzado.

Valores de sugerencias de idioma
Valor del atributo Idiomas hacia los que Advanced ASR está inclinado
Atributo no establecido Ninguna. El ASR avanzado detecta el idioma a partir del discurso de la persona que llama.
es,en-US Español, luego inglés de EE. UU.
["ja"] Japonés
[ "es" , "en" ] Español, luego inglés
fr, de , it Francés, luego alemán, luego italiano
Validación
  • Cada entrada debe ser un código de idioma válido. Utilice un código base de dos o tres letras, seguido opcionalmente de un guión y una subetiqueta de región, por ejemploes, en-US o. pt-BR

  • Las entradas que no coincidan con ese formulario se eliminan y las entradas válidas restantes se siguen aplicando. Si no queda ninguna entrada válida, la conversación continúa sin pistas en lugar de fallar.

  • El ASR avanzado pasa por alto un código bien formado que no reconoce y lo ignora. El código no produce ningún error, pero tampoco sesga el reconocimiento, así que compruebe los códigos que envía.

  • El ASR avanzado elimina los duplicados. Aplica como máximo 10 sugerencias e ignora las que superen la décima.

Ejemplo

El siguiente ejemplo sesga el reconocimiento de una línea en la que las personas que llaman hablan español o inglés, siendo el español el idioma más común:

{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:locale-override:*:*": "es,en-US" } } }
Qué hacer
  • Deja el atributo sin definir, a menos que tengas un motivo específico para sesgar el reconocimiento. La detección gestiona la mayoría de las conversaciones multilingües.

  • Enumere solo los idiomas que hablan realmente las personas que llaman, probablemente primero.

Qué no hacer
  • Enumera los idiomas además de los que realmente hablan las personas que llaman. Una lista larga diluye el sesgo y elimina por completo la ventaja de dar pistas.

  • Envía una sola pista para bloquear la conversación en un idioma. Una sugerencia sesga el reconocimiento, no lo restringe. Para restringir los idiomas en los que responde el agente de IA, consulteRestringir a idiomas específicos.

sugerencia

El idioma sugiere sesgos en el reconocimiento de voz: lo que escucha el bot. No cambian el idioma que habla el bot. Para el idioma de respuesta, utilice el mensaje del sistema de agentes de IA y una voz multilingüe. Consulte Configuración de voz multilingüe.

Gestión de llamadas a herramientas de larga duración

Cuando un agente de IA o Lambda realiza una llamada a una herramienta de larga duración (una búsqueda en el backend, una API externa, una invocación de un modelo) antes de que el bot esté listo para escuchar, la persona que llama permanece en silencio. La persona que llama puede sentir que el bot se ha quedado paralizado o que ha hablado por encima de ella cuando por fin responde.

Mitigaciones:

  • Completa el largo trabajo antes de que el robot abra el micrófono. Termina la llamada de herramientas antes de que el bot ocupe el siguiente espacio.

  • Pon un mensaje de espera o de relleno («Un momento mientras lo levanto...») para que la persona que llama no se quede sentada en silencio.

  • Activa sonidos de sonido de relleno durante las pulsaciones de herramientas o paso a paso.

  • Siga estos pasos para que, si la persona que llama habla durante el aviso de llenado, pueda seguir adelante.

sugerencia

Valida la latencia de principio a fin con tus propias llamadas de herramientas. El objetivo es que la persona que llama nunca se quede en el aire esperando en el backend.

Referencia rápida de atributos de sesión de ASR

Referencia rápida de atributos de sesión de ASR
Atributo Predeterminado Notas
x-amz-lex:allow-interrupt:<intent>:<slot> true Barge-in. Configurado false para descargos de responsabilidad.
x-amz-lex:audio:end-confidence-threshold:<intent>:<slot> 0.7 Señal EOT principal. Rango de 0,5 a 0,9. Out-of-range rechazado.
x-amz-lex:audio:end-timeout-ms:<intent>:<slot> 5.000 ms Alternativa EOT. Rango de 500 a 10 000 ms. Out-of-range sujetado.
x-amz-lex:audio:locale-override:<intent>:<slot> No configurado El lenguaje sugiere un reconocimiento sesgado. Comma-separated códigos, máximo 10.

Errores comunes de ASR

Errores comunes de ASR
Error Por qué es malo Fix
Umbral de confianza bajo al recopilar los dígitos dictados El bot interrumpe a la persona que llama entre grupos Aumenta la confianza y el tiempo de espera en ese intervalo, y restablézcalo después.
Desactivar Barge-in a nivel mundial La persona que llama no puede corregir el bot en ninguna parte Desactívala solo cuando se te disclaimer/compliance pida.
Aplicando un *:* valor predeterminado para arreglar una ranura Cambia el ritmo de todo el bot Aplica el atributo a lo específico intent/slot.
Establecer un umbral entre 0,5 y 0,9 La solicitud se rechaza con un error Manténgalo dentro del alcance. Solo se end-timeout-ms sujeta silenciosamente.
Dejar abierta la ventana de entrada durante una llamada larga a la herramienta La persona que llama se queda en el aire Termina primero la llamada a la herramienta o reproduce un mensaje de relleno.
Tratar una nueva solicitud de EOT como una verdadera irrupción Se ha aplicado una solución incorrecta al permitir la interrupción En su lugar, ajusta los ajustes de final de turno.
Lista de muchos idiomas en locale-override Diluye el sesgo que estaba destinado a proporcionar Enumere solo los idiomas que hablan las personas que llaman, probablemente primero.

Prácticas recomendadas de mensajes de voz

La voz de agencia de Amazon Connect ofrece una conversión de texto a voz expresiva y con un sonido natural en más de 50 lugares. El motor normaliza automáticamente el texto escrito para convertirlo en voz natural. En la mayoría de los casos, puede pasar el texto tal cual y obtener excelentes resultados sin ningún formato especial.

Formato de texto

Reglas generales

Pase texto natural y bien puntuado. Las oraciones completas con mayúsculas y puntuación normales producen el mejor ritmo y entonación.

Haz:

  • Usa oraciones completas con signos de puntuación terminales (.? !).

  • Usa mayúsculas normales.

  • Mantenga los números, las fechas y los formatos comunes en forma escrita convencional.

  • Limite cada generación al menos a una oración o frase completa. Los fragmentos muy cortos tienden a sonar menos naturales.

No hagas lo siguiente:

  • Elimine los signos de puntuación o fuerce todo en mayúsculas.

  • Incluye caracteres marcados, JSON sin procesar, emojis o caracteres especiales.

  • Envía números, caracteres alfanuméricos o etiquetas ortográficas por sí solos sin contexto completo.

  • Pon el texto en negrita o cursiva; el motor intentará pronunciar los asteriscos.

  • Usa paréntesis, corchetes, corchetes, corchetes angulares y comillas.

Normalización automática

El motor lee los formatos escritos comunes como voz natural. La mayoría de las veces, no es necesario reformatearlos:

Normalización automática del texto
Tipo Pase esto El motor se lee como
Números grandes 1.234.567 «un millón doscientos treinta y cuatro mil...»
Números de teléfono (415) 555-1212 Ritmo natural del número de teléfono
Direcciones de correo electrónico user@example.com «usuario en el ejemplo punto com»
Fechas 04/20/2025 Locale-appropriate fecha de lectura
Times 7:00 P.M. «siete de la tarde»
Acrónimos NASA, EE. UU. Hablado como se esperaba
¿PORCENTAJES 12% «doce por ciento»
sugerencia

Las direcciones de correo electrónico se leen bien por escrito. También puedes indicarle a tu agente que escriba la forma oral directamente (por ejemplo, «usuario en el ejemplo punto com») si quieres tener un control preciso.

Etiquetas de control de voz

El motor de voz deduce automáticamente el ritmo y la emoción apropiados a partir del contenido de la transcripción. Utilice las etiquetas de control solo para casos de uso específicos en los que el valor predeterminado no sea el adecuado. Todas las etiquetas se colocan directamente en la transcripción.

Velocidad

Controla la velocidad de conversación. Rango: 0.6 (lento) a 1.5 (rápido). Predeterminado: 1.0.

<speed ratio="0.85"/>This call may be recorded for quality purposes.
Valores de velocidad
Valor Usar cuando
0.8 Lectura de información importante o lenguaje legal
1.0 Predeterminado: velocidad de conversación natural
1.2 Faster-paced diálogo

Para restablecer la velocidad después de reducir la velocidad:

<speed ratio="0.85"/>Important notice.<speed ratio="1.0"/>Now, how can I help?

Volume

Controla el volumen. Rango: 0,5 (silencioso) a 2,0 (alto). Predeterminado: 1.0.

<volume ratio="0.5"/>I'll speak softly for this part.

Pausas

Inserta pausas. Especifique la duración en segundos (s) o milisegundos (ms).

Your balance is $1,234.<break time="500ms"/>Your next payment is due June 15th.

Usa descansos para:

  • Pasar de un lado a otro de la información.

  • Antes del lenguaje legal o de cumplimiento.

  • Entre las opciones del menú de un IVR.

nota

La puntuación natural debe ser la primera herramienta para hacer una pausa. Una coma o un punto normalmente producen la pausa correcta. Es mejor reservar las etiquetas de interrupción para silencios explícitos de una duración específica.

Deletrea

Forza la lectura carácter por carácter de los códigos, identificaciones, números de teléfono o cualquier cadena que deba pronunciarse letra por letra.

Your confirmation code is <spell>TKT4829XB</spell>.

Para secuencias largas, añade un espacio dentro del envoltorio de la etiqueta ortográfica para insertar pausas:

Your phone number is <spell>(415)</spell><break time="200ms"/><spell>5551212</spell>.

Formatos alternativos (sin etiquetas):

  • Space-delimited: A B C 1 2 3

  • Agrupados con comas: A, B, C, 1, 2, 3.

  • Ralentizado y enunciado: A, B, C, 1, 2, 3

nota

El modelo trata el texto TODO EN MAYÚSCULAS de la misma manera que si <spell>lo envolviera en etiquetas: se leerá letra por letra. Por ejemplo, «ACME BANK» se pronunciaría como «» A-C-M-E B-A-N-K. Para que el modelo lo diga como una palabra, utilice mayúsculas estándar: «Acme Bank».

Emotion

El modelo deduce naturalmente el tono emocional del contenido; en la mayoría de los casos, no se necesitan etiquetas. Las etiquetas de emoción son una función beta y funcionan de manera más confiable cuando la emoción coincide con la transcripción.

<emotion value="sympathetic"/>I understand this is frustrating. Let me investigate that for you.

Emociones primarias: neutralangry,excited,content,sad, yscared.

Risa

[laughter]Insértala para producir una risa natural.

Oh, I've actually heard that one before! [laughter] Alright, let's get this sorted out.

Referencia de etiqueta

Referencia a la etiqueta de control de voz
Tag ¿Qué hace? Ejemplo
<speed ratio="X"/> Velocidad de habla (0,6—1,5) <speed ratio="0.85"/>
<volume ratio="X"/> Sonoridad (0,5—2,0) <volume ratio="1.5"/>
<break time="Xs"/> Pausa (segundos o ms) <break time="500ms"/>
<spell>...</spell> Character-by-character lectura <spell>AB12CD</spell>
<emotion value="X"/> Tono emocional <emotion value="content"/>
[laughter] Risa natural [laughter]

Etiquetas malformadas

  • Well-formed El motor procesa correctamente <...> las etiquetas incluidas entre las correspondientes.

  • Las etiquetas mal formadas o que no estén cerradas no se dejarán caer de forma silenciosa: el motor pronunciará en voz alta el texto mal formado.

  • Los envoltorios SSML no compatibles, como los que no son compatibles, no son necesarios y no deberían incluirse. <speak>...</speak>

sugerencia

Si el motor encuentra una etiqueta que no puede analizar, intentará leer el texto sin procesar, incluidos los fragmentos de la etiqueta. Compruebe siempre que sus etiquetas estén bien formadas.

Configuración de voz multilingüe

La voz de agencia de Amazon Connect incluye voces multilingües que pueden hablar varios idiomas y cambiar de uno a otro sin problemas en mitad de una conversación. La persona que llama puede empezar en inglés, cambiar a español y el agente seguirle la pista, sin necesidad de cambiar el flujo ni interrumpir. En el bloque Establecer voz, estas voces se etiquetan como voces políglotas. Esta guía utiliza el término voces multilingües para describirlas. En esta sección se explica cómo configurar voces multilingües y qué hay que tener en cuenta.

Voces multilingües

Las voces multilingües cambian de forma nativa entre los idiomas compatibles en una sola conversación. Use una voz multilingüe cuando su centro de atención necesite atender llamadas que hablen diferentes idiomas o cambie de idioma en mitad de una llamada.

Voces multilingües
Voz Gender Lenguajes admitidos
Katie Femenino Inglés, alemán, español, francés, hindi, italiano, japonés, noruego, portugués, ruso
Blake Masculino Inglés, alemán, español, francés, hindi, italiano, japonés, noruego, portugués, ruso
Brooke Femenino Inglés, alemán, español, francés, hindi, italiano, japonés, noruego, portugués, ruso
Ronald Masculino Inglés, alemán, español, francés, hindi, italiano, japonés, noruego, portugués, ruso
Gemma Femenino Inglés, alemán, español, francés, hindi, italiano, japonés, noruego, portugués, ruso

Configuración

Paso 1: Cree su bot de Amazon Lex en la configuración regional de la voz multilingüe

Si utiliza una voz multilingüe, solo necesitará una única configuración regional del bot de Amazon Lex. Cree su bot en la configuración regional que coincida con la voz multilingüe (por ejemplo, en-US o en-GB). No es necesario que añada todos los idiomas que admite la voz multilingüe como una configuración regional independiente en Amazon Lex.

Haga lo siguiente:

  • Crea tu bot en en-US (o en-GB si usas una voz multilingüe en inglés del Reino Unido).

  • Usa una única configuración regional. El agente de IA y la voz multilingüe gestionan las conversaciones multilingües sin tener que recurrir a ubicaciones adicionales de Amazon Lex.

No haga lo siguiente:

  • Añada configuraciones regionales de bots de Amazon Lex independientes para cada idioma que admita la voz multilingüe. Esto no es necesario: el agente de IA gestiona el cambio de idioma a través del mensaje.

Si necesitas admitir un idioma que no esté en la lista de idiomas admitidos por la voz multilingüe (por ejemplo, el tailandés o el tagalo), crea un bot independiente para esa configuración regional y usa una voz específica para esa región. Consulte Usar una voz de agente no multilingüe en una configuración regional que no sea el inglés.

Paso 2: relaciona la configuración regional del bot Lex con el bloque Set Voice

El atributo de idioma establecido en el bloque Set Voice debe coincidir con la configuración regional de su bot Lex. Si no coinciden, el bloque Get Customer Input devuelve un error. Actualiza el idioma del bloque de configuración de voz para que coincida con la configuración regional de tu bot.

Para voces multilingües creadas en una configuración regional en inglés:

  1. En el bloque Establecer voz, selecciona la voz multilingüe (por ejemplo, Brooke) y establece el idioma en inglés (EE. UU.).

  2. Tu bot Lex debe tener en-US como configuración regional integrada.

First-turn saludo

En el primer turno, el agente de IA no ha recibido ninguna entrada de la persona que llama. Sin la entrada, el agente no puede detectar el idioma de la persona que llama. La voz pronuncia el texto de saludo configurado en el bloque Get Customer Input. Si quieres que el bot salude a la persona que llama en un idioma específico, asegúrate de que el mensaje de saludo de ese bloque esté escrito en ese idioma.

Por ejemplo, si tu base de llamadas principal habla español, configura el saludo Get Customer Input en español:

Hola, gracias por llamar. ¿Cómo puedo ayudarle hoy?

Tras el primer turno, el agente de IA toma el control y detecta y sigue el idioma de la persona que llama durante el resto de la conversación.

Paso 3: Añade instrucciones para gestionar el idioma a la línea de comandos del sistema de agentes de IA

Añada una sección de gestión del idioma a la línea de comandos del sistema de su agente de IA. Esta sección regula el comportamiento multilingüe. El agente de IA detecta el idioma de la persona que llama a partir de la transcripción y responde en ese idioma.

Plantilla (personalízala según tu caso de uso):

You are connected to a multilingual voice that supports the following languages: English, German, Spanish, French, Hindi, Italian, Japanese, Norwegian, Portuguese, and Russian. Language handling rules: Detect the language of the caller's input from the transcription. If the caller speaks in one of the supported languages listed above, respond in that same language. If the caller speaks a language not in the supported list, respond in English and politely let them know you can assist in the supported languages. Always respond in one language at a time. Do not mix languages in a single response unless the caller mixes first. If the caller switches languages mid-conversation, follow their lead immediately. When responding in any non-English language, always use proper accent marks, diacritics, and locale-appropriate formatting (for example, é, ñ, ü, ç). This ensures the voice engine produces natural pronunciation. Keep English brand names, product names, codes, and identifiers in English. Do not translate them.
sugerencia

Enumera únicamente los idiomas que tu voz multilingüe realmente admite en el mensaje. Enumerar los idiomas no admitidos hace que el agente afirme que puede ayudar, pero el TTS produce un resultado poco natural.

Usar una voz de agente no multilingüe en una configuración regional que no sea el inglés

Si utiliza una voz de agencia que no es multilingüe (por ejemplo, una voz en tailandés, coreano o portugués), debe establecer explícitamente el atributo de idioma para que el sistema dirija al motor ASR correcto.

Opción A: configurar el bloqueo de voz

  1. Selecciona una voz que no sea inglesa (por ejemplo, una voz en tailandés para la configuración regional).

  2. Establece el idioma en la configuración regional correspondiente (por ejemplo, TH-th).

  3. Crea tu robot Lex con una configuración regional coincidente (TH-th).

Opción B: establecer el bloque de atributos de contacto

Si el bloque Establecer voz no muestra la configuración de idioma de su configuración, puede establecer el idioma utilizando el bloque Establecer atributos de contacto antes del bloque Obtener información del cliente:

  • Tipo: sistema

  • Atributo — Idioma

  • Valor: el código de configuración regional (por ejemplo, tl-ph para tagalo, th-th para tailandés)

Restringir a idiomas específicos

Si su centro de atención solo admite un subconjunto de idiomas, simplifique la solicitud:

You support English and Spanish on this line only. Detect the language of the caller's input. If the caller speaks English or Spanish, respond in that language. If the caller speaks any other language, respond in English: I apologize, but I can only assist in English or Spanish. How can I help you today? If the caller switches between English and Spanish, follow their lead. Use proper accent marks when responding in Spanish (á, é, í, ó, ú, ñ, ü). Keep brand names and codes in English.

Mensaje del sistema para los agentes de IA de Amazon Connect

Cuando los agentes de inteligencia artificial de Amazon Connect generen texto que se va a pronunciar, añada estas instrucciones de formato de voz a la solicitud del sistema de su agente. Copia y pega el bloque que aparece a continuación directamente en tu configuración de mensajes.

nota

Estas instrucciones son plantillas para empezar. Modifícalas según tu caso de uso, tono y requisitos empresariales específicos.

sugerencia

Para obtener orientación sobre cómo optimizar las indicaciones de su agente de IA para el rendimiento de voz y la latencia, consulteMejores prácticas de ingeniería rápidas para los agentes de IA.

Solicitud de formato de salida de voz

Speech Output Formatting Everything you output will be spoken aloud by text-to-speech. Follow these rules: GENERAL FORMATTING Use full sentences with normal capitalization. Always end with . ? or ! Use conventional written forms for numbers, dates, acronyms, symbols. Do NOT use markdown, bullet points, headers, bold, raw JSON, emoji, or special characters. Write plain prose only. SPELLING OUT CODES AND IDS For codes or IDs that must be read character-by-character, except for phone numbers, wrap in <spell> tags: Example: Your confirmation code is <spell>TKT4829XB</spell>. Was that the account ending in <spell>1234</spell>? THINGS TO AVOID Do not output bullet points, numbered lists, or structured formatting. Do not use asterisks, hashtags, or markdown syntax. Do not include internal thoughts, reasoning, or meta-commentary. Do not use parentheses, brackets, curly braces, or quotation marks. NATURALNESS Respond as if speaking directly to the caller. Keep responses concise. Avoid long monologues. Use natural transitions like: Let me check that for you. Or: Here is what I found.

Complemento multilingüe

Si tu bot usa una voz multilingüe, agrega lo siguiente al mensaje del sistema para habilitar las respuestas en varios idiomas:

Language Handling You are connected to a multilingual voice that supports: English, German, Spanish, French, Hindi, Italian, Japanese, Norwegian, Portuguese, and Russian. Detect the language of the caller input from the transcription. If the caller speaks in one of the supported locales, respond in that language. If the caller speaks a language not in the supported list, respond in English and politely let them know you can assist in English. Always respond in one language at a time. Do not mix multiple languages in a single response. If the caller switches languages mid-conversation, follow their lead and switch your responses to match. When responding in a non-English language, always use proper accent marks, diacritics, and locale-appropriate formatting. This ensures the voice engine produces natural, native-sounding pronunciation.

Ejemplos de centros de contacto

Saludo IVR

Hi, thanks for calling. How can I help you today?

No se necesitan etiquetas: el motor gestiona los saludos conversacionales de forma natural.

Aviso legal (lento)

<speed ratio="0.85"/>This call may be recorded for quality assurance purposes. By continuing, you consent to recording.

Empareje con la irregularidad desactivada en el nivel del flujo.

Volver a leer un número de cuenta

Con etiquetas ortográficas:

Your account number is <spell>1234</spell> <spell>5678</spell> <spell>9012</spell>.

Sin etiquetas ortográficas:

Your account number is 1 2 3 4, 5 6 7 8, 9 0 1 2.

Confirmación con código de referencia

I've created your ticket. Your reference number is <spell>TKT4829XB</spell>. Is there anything else I can help with?

Opciones de menú

Press 1 for billing.<break time="500ms"/>Press 2 for technical support.<break time="500ms"/>Press 3 to speak with an agent.

Deletrear el nombre de un cliente

Let me confirm — your last name is Smith, spelled <spell>SMITH</spell>. Is that correct?

Errores comunes al convertir texto en voz

Errores comunes de conversión de texto a voz
Error Por qué es malo Fix
Eliminar la puntuación Arruina el ritmo y la entonación Mantén la puntuación natural.
Texto TODO EN MAYÚSCULAS Cambia la forma en que lee el motor Usa mayúsculas normales.
Incluyendo la rebaja El motor habla de formatear caracteres Quítelo antes de enviarlo o dígale al agente que lo evite.
Transmisión de etiquetas incompletas Las etiquetas se leen en voz alta como texto Guarda en búfer los valores de etiqueta completos antes de enviarlos.
Emoción y contenido no coincidentes Produce resultados antinaturales Alinee la emoción con el contenido u omita.
Over-engineering el mensaje Puede reducir la naturalidad Comience de manera simple: añada etiquetas solo donde sea necesario.
Non-multilingual voz para varios idiomas La voz conserva el acento local principal Usa una voz multilingüe para la pronunciación nativa.
Envolver el texto en negrita o cursiva El motor pronuncia los asteriscos en voz alta Elimina todo el formato Markdown.
Enviar etiquetas mal formadas o sin cerrar El motor lee el texto de las etiquetas sin procesar Las etiquetas de validación están bien formadas con corchetes coincidentes.