View a markdown version of this page

Práticas recomendadas de voz agente - Amazon Connect Customer

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Práticas recomendadas de voz agente

A voz agente do Amazon Connect combina reconhecimento avançado de fala (ASR) com vozes expressivas e de som natural para oferecer uma experiência completa de inteligência artificial por voz. O ASR avançado fornece conversas naturais e de baixa latência em tempo real, enquanto o mecanismo de voz oferece uma fala realista em mais de 50 localidades. Juntos, esses componentes possibilitam interações perfeitas e humanas entre os chamadores e os agentes de IA do Amazon Connect. Este guia aborda a configuração e as melhores práticas para ambos os componentes, para que você possa aproveitar ao máximo a experiência completa de voz agente.

nota

Para usar os recursos de voz agente do Amazon Connect, certifique-se de que o Amazon Connect Customer esteja habilitado para sua instância. A voz agente do Amazon Connect é o provedor de voz padrão para clientes do Amazon Connect.

Este guia aborda:

  • Sintaxe de atributo de sessão para controles ASR.

  • Barge-in comportamento (interromper) e quando desativá-lo.

  • End-of-turn ajuste para Advanced ASR.

  • Dicas de idioma para reconhecimento de fala multilíngue.

  • Lidando com chamadas de ferramentas de longa duração.

  • Práticas recomendadas de formatação de texto para saída de voz.

  • Etiquetas de controle de fala para controle de voz refinado.

  • Solicitações do sistema para agentes de IA do Amazon Connect.

  • Exemplos de contact centers.

  • Configuração de voz multilíngue para suporte em vários idiomas.

Práticas recomendadas de reconhecimento avançado de fala (ASR)

A preferência do modelo de fala ASR avançado é um reconhecedor de streaming projetado para conversas naturais e de baixa latência em tempo real. Em vez de confiar apenas em uma janela fixa de silêncio, ele avalia a fala do chamador enquanto ele fala e prevê quando o chamador termina — o final do turno (EOT).

Sintaxe do atributo de sessão

Os controles nesta seção são definidos com atributos de sessão padrão do Lex V2 no x-amz-lex namespace. Você os define ao iniciar uma conversa e pode substituí-los em uma função do Lambda (por exemplo, para relaxar a detecção somente ao coletar um valor confidencial).

Defina o escopo de cada atributo para uma intenção e um espaço:

x-amz-lex:audio:<setting>:<intentName>:<slotToElicit>
  • Use * como intenção ou nome do slot para definir um padrão que se aplique a qualquer lugar.

  • Qualquer configuração específica de intenção ou slot tem precedência sobre uma configuração padrão. *

Faça:

  • Defina valores conservadores somente nos slots que precisam deles (por exemplo, um slot de número de conta) e deixe todo o resto como padrão.

  • Redefina os valores relaxados para o próximo slot após a conclusão de uma coleção sensível.

Não faça:

  • Aplique um único *:* padrão agressivo globalmente para fixar um slot — ele muda o ritmo a cada turno no bot.

Barge-in (interromper o comportamento)

Barge-in permite que o chamador interrompa uma mensagem que o bot está reproduzindo. Ele é ativado por padrão, o que geralmente é o que você deseja para uma conversa natural. Você o controla com:

x-amz-lex:allow-interrupt:<intentName>:<slotToElicit>

Padrão: true

Desative barge-in (false) quando:

  • Reproduzir linguagem legal, de conformidade ou de divulgação de gravações que deve ser ouvida na íntegra.

  • Lendo novamente uma confirmação de que o chamador não deve falar sobre o assunto.

Mantenha o barge-in ativado quando:

  • Talvez o chamador queira corrigir ou encurtar o bot no meio do prompt — o caso normal de uma conversa.

Exemplo

Para um agente de IA de autoatendimento, deixe o barge-in on anywhere por padrão. Desative-o somente quando uma solicitação precisar ser ouvida na íntegra — por exemplo, uma isenção de responsabilidade legal ou de conformidade. Defina os atributos ao iniciar a conversa. Mantenha o padrão ativado com uma *:* entrada e desative o barge-in somente com a intenção de reproduzir o aviso:

{ "sessionState": { "sessionAttributes": { "x-amz-lex:allow-interrupt:*:*": "true", "x-amz-lex:allow-interrupt:Disclaimer:*": "false" } } }

A entrada específica da intenção e do slot tem precedência sobre a *:* padrão, portanto, o chamador pode interromper em qualquer lugar, exceto enquanto a intenção está falando. Disclaimer Se, em vez disso, você definir o atributo de isenção de responsabilidade em uma função do Lambda, defina-o antes que o prompt de isenção de responsabilidade seja reproduzido. Redefina-o para true depois para que o resto da conversa permaneça interrompido.

nota

Uma nova solicitação com limite de tempo limite não é uma verdadeira intromissão. Um ponto comum de confusão: se um chamador ficar em silêncio e o substituto no final do turno for acionado, o bot poderá encerrar o turno ou solicitar novamente sozinho. Isso pode parecer uma interrupção, mas é a detecção de fim de turno que está sendo acionada, não o chamador entrando. A solução é quase sempre ajustar as configurações de final de turno — não o sinalizador de permissão de interrupção.

End-of-turn afinação

O ASR avançado termina um turno quando uma das condições é atendida primeiro:

  • End-of-turn limite de confiança — o modelo está confiante o suficiente de que o chamador terminou. Este é o sinal principal e é o que faz com que o som de turnos seja natural.

  • End-of-turn tempo limite de silêncio — o chamador ficou em silêncio durante o tempo configurado. Esse é o substituto (um chamador se arrastando ou ficando quieto).

End-of-turn configurações
Configuração Atributos da sessão Padrão Intervalo
End-of-turn limite de confiança x-amz-lex:audio:end-confidence-threshold 0.7 0,5—0,9
End-of-turn tempo limite de silêncio x-amz-lex:audio:end-timeout-ms 5.000 ms 500—10.000 ms

Valores mais altos fazem com que o bot espere mais e termine os turnos de forma mais conservadora (menos cortes prematuros, um pouco mais de latência). Valores mais baixos terminam mais cedo (menor latência, maior chance de interromper um chamador que faz uma pausa). O limite de confiança é a alavanca principal; o tempo limite de silêncio só importa quando a confiança ainda não terminou o turno.

Out-of-range comportamento:

  • end-confidence-thresholdfora de 0,5—0,9 é rejeitado com um erro de atributo de sessão inválido.

  • end-timeout-msabaixo de 500 ou acima de 10.000 é fixado silenciosamente ao valor suportado mais próximo.

Escolhendo valores

Escolhendo valores de final de turno
Cenário Configurações recomendadas Observações
Conversa natural Padrões (0,7/5.000 ms) Ajustado para uma tomada de turnos responsiva de uso geral.
Entrada sensível ou ditada (OTP, número da conta) limite: 0,9, tempo limite: 6.000—8.000 ms Tolera pausas. Reinicie para o próximo slot após a coleta.
Trocas curtas (yes/no, palavra única) limite: ~ 0,5, tempo limite: ~ 500 ms Curvas mais rápidas. Teste primeiro os pontos de corte prematuros.

Exemplo

Detecção conservadora de fim de turno para o AccountNumber slot da VerifyIdentity intenção:

{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:end-confidence-threshold:VerifyIdentity:AccountNumber": "0.9", "x-amz-lex:audio:end-timeout-ms:VerifyIdentity:AccountNumber": "7000" } } }

Um único padrão para cada intenção e slot:

{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:end-confidence-threshold:*:*": "0.8", "x-amz-lex:audio:end-timeout-ms:*:*": "800" } } }

Dicas de idioma para reconhecimento multilíngue

O ASR avançado reconhece vários idiomas na mesma conversa sem saber quais idiomas esperar. Ele detecta o idioma da fala do chamador, para que o chamador possa começar em inglês e mudar para o espanhol e a transcrição segue. Esse é o comportamento padrão e não precisa de configuração.

Se você já sabe quais idiomas seus chamadores usam, você pode direcionar o reconhecimento para eles com dicas de idioma. As dicas ajudam mais quando dois idiomas soam semelhantes. Eles também ajudam quando enunciados curtos — uma única palavra, um dígito, um yes/no — dão pouco ao modelo com que trabalhar. Você os configura com:

x-amz-lex:audio:locale-override:<intentName>:<slotToElicit>

Padrão: sem dicas — O ASR avançado detecta o idioma sozinho.

Defina o escopo do atributo da mesma forma que os outros controles nesta seção. Use *:* para influenciar cada turno da conversa ou nomeie uma intenção e um espaço para influenciar apenas os turnos em que você conhece o idioma esperado.

Formato de valor

Defina o valor para os códigos de idioma que você deseja usar, provavelmente primeiro. Use uma lista separada por vírgulas, opcionalmente entre colchetes e aspas, se isso for mais fácil de produzir a partir do seu fluxo ou da função Lambda. O ASR avançado ignora os espaços em branco circundantes e trata os sublinhados como hífens, portanto, são equivalentes. pt_BR pt-BR

A tabela a seguir mostra exemplos de valores de atributos e os idiomas para os quais cada um deles influencia o Advanced ASR.

Valores de dicas de idioma
Valor de atributo Idiomas O ASR avançado é tendencioso para
Atributo não definido Nenhum. O ASR avançado detecta o idioma da fala do chamador.
es,en-US Espanhol e depois inglês americano
["ja"] Japonesa
[ "es" , "en" ] Espanhol, depois inglês
fr, de , it Francês, depois alemão, depois italiano
Validação
  • Cada entrada deve ter um código de idioma válido. Use um código base de duas ou três letras, opcionalmente seguido por um hífen e uma subtag de região — por exemplo,, ou. es en-US pt-BR

  • As entradas que não corresponderem ao formulário serão descartadas e as entradas válidas restantes ainda serão aplicadas. Se nenhuma entrada válida permanecer, a conversa prosseguirá sem dicas, em vez de falhar.

  • O ASR avançado passa e ignora um código bem formado que ele não reconhece. O código não produz um erro, mas também não distorce o reconhecimento, portanto, verifique os códigos que você envia.

  • O ASR avançado remove duplicatas. Ele aplica no máximo 10 dicas e ignora qualquer uma além da décima.

Exemplo

O exemplo a seguir distorce o reconhecimento de uma linha cujos chamadores falam espanhol ou inglês, sendo o espanhol o idioma mais comum:

{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:locale-override:*:*": "es,en-US" } } }
Faça
  • Deixe o atributo não definido, a menos que você tenha um motivo específico para influenciar o reconhecimento. A detecção lida com a maioria das conversas multilíngues.

  • Liste apenas os idiomas que seus chamadores realmente falam, provavelmente primeiro.

Não
  • Liste idiomas além daqueles que seus chamadores realmente falam. Uma lista longa dilui o preconceito e elimina o benefício de definir dicas.

  • Envie uma única dica para bloquear a conversa em um idioma. Uma dica influencia o reconhecimento; ela não o restringe. Para restringir os idiomas em que o agente de IA responde, consulteRestringindo a idiomas específicos.

dica

As dicas de linguagem influenciam o reconhecimento de fala — o que o bot ouve. Eles não mudam o idioma que o bot fala. Para o idioma de resposta, use o prompt do sistema do agente de IA e uma voz multilíngue. Consulte Configuração de voz multilíngue.

Lidando com chamadas de ferramentas de longa duração

Quando um agente de IA ou Lambda faz uma chamada de ferramenta de longa duração (uma pesquisa de back-end, uma API externa, uma invocação de modelo) antes que o bot esteja pronto para ouvir, o chamador fica em silêncio. Para o chamador, pode parecer que o bot parou ou falou sobre ele quando finalmente responde.

Mitigações:

  • Conclua o trabalho de longa duração antes que o bot abra o microfone. Conclua a chamada da ferramenta antes que o bot selecione o próximo slot.

  • Toque um aviso de espera ou preenchimento (“Um momento enquanto eu puxo isso para cima...”) para que o chamador não fique sentado em silêncio.

  • Ative o preenchimento de sons de áudio durante chamadas de ferramentas ou turno a turno.

  • Mantenha o barge-in ativado por meio dessas etapas para que, se o chamador falar durante uma solicitação de preenchimento, ele possa prosseguir.

dica

Valide a latência de ponta a ponta com suas chamadas reais de ferramentas. O objetivo é que o chamador nunca fique no ar morto esperando no back-end.

Referência rápida de atributos de sessão ASR

Referência rápida de atributos de sessão ASR
Atributo Padrão Observações
x-amz-lex:allow-interrupt:<intent>:<slot> true Barge-in. Definido false para isenções de responsabilidade.
x-amz-lex:audio:end-confidence-threshold:<intent>:<slot> 0.7 Sinal EOT primário. Intervalo de 0,5 a 0,9. Out-of-range rejeitado.
x-amz-lex:audio:end-timeout-ms:<intent>:<slot> 5.000 ms Recuo do EOT. Alcance de 500 a 10.000 ms. Out-of-range preso.
x-amz-lex:audio:locale-override:<intent>:<slot> Não definido A linguagem sugere um reconhecimento tendencioso. Comma-separated códigos, máx. 10.

Erros comuns de ASR

Erros comuns de ASR
Erro Por que é ruim Correção
Limite de confiança baixo ao coletar dígitos ditados O bot interrompe o chamador entre os grupos Aumente a confiança e o tempo limite nesse slot, reinicie depois.
Desativando o barge-in globalmente O chamador não consegue corrigir o bot em nenhum lugar Desative somente quando disclaimer/compliance solicitado.
Aplicando um *:* padrão para corrigir um slot Muda o ritmo de todo o bot Defina o escopo do atributo para o específico intent/slot.
Definindo limite fora de 0,5—0,9 A solicitação foi rejeitada com um erro Mantenha-o ao alcance. Apenas end-timeout-ms aperta silenciosamente.
Deixar a janela de entrada aberta durante uma longa chamada de ferramenta O chamador está sentado no ar morto Conclua a chamada da ferramenta primeiro ou reproduza um prompt de preenchimento.
Tratar uma nova solicitação de EOT como uma verdadeira intromissão Correção errada aplicada para permitir a interrupção Em vez disso, ajuste as configurações de final de turno.
Listando vários idiomas em locale-override Dilui o viés que foi definido para fornecer Liste apenas os idiomas que os chamadores falam, provavelmente primeiro.

Práticas recomendadas para mensagens de voz

A voz agente do Amazon Connect oferece conversão de texto em fala expressiva e com som natural em mais de 50 localidades. O mecanismo normaliza automaticamente o texto escrito em fala natural. Na maioria dos casos, você pode passar o texto como está e obter ótimos resultados sem nenhuma formatação especial.

Formatação de texto

Regras gerais

Passe um texto natural e bem pontuado. Frases completas com capitalização e pontuação normais produzem o melhor ritmo e entonação.

Faça:

  • Use frases completas com pontuação terminal (.? !).

  • Use letras maiúsculas normais.

  • Mantenha números, datas e formatos comuns na forma escrita convencional.

  • Mantenha cada geração com pelo menos uma frase ou frase completa. Fragmentos muito curtos tendem a parecer menos naturais.

Não faça:

  • Retire a pontuação ou force TODAS AS LETRAS EM MAIÚSCULAS.

  • Inclua markdown, JSON bruto, emoji ou caracteres especiais.

  • Envie números, números alfanuméricos ou etiquetas ortográficas sozinhos, sem contexto completo.

  • Embrulhe o texto em negrito ou itálico — o mecanismo tentará falar os asteriscos.

  • Use parênteses, colchetes, chaves onduladas, colchetes angulares e aspas.

Normalização automática

O mecanismo lê formatos escritos comuns como fala natural. Na maioria das vezes, você não precisa reformatá-los:

Normalização automática de texto
Tipo Passe isso O motor é lido como
Números grandes 1.234.567 “um milhão duzentos e trinta e quatro mil...”
Números de telefone (415) 555-1212 Ritmo natural do número de telefone
Endereços de e-mail user@example.com “usuário no exemplo dot com”
Datas 04/20/2025 Locale-appropriate leitura de data
Times 19:00 “sete da tarde”
Acrônimos NASA, EUA Falou conforme o esperado
Porcentagens 12% “doze por cento”
dica

Os endereços de e-mail são bem lidos por escrito. Você também pode instruir seu agente a emitir a forma falada diretamente (por exemplo, “usuário no exemplo dot com”) se quiser um controle preciso.

Etiquetas de controle de fala

O mecanismo de voz deduz automaticamente o ritmo e a emoção apropriados a partir do conteúdo da transcrição. Use tags de controle somente para casos de uso específicos em que o padrão não seja satisfatório. Todas as tags são colocadas diretamente na transcrição.

Velocidade

Controle a taxa de fala. Intervalo: 0,6 (lento) a 1,5 (rápido). Padrão: 1.0.

<speed ratio="0.85"/>This call may be recorded for quality purposes.
Valores de velocidade
Valor Use quando
0.8 Lendo informações importantes ou linguagem jurídica
1,0 Padrão — velocidade de conversação natural
1.2 Faster-paced diálogo

Para redefinir a velocidade depois de diminuir a velocidade:

<speed ratio="0.85"/>Important notice.<speed ratio="1.0"/>Now, how can I help?

Volume

Controle o volume. Alcance: 0,5 (silencioso) a 2,0 (alto). Padrão: 1.0.

<volume ratio="0.5"/>I'll speak softly for this part.

Pausas

Insira pausas. Especifique a duração em segundos (s) ou milissegundos (ms).

Your balance is $1,234.<break time="500ms"/>Your next payment is due June 15th.

Use pausas para:

  • Ritmo entre as informações.

  • Antes da linguagem legal ou de conformidade.

  • Entre as opções de menu em um IVR.

nota

A pontuação natural deve ser a primeira ferramenta para pausar. Uma vírgula ou ponto final geralmente produz a pausa correta. As tags de interrupção são melhor reservadas para silêncios explícitos de duração específica.

Feitiço

Força a leitura caractere por caractere de códigos, IDs, números de telefone ou qualquer sequência de caracteres que deva ser falada letra por letra.

Your confirmation code is <spell>TKT4829XB</spell>.

Para sequências longas, adicione um espaço dentro do invólucro da etiqueta ortográfica para inserir pausas:

Your phone number is <spell>(415)</spell><break time="200ms"/><spell>5551212</spell>.

Formatos alternativos (sem tags):

  • Space-delimited: ABC 1 2 3

  • Agrupados com vírgulas: A B C, 1 2 3.

  • Desacelerado e enunciado: A, B, C, 1, 2, 3

nota

O modelo trata o texto em MAIÚSCULAS da mesma forma que embrulhá-lo em <spell>etiquetas — ele será lido letra por letra. Por exemplo, “ACME BANK” seria falado como "A-C-M-E B-A-N-K.” Para que o modelo fale isso como uma palavra, use a capitalização padrão: “Acme Bank”.

Emotion

O modelo naturalmente deduz o tom emocional do conteúdo — não são necessárias tags na maioria dos casos. As etiquetas de emoção são um recurso beta e funcionam de forma mais confiável quando a emoção corresponde à transcrição.

<emotion value="sympathetic"/>I understand this is frustrating. Let me investigate that for you.

Emoções primárias: neutral angry excitedcontent,sad,, scared e.

Risada

Insira [laughter] para produzir uma risada natural.

Oh, I've actually heard that one before! [laughter] Alright, let's get this sorted out.

Referência de tag

Referência de etiqueta de controle de fala
Tag O que ela faz Exemplo
<speed ratio="X"/> Taxa de fala (0,6—1,5) <speed ratio="0.85"/>
<volume ratio="X"/> Volume (0,5—2,0) <volume ratio="1.5"/>
<break time="Xs"/> Pausa (segundos ou ms) <break time="500ms"/>
<spell>...</spell> Character-by-character leia <spell>AB12CD</spell>
<emotion value="X"/> Tom emocional <emotion value="content"/>
[laughter] Risada natural [laughter]

Etiquetas malformadas

  • Well-formed as etiquetas incluídas na correspondência <...> são processadas corretamente pelo mecanismo.

  • Etiquetas malformadas ou não fechadas não serão descartadas silenciosamente — o mecanismo falará o texto malformado em voz alta.

  • Os invólucros SSML não suportados não <speak>...</speak> são obrigatórios e não devem ser incluídos.

dica

Se o mecanismo encontrar uma tag que não possa analisar, ele tentará falar o texto bruto, incluindo fragmentos de tag. Sempre valide se suas tags estão bem formadas.

Configuração de voz multilíngue

A voz agente do Amazon Connect inclui vozes multilíngues que podem falar vários idiomas e alternar entre eles sem problemas durante uma conversa. Um chamador pode começar em inglês, mudar para o espanhol e o agente segue, sem necessidade de alterações de fluxo ou interrupções. No bloco Definir voz, essas vozes são rotuladas como vozes poliglotas. Este guia usa o termo vozes multilíngues para descrevê-las. Esta seção aborda como configurar vozes multilíngues e o que observar.

Vozes multilíngues

Vozes multilíngues alternam nativamente entre os idiomas suportados em uma única conversa. Use uma voz multilíngue quando sua central de atendimento precisar lidar com chamadores que falam idiomas diferentes ou trocam de idioma no meio da chamada.

Vozes multilíngues
Voz Gender Idiomas compatíveis
Katie Feminino Inglês, alemão, espanhol, francês, hindi, italiano, japonês, norueguês, português, russo
Blake Masculino Inglês, alemão, espanhol, francês, hindi, italiano, japonês, norueguês, português, russo
Brooke Feminino Inglês, alemão, espanhol, francês, hindi, italiano, japonês, norueguês, português, russo
Ronald Masculino Inglês, alemão, espanhol, francês, hindi, italiano, japonês, norueguês, português, russo
Gemma Feminino Inglês, alemão, espanhol, francês, hindi, italiano, japonês, norueguês, português, russo

Configuração

Etapa 1: Crie seu bot Amazon Lex na localidade da voz multilíngue

Se você usa uma voz multilíngue, só precisa de uma única localidade de bot do Amazon Lex. Crie seu bot na localidade que corresponda à voz multilíngue (por exemplo, en-US ou en-GB). Você não precisa adicionar todos os idiomas suportados pela voz multilíngue como uma localidade separada no Amazon Lex.

Faça:

  • Crie seu bot em en-US (ou en-GB se estiver usando uma voz multilíngue em inglês do Reino Unido).

  • Use um único local. O agente de IA e a voz multilíngue lidam com conversas multilíngues sem localidades adicionais do Amazon Lex.

Não faça:

  • Adicione localidades separadas de bots do Amazon Lex para cada idioma compatível com a voz multilíngue. Isso é desnecessário — o agente de IA lida com a troca de idioma por meio do prompt.

Se você precisar oferecer suporte a um idioma que não esteja na lista de idiomas suportados pela voz multilíngue (por exemplo, tailandês ou tagalo), crie um bot separado para esse local e use uma voz específica do local. Consulte Usando uma voz agente não multilíngue em um local que não seja o inglês.

Etapa 2: combine a localização do bot Lex com o bloco Set Voice

O atributo de idioma definido no bloco Set Voice deve corresponder à localidade do seu bot Lex. Se eles não corresponderem, o bloco Obter entrada do cliente retornará um erro. Atualize o idioma do bloco Set Voice para corresponder à localização do seu bot.

Para vozes multilíngues criadas em uma localidade em inglês:

  1. No bloco Definir voz, selecione a voz multilíngue (por exemplo, Brooke) e defina o idioma como inglês (EUA).

  2. Seu bot Lex deve ter en-US como um local construído.

First-turn saudação

No primeiro turno, o agente de IA não recebeu nenhuma entrada do chamador. Sem entrada, o agente não consegue detectar o idioma do chamador. A voz fala o texto de saudação configurado no bloco Obter entrada do cliente. Se você quiser que o bot cumprimente o chamador em um idioma específico, certifique-se de que a mensagem de saudação nesse bloco esteja escrita nesse idioma.

Por exemplo, se sua base de chamadas principal fala espanhol, configure a saudação Get Customer Input em espanhol:

Hola, gracias por llamar. ¿Cómo puedo ayudarle hoy?

Após o primeiro turno, o agente de IA assume o controle, detecta e segue o idioma do chamador pelo resto da conversa.

Etapa 3: adicionar instruções de tratamento de linguagem ao prompt do sistema do agente de IA

Adicione uma seção de tratamento de idiomas ao prompt do sistema do seu agente de IA. Esta seção orienta o comportamento multilíngue. O agente de IA detecta o idioma do chamador a partir da transcrição e responde nesse idioma.

Modelo (personalize para seu caso de uso):

You are connected to a multilingual voice that supports the following languages: English, German, Spanish, French, Hindi, Italian, Japanese, Norwegian, Portuguese, and Russian. Language handling rules: Detect the language of the caller's input from the transcription. If the caller speaks in one of the supported languages listed above, respond in that same language. If the caller speaks a language not in the supported list, respond in English and politely let them know you can assist in the supported languages. Always respond in one language at a time. Do not mix languages in a single response unless the caller mixes first. If the caller switches languages mid-conversation, follow their lead immediately. When responding in any non-English language, always use proper accent marks, diacritics, and locale-appropriate formatting (for example, é, ñ, ü, ç). This ensures the voice engine produces natural pronunciation. Keep English brand names, product names, codes, and identifiers in English. Do not translate them.
dica

Liste apenas os idiomas que sua voz multilíngue realmente suporta no prompt. Listar idiomas não suportados faz com que o agente afirme que isso pode ajudar, mas o TTS produz uma saída não natural.

Usando uma voz agente não multilíngue em um local que não seja o inglês

Se você estiver usando uma voz agente que não seja multilíngue (por exemplo, uma voz tailandesa, coreana ou portuguesa), defina explicitamente o atributo de idioma para que o sistema encaminhe para o mecanismo ASR correto.

Opção A: definir bloqueio de voz

  1. Selecione sua voz que não seja inglesa (por exemplo, uma voz tailandesa para a décima terceira localidade).

  2. Defina o idioma para a localidade correspondente (por exemplo, th-TH).

  3. Crie seu bot Lex com uma localidade correspondente (Th-th).

Opção B: Definir bloco de atributos de contato

Se o bloco Definir voz não expor a configuração de idioma da sua configuração, você poderá definir o idioma usando o bloco Definir atributos de contato antes do bloco Obter entrada do cliente:

  • Tipo — Sistema

  • Atributo — Idioma

  • Valor — O código local (por exemplo, TL-ph para tagalo, th-TH para tailandês)

Restringindo a idiomas específicos

Se sua central de atendimento oferecer suporte apenas a um subconjunto de idiomas, simplifique a solicitação:

You support English and Spanish on this line only. Detect the language of the caller's input. If the caller speaks English or Spanish, respond in that language. If the caller speaks any other language, respond in English: I apologize, but I can only assist in English or Spanish. How can I help you today? If the caller switches between English and Spanish, follow their lead. Use proper accent marks when responding in Spanish (á, é, í, ó, ú, ñ, ü). Keep brand names and codes in English.

Solicitação do sistema para agentes de IA do Amazon Connect

Quando os agentes de IA do Amazon Connect gerarem um texto que será falado, adicione essas instruções de formatação de fala ao prompt do sistema do seu agente. Copie e cole o bloco abaixo diretamente na configuração do prompt.

nota

Essas instruções são modelos para você começar. Modifique-os de acordo com seu caso de uso, tom e requisitos comerciais específicos.

dica

Para obter orientação sobre como otimizar sua solicitação de agente de IA para desempenho e latência de voz, consulte. Melhores práticas imediatas de engenharia para agentes de IA

Aviso de formatação de saída de fala

Speech Output Formatting Everything you output will be spoken aloud by text-to-speech. Follow these rules: GENERAL FORMATTING Use full sentences with normal capitalization. Always end with . ? or ! Use conventional written forms for numbers, dates, acronyms, symbols. Do NOT use markdown, bullet points, headers, bold, raw JSON, emoji, or special characters. Write plain prose only. SPELLING OUT CODES AND IDS For codes or IDs that must be read character-by-character, except for phone numbers, wrap in <spell> tags: Example: Your confirmation code is <spell>TKT4829XB</spell>. Was that the account ending in <spell>1234</spell>? THINGS TO AVOID Do not output bullet points, numbered lists, or structured formatting. Do not use asterisks, hashtags, or markdown syntax. Do not include internal thoughts, reasoning, or meta-commentary. Do not use parentheses, brackets, curly braces, or quotation marks. NATURALNESS Respond as if speaking directly to the caller. Keep responses concise. Avoid long monologues. Use natural transitions like: Let me check that for you. Or: Here is what I found.

Complemento multilíngue

Se seu bot usa uma voz multilíngue, adicione o seguinte ao prompt do sistema para ativar respostas em vários idiomas:

Language Handling You are connected to a multilingual voice that supports: English, German, Spanish, French, Hindi, Italian, Japanese, Norwegian, Portuguese, and Russian. Detect the language of the caller input from the transcription. If the caller speaks in one of the supported locales, respond in that language. If the caller speaks a language not in the supported list, respond in English and politely let them know you can assist in English. Always respond in one language at a time. Do not mix multiple languages in a single response. If the caller switches languages mid-conversation, follow their lead and switch your responses to match. When responding in a non-English language, always use proper accent marks, diacritics, and locale-appropriate formatting. This ensures the voice engine produces natural, native-sounding pronunciation.

Exemplos de contact centers

Saudação IVR

Hi, thanks for calling. How can I help you today?

Sem necessidade de tags — o mecanismo lida com saudações conversacionais naturalmente.

Aviso legal (desacelerado)

<speed ratio="0.85"/>This call may be recorded for quality assurance purposes. By continuing, you consent to recording.

Emparelhe com a barcaça desativada no nível do fluxo.

Lendo o número de uma conta

Com etiquetas ortográficas:

Your account number is <spell>1234</spell> <spell>5678</spell> <spell>9012</spell>.

Sem etiquetas ortográficas:

Your account number is 1 2 3 4, 5 6 7 8, 9 0 1 2.

Confirmação com código de referência

I've created your ticket. Your reference number is <spell>TKT4829XB</spell>. Is there anything else I can help with?

Opções de menu

Press 1 for billing.<break time="500ms"/>Press 2 for technical support.<break time="500ms"/>Press 3 to speak with an agent.

Soletrar o nome de um cliente

Let me confirm — your last name is Smith, spelled <spell>SMITH</spell>. Is that correct?

Erros comuns de conversão de texto em fala

Erros comuns de conversão de texto em fala
Erro Por que é ruim Correção
Removendo a pontuação Estraga o ritmo e a entonação Mantenha a pontuação natural.
Texto em maiúsculas Muda a forma como o motor lê Use letras maiúsculas normais.
Incluindo remarcação O motor fala formatando caracteres Tire a roupa antes de enviar ou instrua o agente a evitar.
Streaming de tags incompletas As tags são lidas em voz alta como texto Armazene em buffer os valores completos da tag antes de enviar.
Emoção e conteúdo incompatíveis Produz resultados não naturais Alinhe a emoção com o conteúdo ou omita.
Over-engineering o prompt Pode reduzir a naturalidade Comece de forma simples: adicione tags somente quando necessário.
Non-multilingual voz para vários idiomas A voz mantém o sotaque local primário Use uma voz multilíngue para a pronúncia nativa.
Quebrando o texto em markdown, negrito ou itálico O motor fala os asteriscos em voz alta Remova toda a formatação markdown.
Envio de tags malformadas ou não fechadas O motor fala o texto bruto da tag As etiquetas de validação estão bem formadas com colchetes correspondentes.