本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
客服人員語音最佳實務
Amazon Connect 代理語音結合了進階語音辨識 (ASR) 和表達式自然聲音,可提供完整的語音 AI 體驗。進階 ASR 可在即時對話中提供自然、低延遲的輪換,而語音引擎則可跨 50 多個區域提供栩栩如生的語音。這些元件共同推動發起人和 Amazon Connect AI 客服人員之間的無縫、類似人類的互動。本指南涵蓋兩個元件的組態和最佳實務,因此您可以充分利用完整的客服人員語音體驗。
注意
若要使用 Amazon Connect 代理語音功能,請確定已為您的執行個體啟用 Amazon Connect Customer。Amazon Connect 代理語音是 Amazon Connect Customer 的預設語音提供者。
本指南涵蓋:
ASR 控制項的工作階段屬性語法。
插斷 (中斷) 行為和停用時機。
進階 ASR End-of-turn調校。
多語言語音辨識的語言提示。
處理長時間執行的工具呼叫。
語音輸出的文字格式最佳實務。
用於精細語音控制的語音控制標籤。
Amazon Connect AI 代理器的系統提示。
聯絡中心範例。
多語言語音組態,提供多語言支援。
進階語音辨識 (ASR) 最佳實務
進階 ASR 語音模型偏好設定是串流辨識器,專為自然、低延遲的即時對話轉向而設計。它不會只依賴固定的靜音時段,而是在來電者說話時評估來電者的語音,並預測來電者何時完成 — 轉彎結束 (EOT)。
工作階段屬性語法
本節中的控制項是以 x-amz-lex 命名空間中的標準 Lex V2 工作階段屬性設定。您可以在開始對話時設定它們,並在 Lambda 函數中覆寫它們 (例如,僅在收集敏感值時放寬偵測)。
將每個屬性範圍限定為意圖和槽:
x-amz-lex:audio:<setting>:<intentName>:<slotToElicit>
使用
*做為意圖或槽名稱,以設定適用於所有位置的預設 。任何意圖或插槽特定設定優先於
*預設值。
執行:
僅在需要它們的槽 (例如,帳戶編號槽) 上設定保守值,並將所有其他值保留為預設值。
敏感集合完成後,重設下一個槽的寬鬆值。
不要:
全域套用單一積極
*:*預設來修正一個槽 — 它會變更機器人中每個轉彎的步調。
插斷 (中斷行為)
插入可讓呼叫者中斷機器人正在播放的提示。它預設為啟用,這通常是您想要自然對話的內容。您可以使用下列方法控制它:
x-amz-lex:allow-interrupt:<intentName>:<slotToElicit>
預設:true
在下列情況下停用插入 (false):
必須完整聆聽的播放法律、合規或錄音揭露語言。
回讀呼叫者不應交談的確認。
在下列情況下保持啟用插入:
發起人可能想要更正或捷徑機器人提示中 — 正常的對話案例。
範例
對於自助式 AI 代理器,預設情況下將插斷提示保留在任何地方。只有在必須完全聽到提示時才停用,例如法律或合規免責聲明。在開始對話時設定屬性。使用 *:*項目保持預設值開啟,並僅為播放免責聲明的意圖關閉插斷提示:
{ "sessionState": { "sessionAttributes": { "x-amz-lex:allow-interrupt:*:*": "true", "x-amz-lex:allow-interrupt:Disclaimer:*": "false" } } }
意圖和位置特定的項目優先於*:*預設值,因此發起人可以在任何地方中斷,除非Disclaimer意圖正在說話。如果您改為在 Lambda 函數中設定免責聲明屬性,請在免責聲明提示播放之前進行設定。true 之後將其重設為 ,以便其餘對話保持中斷。
注意
逾時驅動的重新提示不是真正的插斷。常見的混淆點:如果發起人靜音,且end-of-turn起火,機器人可能會自行結束轉彎或重新提示。這可能看起來像是中斷,但它是end-of-turn偵測發射,而不是發起人插斷。修正幾乎總是調校end-of-turn設定,而不是允許中斷旗標。
End-of-turn調校
先滿足任一條件時,進階 ASR 會結束轉彎:
End-of-turn可信度閾值 — 模型有足夠的可信度,足以讓發起人完成。這是主要訊號,也是讓轉彎變得自然的原因。
End-of-turn靜音逾時 — 發起人在設定的時間內保持靜音。這是備用 (來電者落後或安靜)。
| 設定 | 工作階段屬性 | 預設 | 範圍 |
|---|---|---|---|
| End-of-turn可信度閾值 | x-amz-lex:audio:end-confidence-threshold |
0.7 | 0.5–0.9 |
| End-of-turn靜音逾時 | x-amz-lex:audio:end-timeout-ms |
5,000 毫秒 | 500–10,000 毫秒 |
值越高,機器人等待時間越長,結束轉彎越保守 (過早截止越少,延遲越長)。較低的值結束時間會更快 (延遲較低,切斷暫停的來電者的機率較高)。可信度閾值是主要控制桿;只有在可信度尚未結束時,靜音逾時才很重要。
Out-of-range行為:
end-confidence-threshold0.5–0.9 外部會因無效的工作階段屬性錯誤而遭到拒絕。end-timeout-ms低於 500 或高於 10,000 會無提示地固定到最接近支援的值。
選擇值
| 案例 | 建議設定 | 備註 |
|---|---|---|
| 自然對話 | 預設 (0.7 / 5,000 毫秒) | 針對回應式一般用途輪換進行調校。 |
| 敏感或口述輸入 (OTP、帳戶號碼) | 閾值:0.9,逾時:6,000–8,000 毫秒 | 容忍暫停。收集後為下一個槽重設 。 |
| 短交換 (是/否,單字) | 閾值:~0.5,逾時:~500 毫秒 | 轉彎速度更快。先測試過早截止值。 |
範例
VerifyIdentity 意圖AccountNumber槽的保守end-of-turn偵測:
{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:end-confidence-threshold:VerifyIdentity:AccountNumber": "0.9", "x-amz-lex:audio:end-timeout-ms:VerifyIdentity:AccountNumber": "7000" } } }
每個意圖和槽的單一預設值:
{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:end-confidence-threshold:*:*": "0.8", "x-amz-lex:audio:end-timeout-ms:*:*": "800" } } }
多語言辨識的語言提示
進階 ASR 會在相同對話中辨識多種語言,而不會得知預期使用哪種語言。它從發起人的語音中偵測語言,因此發起人可以用英文開始並切換到西班牙文,然後轉錄如下。這是預設行為,不需要組態。
如果您已經知道發起人使用的語言,您可以使用語言提示來偏差辨識。當兩種語言聽起來很類似時,提示大有幫助。當短語 - 單字、數字、是/否 - 讓模型幾乎沒有用處時,它們也很有幫助。您可以使用 來設定它們:
x-amz-lex:audio:locale-override:<intentName>:<slotToElicit>
預設:無提示 — 進階 ASR 會自行偵測語言。
以與本節中其他控制項相同的方式範圍 屬性。使用 *:* 來偏差對話中的每個回合,或命名意圖和槽,只偏差您知道預期語言的回合。
值格式
將 值設定為您想要偏差的語言代碼,最有可能是先。使用逗號分隔的清單,如果括號和引號更容易從流程或 Lambda 函數產生,則選擇性地用括號和引號括住。進階 ASR 會忽略周圍的空格,並將底線視為連字號,因此 pt_BR和 pt-BR相等。
下表顯示屬性值範例,以及每個屬性值都會偏差進階 ASR 的語言。
| 屬性值 | 進階 ASR 偏向的語言 |
|---|---|
| 未設定屬性 | 無。進階 ASR 會從來電者的語音偵測語言。 |
es,en-US |
西班牙文,然後美國英文 |
["ja"] |
日文 |
[ "es" , "en" ] |
西班牙文,然後英文 |
fr, de , it |
法文、德文、義大利文 |
驗證
每個項目必須是有效的語言代碼。使用兩個或三個字母的基本代碼,選擇性地後面接著連字號和區域子標籤,例如
es、en-US或pt-BR。不符合該表單的項目會遭到捨棄,剩餘的有效項目仍會套用。如果沒有有效的項目,則對話會以無提示繼續,而不是失敗。
進階 ASR 會傳遞並忽略其無法辨識的格式良好的程式碼。程式碼不會產生錯誤,但也不會偏差辨識,因此請驗證您傳送的程式碼。
進階 ASR 會移除重複項目。它最多套用 10 個提示,並忽略第十個以外的任何提示。
範例
下列範例會偏向辨識呼叫者會說西班牙文或英文的行,而西班牙文是更常見的語言:
{ "sessionState": { "sessionAttributes": { "x-amz-lex:audio:locale-override:*:*": "es,en-US" } } }
執行
除非您有特定的偏差辨識原因,否則請取消設定屬性。偵測可處理大多數多語言對話。
僅列出來電者實際說的語言,最有可能是先。
不要
列出來電者實際說話以外的語言。長清單會排除偏差,並完全移除設定提示的好處。
傳送單一提示以將對話鎖定為一種語言。提示會偏差辨識;不會限制辨識。若要限制 AI 代理器回應的語言,請參閱 限制為特定語言。
提示
語言提示偏差語音辨識 - 機器人聽到的內容。它們不會變更機器人說的語言。對於回應語言,請使用 AI 代理程式系統提示和多語言語音。請參閱 多語言語音組態。
處理長時間執行的工具呼叫
當 AI 代理器或 Lambda 在機器人準備好接聽之前進行長時間執行的工具呼叫 (後端查詢、外部 API、模型調用) 時,發起人會安靜地坐著。對於發起人,這可能感覺機器人在最終回應時停滯或交談。
緩解措施:
在機器人開啟麥克風之前完成長時間執行的工作。在機器人引出下一個槽之前完成工具呼叫。
播放保留或填充提示 (「我提取時一會兒...」),讓發起人不會安靜地坐著。
在工具呼叫期間或輪流啟用填充音訊聲音。
透過這些步驟保持啟用插斷,以便如果發起人在填充提示期間說話,他們可以移動物件。
提示
使用實際的工具呼叫end-to-end延遲。目標是呼叫者永遠不會留在死空氣中等待後端。
ASR 工作階段屬性快速參考
| 屬性 | 預設 | 備註 |
|---|---|---|
x-amz-lex:allow-interrupt:<intent>:<slot> |
true | 插斷提示。false 為免責聲明設定 。 |
x-amz-lex:audio:end-confidence-threshold:<intent>:<slot> |
0.7 | 主要 EOT 訊號。範圍 0.5–0.9。Out-of-range遭拒。 |
x-amz-lex:audio:end-timeout-ms:<intent>:<slot> |
5,000 毫秒 | EOT 備用。範圍 500–10,000 毫秒。鎖定Out-of-range。 |
x-amz-lex:audio:locale-override:<intent>:<slot> |
未設定 | 語言提示會偏差辨識。逗號分隔代碼,最多 10 個。 |
常見的 ASR 錯誤
| 錯誤 | 為什麼不好 | 修正 |
|---|---|---|
| 收集口述數字時的低可信度閾值 | 機器人關閉群組之間的呼叫者 | 提高該槽的可信度和逾時,之後重設。 |
| 全域停用插斷提示 | 來電者無法在任何地方更正機器人 | 僅在免責聲明/合規提示時停用。 |
套用*:*預設值以修正一個槽 |
變更整個機器人的調節 | 將 屬性範圍限定為特定意圖/插槽。 |
| 在 0.5–0.9 之外設定閾值 | 請求因錯誤而遭到拒絕 | 將其保持在範圍內。僅以無提示的方式end-timeout-ms固定。 |
| 在長時間工具呼叫期間保持輸入視窗開啟 | 來電者坐在死空氣中 | 首先完成工具呼叫或播放填充提示。 |
| 將 EOT 重新提示視為實際插斷提示 | 套用至允許中斷的錯誤修正 | 請改為調校end-of-turn設定。 |
在 中列出多種語言 locale-override |
排除其設定為提供的偏差 | 只列出來電者說的語言,最有可能是先。 |
語音最佳實務
Amazon Connect 代理語音可在 50 多個地區提供表達式、自然聲音text-to-speech。引擎會自動將文字標準化為自然語音。在大多數情況下,您可以按原狀傳遞文字,並取得絕佳的結果,無需任何特殊格式。
文字格式
一般規則
傳遞自然、標點符號良好的文字。具有正常大小寫和標點符號的完整句子會產生最佳的步調和語調。
執行:
使用完整的句子搭配終端機標點符號 (. ? !)。
使用正常大小寫。
將數字、日期和常用格式保留為傳統寫入格式。
將每一代保留為至少完整句子或片語。非常短的片段通常聽起來不太自然。
請勿:
去除標點符號或強制所有大寫。
包含 Markdown、原始 JSON、表情符號或特殊字元。
在沒有完整內容的情況下自行傳送數字、英數字元或拼字標籤。
以粗體或斜體括住文字 — 引擎會嘗試說出星號。
使用括號、括號、大括號、角括號和引號。
自動標準化
引擎會將常見的寫入格式讀取為自然語音。在大多數情況下,您不需要重新格式化它們:
| Type | 傳遞此 | 引擎讀取為 |
|---|---|---|
| 大型數字 | 1,234,567 | 「一百萬二十萬四千...」 |
| 電話號碼 | (415) 555-1212 | 自然電話號碼調節 |
| 電子郵件位址 | user@example.com | 「範例 dot com 的使用者」 |
| 日期 | 04/20/2025 | 適合地區設定的日期讀取 |
| Times | 晚上 7:00 | 「下午七點」 |
| 縮寫 | NASA,美國 | 如預期般說出 |
| 百分比 | 12% | 「12%」 |
提示
電子郵件地址會以書面形式正確讀取。如果您想要精確控制,也可以指示您的代理程式直接輸出口語形式 (例如,「使用者範例點com」)。
語音控制標籤
語音引擎會自動從文字記錄內容推斷適當的節奏和情緒。控制標籤僅適用於預設值未滿足的特定使用案例。所有標籤都會直接放置在文字記錄中。
速度
控制說話率。範圍:0.6 (慢) 到 1.5 (快)。預設:1.0。
<speed ratio="0.85"/>This call may be recorded for quality purposes.
| Value | 使用時機 |
|---|---|
| 0.8 | 閱讀重要資訊或法律語言 |
| 1.0 | 預設 — 自然對話速度 |
| 1.2 | 更快速的對話 |
若要在減速後重設速度:
<speed ratio="0.85"/>Important notice.<speed ratio="1.0"/>Now, how can I help?
磁碟區
控制響度。範圍:0.5 (靜態) 到 2.0 (大聲)。預設:1.0。
<volume ratio="0.5"/>I'll speak softly for this part.
休息時間
插入暫停。以秒 (s) 或毫秒 (ms) 為單位指定持續時間。
Your balance is $1,234.<break time="500ms"/>Your next payment is due June 15th.
使用休息時間:
在資訊片段之間進行調節。
在法律或合規語言之前。
IVR 中的功能表選項之間。
注意
自然標點符號應該是第一個暫停的工具。逗號或句號通常會產生正確的暫停。中斷標籤最好保留給特定持續時間的明確靜音。
拼寫
強制character-by-character讀取程式碼、IDs、電話號碼或任何應逐letter-by-letter說出的字串。
Your confirmation code is <spell>TKT4829XB</spell>.
對於長序列,請在拼寫標籤包裝函式中新增空格以插入暫停:
Your phone number is <spell>(415)</spell><break time="200ms"/><spell>5551212</spell>.
替代格式 (不含標籤):
空格分隔:A B C 1 2 3
以逗號分組:A B C、1 2 3。
慢速編碼:A、B、C、1、2、3
注意
該模型會將所有 CAPS 文字視為與以 <spell> 標籤包裝文字相同 — 它會以字母讀取字母。例如,「ACME BANK」會說為「A-C-M-E B-A-N-K」。 若要讓模型以單字表達,請使用標準大寫:「Acme Bank」。
情緒
此模型自然會從內容推斷出情緒基調,在大多數情況下不需要標籤。情緒標籤是 Beta 版功能,當情緒符合文字記錄時,最可靠地運作。
<emotion value="sympathetic"/>I understand this is frustrating. Let me investigate that for you.
主要情緒:neutral、angry、excited、sad、 content和 scared。
子句
插入 [laughter] 以產生自然的笑聲。
Oh, I've actually heard that one before! [laughter] Alright, let's get this sorted out.
標籤參考
| Tag | 它的功能 | 範例 |
|---|---|---|
<speed ratio="X"/> |
說話率 (0.6–1.5) | <speed ratio="0.85"/> |
<volume ratio="X"/> |
音量 (0.5–2.0) | <volume ratio="1.5"/> |
<break time="Xs"/> |
暫停 (秒或毫秒) | <break time="500ms"/> |
<spell>...</spell> |
Character-by-character讀取 | <spell>AB12CD</spell> |
<emotion value="X"/> |
情緒調 | <emotion value="content"/> |
[laughter] |
自然笑聲 | [laughter] |
格式不正確的標籤
引擎
<...>會正確處理包含在相符項目中的格式良好的標籤。格式不正確或未關閉的標籤不會無提示捨棄,引擎會大聲說出格式不正確的文字。
不支援的 SSML 包裝函式,例如
<speak>...</speak>並非必要項目,且不應包含在內。
提示
如果引擎遇到無法剖析的標籤,則會嘗試說出包含標籤片段的原始文字。一律驗證您的標籤格式是否正確。
多語言語音組態
Amazon Connect 代理語音包含多語言語音,可以說多種語言,並在對話中無縫切換。發起人可以用英文開始,切換到西班牙文,客服人員接續 — 不需要流程變更或中斷。在設定語音區塊中,這些語音會標記為多邊形語音。本指南使用多語言語音一詞來描述。本節說明如何設定多語言語音,以及要注意的內容。
多語言語音
多語言語音在單一對話中原生切換支援的語言。當您的聯絡中心需要處理講不同語言或在通話中切換語言的來電者時,請使用多語言語音。
| 語音 | Gender | 支援的語言 |
|---|---|---|
| Katie | 女性化 | 英文、德文、西班牙文、法文、印地文、義大利文、日文、挪威文、葡萄牙文、俄文 |
| Blake | 男性化 | 英文、德文、西班牙文、法文、印地文、義大利文、日文、挪威文、葡萄牙文、俄文 |
| 中斷 | 女性化 | 英文、德文、西班牙文、法文、印地文、義大利文、日文、挪威文、葡萄牙文、俄文 |
| 羅納德 | 男性化 | 英文、德文、西班牙文、法文、印地文、義大利文、日文、挪威文、葡萄牙文、俄文 |
| Gemma | 女性化 | 英文、德文、西班牙文、法文、印地文、義大利文、日文、挪威文、葡萄牙文、俄文 |
組態
步驟 1:在多語言語音的地區設定中建置 Amazon Lex 機器人
如果您使用多語言語音,則只需要單一 Amazon Lex 機器人地區設定。在符合多語言語音的地區設定中建置您的機器人 (例如 en-US 或 en-GB)。您不需要將多語言語音支援的每個語言新增為 Amazon Lex 中的個別地區設定。
執行:
以 en-US (如果使用英國英文多語言語音,則為 en-GB) 建置您的機器人。
使用單一地區設定。AI 代理程式和多語言語音可處理多語言對話,無需其他 Amazon Lex 地區設定。
請勿:
為多語言語音支援的每個語言新增個別的 Amazon Lex 機器人地區設定。這是不必要的:AI 代理器會透過提示處理語言切換。
如果您需要支援不在多語言語音支援的語言清單 (例如泰文或塔加洛文),請為該地區設定建立單獨的機器人,並使用地區設定特定的語音。請參閱 在非英文地區設定中使用非多語言客服人員語音。
步驟 2:將 Lex 機器人地區設定與設定語音區塊配對
設定語音區塊中設定的語言屬性必須符合 Lex 機器人的地區設定。如果不相符,則取得客戶輸入區塊會傳回錯誤。更新設定語音區塊語言以符合您的機器人地區設定。
對於在英文地區設定上建置的多語言語音:
在設定語音區塊中,選取多語言語音 (例如 Brooke),並將語言設定為英文 (US)。
您的 Lex 機器人必須有 en-US 做為建置的地區設定。
第一次問候語
第一次轉彎時,AI 代理器尚未收到任何呼叫者輸入。如果沒有輸入,客服人員就無法偵測發起人的語言。語音會說出在取得客戶輸入區塊中設定的問候語文字。如果您希望機器人以特定語言歡迎來電者,請確定該區塊中的問候語訊息是以該語言撰寫。
例如,如果您的主要來電者群說西班牙文,請以西班牙文設定取得客戶輸入問候語:
Hola, gracias por llamar. ¿Cómo puedo ayudarle hoy?
第一次輪換之後,AI 代理程式會接管並偵測和遵循來電者在其餘對話中的語言。
步驟 3:將語言處理指示新增至 AI 代理器系統提示
將語言處理區段新增至 AI 代理器的系統提示。本節會驅動多語言行為。AI 代理程式會從文字記錄中偵測發起人的語言,並以該語言回應。
範本 (針對您的使用案例自訂):
You are connected to a multilingual voice that supports the following languages: English, German, Spanish, French, Hindi, Italian, Japanese, Norwegian, Portuguese, and Russian. Language handling rules: Detect the language of the caller's input from the transcription. If the caller speaks in one of the supported languages listed above, respond in that same language. If the caller speaks a language not in the supported list, respond in English and politely let them know you can assist in the supported languages. Always respond in one language at a time. Do not mix languages in a single response unless the caller mixes first. If the caller switches languages mid-conversation, follow their lead immediately. When responding in any non-English language, always use proper accent marks, diacritics, and locale-appropriate formatting (for example, é, ñ, ü, ç). This ensures the voice engine produces natural pronunciation. Keep English brand names, product names, codes, and identifiers in English. Do not translate them.
提示
只在提示中列出您的多語言語音實際支援的語言。列出不支援的語言會導致代理程式宣告它可以提供幫助,但 TTS 會產生不自然的輸出。
在非英文地區設定中使用非多語言客服人員語音
如果您使用的客服人員語音不是多語言語音 (例如泰文、韓文或葡萄牙文語音),則必須明確設定語言屬性,以便系統路由到正確的 ASR 引擎。
選項 A:設定語音區塊
選取您的非英文語音 (例如,th-TH 地區設定適用的泰文語音)。
將語言設定為相符的地區設定 (例如 th-TH)。
使用相符的地區設定 (th-TH) 建置 Lex 機器人。
選項 B:設定聯絡屬性區塊
如果設定語音區塊未公開組態的語言設定,您可以在取得客戶輸入區塊之前,使用設定聯絡屬性區塊來設定語言:
類型 — 系統
屬性 - 語言
值 — 地區設定代碼 (例如,Tagalog 為 tl-PH,泰文為 th-TH)
限制為特定語言
如果您的聯絡中心僅支援一部分語言,請簡化提示:
You support English and Spanish on this line only. Detect the language of the caller's input. If the caller speaks English or Spanish, respond in that language. If the caller speaks any other language, respond in English: I apologize, but I can only assist in English or Spanish. How can I help you today? If the caller switches between English and Spanish, follow their lead. Use proper accent marks when responding in Spanish (á, é, í, ó, ú, ñ, ü). Keep brand names and codes in English.
Amazon Connect AI 代理器的系統提示
當 Amazon Connect AI Agents 產生將說出的文字時,請將這些語音格式指示新增至代理程式的系統提示。直接將下面的區塊複製並貼到您的提示組態中。
注意
這些提示是讓您開始使用的範本。根據您的特定使用案例、語氣和業務需求進行修改。
提示
如需最佳化 AI 代理器語音效能和延遲提示的指引,請參閱 AI 代理器的提示工程最佳實務。
語音輸出格式提示
Speech Output Formatting Everything you output will be spoken aloud by text-to-speech. Follow these rules: GENERAL FORMATTING Use full sentences with normal capitalization. Always end with . ? or ! Use conventional written forms for numbers, dates, acronyms, symbols. Do NOT use markdown, bullet points, headers, bold, raw JSON, emoji, or special characters. Write plain prose only. SPELLING OUT CODES AND IDS For codes or IDs that must be read character-by-character, except for phone numbers, wrap in <spell> tags: Example: Your confirmation code is <spell>TKT4829XB</spell>. Was that the account ending in <spell>1234</spell>? THINGS TO AVOID Do not output bullet points, numbered lists, or structured formatting. Do not use asterisks, hashtags, or markdown syntax. Do not include internal thoughts, reasoning, or meta-commentary. Do not use parentheses, brackets, curly braces, or quotation marks. NATURALNESS Respond as if speaking directly to the caller. Keep responses concise. Avoid long monologues. Use natural transitions like: Let me check that for you. Or: Here is what I found.
多語言附加元件
如果您的機器人使用多語言語音,請將以下內容新增至您的系統提示,以啟用多語言回應:
Language Handling You are connected to a multilingual voice that supports: English, German, Spanish, French, Hindi, Italian, Japanese, Norwegian, Portuguese, and Russian. Detect the language of the caller input from the transcription. If the caller speaks in one of the supported locales, respond in that language. If the caller speaks a language not in the supported list, respond in English and politely let them know you can assist in English. Always respond in one language at a time. Do not mix multiple languages in a single response. If the caller switches languages mid-conversation, follow their lead and switch your responses to match. When responding in a non-English language, always use proper accent marks, diacritics, and locale-appropriate formatting. This ensures the voice engine produces natural, native-sounding pronunciation.
聯絡中心範例
IVR 問候語
Hi, thanks for calling. How can I help you today?
不需要標籤 — 引擎自然地處理對話式問候語。
法律免責聲明 (緩慢)
<speed ratio="0.85"/>This call may be recorded for quality assurance purposes. By continuing, you consent to recording.
在流程層級停用插入配對。
讀取帳戶號碼
使用拼字標籤:
Your account number is <spell>1234</spell> <spell>5678</spell> <spell>9012</spell>.
沒有拼字標籤:
Your account number is 1 2 3 4, 5 6 7 8, 9 0 1 2.
使用參考碼進行確認
I've created your ticket. Your reference number is <spell>TKT4829XB</spell>. Is there anything else I can help with?
選單選項
Press 1 for billing.<break time="500ms"/>Press 2 for technical support.<break time="500ms"/>Press 3 to speak with an agent.
拼寫客戶的名稱
Let me confirm — your last name is Smith, spelled <spell>SMITH</spell>. Is that correct?
常見的text-to-speech錯誤
| 錯誤 | 為什麼不好 | 修正 |
|---|---|---|
| 分割標點符號 | 廢墟調節和進入 | 保留自然標點符號。 |
| 所有大寫文字 | 變更引擎的讀取方式 | 使用正常大小寫。 |
| 包含 Markdown | 引擎會說出格式化字元 | 在傳送之前移除 ,或指示代理程式避免。 |
| 串流不完整的標籤 | 標籤會大聲讀取為文字 | 在傳送之前緩衝完成標籤值。 |
| 不相符的情緒 + 內容 | 產生不自然的輸出 | 將情緒與內容對齊,或省略。 |
| 過度工程化提示 | 可以降低自然性 | 啟動簡單 — 僅在需要時新增標籤。 |
| 多語言的非多語言語音 | 語音保留主要地區設定重音 | 使用多語言語音進行原生發音。 |
| 以粗體或斜體括住文字 | 引擎大聲說出星號 | 移除所有 Markdown 格式。 |
| 傳送格式不正確或未關閉的標籤 | 引擎說出原始標籤文字 | 驗證標籤的格式與相符的括號相符。 |