本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
透過自訂詞彙和自訂語言模型提高轉錄準確性
如果您的媒體包含特定網域或非標準術語,例如品牌名稱、縮寫、技術單字和術語, Amazon Transcribe 則可能無法在您的轉錄輸出中正確擷取這些術語。
若要更正轉錄不準確性並針對特定使用案例自訂輸出,您可以建立 自訂詞彙 和 自訂語言模型。
-
自訂詞彙 目的是調整和提高所有情況下特定單字的識別和格式。這涉及到提供 Amazon Transcribe 單字和發音和顯示格式。
如果 Amazon Transcribe 未正確轉譯文字記錄中的特定詞彙,您可以建立自訂詞彙檔案,告知您希望這些詞彙 Amazon Transcribe 如何顯示。這種特定單字的方法最適合用於更正品牌名稱和縮詞之類的術語。
-
自訂語言模型 目的是擷取與術語相關的上下文。這包括 Amazon Transcribe 提供大量的網域特定文字資料。
如果 Amazon Transcribe 未正確轉譯技術術語或在文字記錄中使用不正確的同音電話,您可以建立自訂語言模型來教導 Amazon Transcribe 您的網域特定語言。例如,自訂語言模型可以了解使用「浮冰」(浮冰) 與「流」(線性流) 的時機。
這種情境感知方法最適合轉錄大量領域特定語音。自訂語言模型可以產生在自訂詞彙上顯著提高準確性。雖然 API 在相同的請求中同時接受自訂語言模型和自訂詞彙,但自訂語言模型處於作用中狀態時,自訂詞彙效果 (例如
DisplayAs轉譯) 不會套用至轉錄輸出。
重要
當自訂語言模型在相同的請求中處於作用中狀態時,自訂詞彙功能 (例如 DisplayAs 欄位) 不會套用至轉錄輸出。這同時適用於批次和串流轉錄。
如需建立和使用自訂詞彙的影片說明,請參閱:
如需建立和使用自訂語言模型的影片說明,請參閱: