本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
子系偵測架構
發佈日期:2021 年 7 月 26 日 (圖表歷史記錄)
此架構可協助您使用 AWS Step Functions AWS Lambda、Amazon SageMaker AI 和 OpenSearch Service 建立分片偵測服務。
子系偵測架構圖
-
將您想要在 上執行 plagiarism 偵測的文件複製到 Amazon Simple Storage Service (Amazon S3)。
-
Amazon S3 事件觸發程序啟動AWS Step Functions工作流程。
-
AWS Lambda 函數使用 Tika 從文件擷取文字 (內容分析工具組,可偵測和擷取超過數千種不同檔案類型的中繼資料和文字。
-
針對文件中的每個段落,文字會從轉換器 (BERT) 型模型傳遞至預先訓練的雙向編碼器表示法,以擷取文字內嵌向量。
-
對於每個字詞內嵌向量,會使用餘弦相似性演算法執行 K 近鄰 (KNN) 搜尋。
-
Amazon OpenSearch Service (OpenSearch Service) 網域會存放已轉換為文字內嵌向量並編製索引的預先處理著作索引。
-
根據與 OpenSearch Service 查詢結果分數比較的已設定相似性閾值,引發事件橋接事件,指定可能已參照相關著作進行分割的來源文件資訊。
深入閱讀
如需詳細資訊,請參閱
圖表歷史記錄
若要收到此參考架構圖的更新通知,請訂閱 RSS 摘要。
| 變更 | 描述 | 日期 |
|---|---|---|
初次出版 | 首先發佈參考架構圖。 | 2021 年 7 月 26 日 |
注意
若要訂閱 RSS 更新,您必須為正在使用的瀏覽器啟用 RSS 外掛程式。