本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
分數定義
嚴重性分數 (適用於內容篩選條件和提示攻擊偵測)
透過內容篩選條件和提示攻擊偵測,API 會傳回嚴重性分數,這是範圍 【0, 1】 中的數值,代表安全檢查條件最強烈的相符項目。這些分數是分散的,可能的值為 0、0.2、0.4、0.6、0.8 和 1.0。
分數為 1 (最大值) 是最強的相符項目,表示最接近安全檢查的定義。分數為 0 (最小值) 是最弱的配對,表示內容是良性的。
嚴重性分數是內容本身的屬性,而不是基礎模型對其分類的確定性。它回答了以下問題:「此內容與安全檢查的條件有多相符?」 它沒有回答:「基礎模型有多確定?」 下表詳細說明此定義。
| 保護 | 精細程度 | 嚴重性分數的意義 |
|---|---|---|
| 內容篩選條件 | 每個類別 (HATE、VIOLENCE、INSULTS、SEXUAL、MISCONDUCT) | 內容與每個類別的有害內容相符的程度為何? |
| 提示攻擊 | 每個攻擊向量 (JAILBREAK、PROMPT_INJECTION、PROMPT_LEAKAGE) | 內容符合每個攻擊向量的程度為何? |
分數本身不會封鎖任何內容。您可以使用分數做為閾值,以控制應用程式的行為限制。
可信度分數 (適用於敏感資訊篩選條件)
透過敏感資訊篩選條件,API 會傳回可信度分數,指出模型對 PII 實體存在的確定程度。此分數與 PII 偵測相關,並反映模型對您調用 API 時所選 PII 實體是否存在的信心。