翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
スコア定義
重要度スコア (コンテンツフィルターとプロンプト攻撃検出用)
コンテンツフィルターとプロンプト攻撃検出では、API は重要度スコアを返します。これは、[0, 1] の範囲の数値で、安全チェック基準の最も強力な一致を表します。これらのスコアは個別であり、指定できる値は 0、0.2、0.4、0.6、0.8、1.0 です。
スコア 1 (最大) は最も強い一致であり、安全チェックの定義に最も近い一致を示します。スコア 0 (最小) は最も弱い一致であり、コンテンツが無害であることを示します。
重要度スコアはコンテンツ自体のプロパティであり、その分類に関する基盤となるモデルの確実性ではありません。「このコンテンツは安全チェックの基準にどの程度一致しますか?」という質問に答えます。「基盤となるモデルはどの程度確実ですか?」という回答はありません。次の表に、この定義の詳細を示します。
| Safeguard | 詳細度 | 重要度スコアの意味 |
|---|---|---|
| コンテンツフィルター | カテゴリごと (HATE、VIOLENCE、INSULTS、SEXUAL、MISCONDUCT) | コンテンツは、各カテゴリの有害なコンテンツとどの程度一致しますか? |
| プロンプト攻撃 | 攻撃ベクトルごと (JAILBREAK、PROMPT_INJECTION、PROMPT_LEAKAGE) | コンテンツは各攻撃ベクトルとどの程度一致しますか? |
スコア自体はコンテンツをブロックしません。スコアをしきい値として使用して、アプリケーションがどの程度制限的であるかを制御します。
信頼スコア (機密情報フィルターの場合)
機密情報フィルターを使用すると、API は、モデルが PII エンティティが存在するかどうかを示す信頼スコアを返します。このスコアは PII 検出に関連し、API を呼び出したときに選択した PII エンティティの存在に関するモデルの信頼度を反映します。