本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
分数定义
严重性分数(用于内容过滤器和即时攻击检测)
通过内容过滤器和即时攻击检测,API 会返回严重性分数,该分数是 [0, 1] 范围内的数值,表示与安全检查标准的最强匹配度。这些分数是离散的,可能的值为 0、0.2、0.4、0.6、0.8 和 1.0。
分数为 1(最大值)是最强的匹配项,表示最接近安全检查的定义。0(最低)分数是最弱的匹配项,表示内容是良性的。
严重性分数是内容本身的属性,而不是基础模型对其分类的确定性。它回答了这样一个问题:“这些内容在多大程度上符合安全检查的标准?” 它没有回答:“底层模型有多确定?” 下表详细说明了这个定义。
| Safeguard | 粒度 | 严重性分数的含义 |
|---|---|---|
| 内容过滤器 | 按类别(仇恨、暴力、侮辱、性、不当行为) | 内容与每个类别的有害内容的匹配程度如何? |
| 即时攻击 | 每个攻击向量(越狱、提示注入、提示泄露) | 内容与每个攻击向量的匹配程度如何? |
乐谱本身不会屏蔽任何内容。您可以使用分数作为阈值来控制应用程序的限制程度。
置信度分数(适用于敏感信息过滤器)
对于敏感信息过滤器,API 会返回置信度分数,该分数表示模型对存在 PII 实体的确定程度。该分数与 PII 检测有关,反映了模型对您在调用 API 时选择的 PII 实体存在的信心。