View a markdown version of this page

交易欺诈见解 - Amazon Fraud Detector

自2025年11月7日起,亚马逊欺诈探测器不再向新客户开放。要了解与亚马逊欺诈检测器类似的功能,请浏览亚马逊 SageMaker AutoGluon、和 AWS WAF。

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

交易欺诈见解

交易欺诈洞察模型类型旨在检测在线或不在场的交易欺诈。Transaction Fraud Insights 是一种有监督的机器学习模型,这意味着它使用欺诈和合法交易的历史示例来训练模型。

交易欺诈洞察模型使用一组机器学习算法进行数据丰富、转换和欺诈分类。它利用功能工程引擎来创建实体级和事件级聚合。作为模型训练过程的一部分,Transaction Fraud Insights 使用第三方数据(例如 IP 地址的地理位置或信用卡的发卡银行)丰富了 IP 地址和 BIN 号等原始数据元素。除第三方数据外,Transaction Fraud Insights还使用深度学习算法,该算法考虑了在亚马逊看到的欺诈模式, AWS 这些欺诈模式使用梯度树增强算法成为模型的输入特征。

为了提高性能,Transaction Fraud Insights通过贝叶斯优化过程优化梯度树增强算法的超参数,按顺序训练数十种不同的模型,这些模型具有不同的模型参数(例如树的数量、树的深度、每片叶子的样本数),以及不同的优化策略,例如增加少数欺诈群体的权重以应对非常低的欺诈率。

作为模型训练过程的一部分,Transaction Fraud 模型的特征工程引擎会计算训练数据集中每个唯一实体的值,以帮助改进欺诈预测。例如,在训练过程中,Amazon Fraud Detector 会计算和存储实体上次购买的时间,并在您每次调用GetEventPredictionSendEvent API 时动态更新此值。在欺诈预测期间,将事件变量与其他实体和事件元数据相结合,以预测交易是否是欺诈性的。

选择数据源

交易欺诈洞察模型仅在亚马逊欺诈检测器(INGESTED_EVENTS)内部存储的数据集上进行训练。这使亚马逊欺诈探测器能够持续更新有关您正在评估的实体的计算值。有关可用数据源的更多信息,请参阅 事件数据存储

准备数据

在训练交易欺诈洞察模型之前,请确保您的数据文件包含准备事件数据集中提及的所有标题。Transaction Fraud Insights 模型将收到的新实体与数据集中的欺诈和合法实体示例进行比较,因此为每个实体提供许多示例会很有帮助。

Amazon Fraud Detector 会自动将存储的事件数据集转换为正确的训练格式。模型完成训练后,您可以查看性能指标并确定是否应向训练数据集中添加实体。

选择数据

默认情况下,交易欺诈见解会根据您选择的事件类型在您存储的整个数据集上进行训练。您可以选择设置时间范围以减少用于训练模型的事件。设置时间范围时,请确保用于训练模型的记录有足够的成熟时间。也就是说,已经过去了足够的时间来确保正确识别合法和欺诈记录。例如,对于拒付欺诈,正确识别欺诈事件通常需要 60 天或更长时间。为了获得最佳模型性能,请确保训练数据集中的所有记录均已成熟。

无需选择代表理想欺诈率的时间范围。Amazon Fraud Detector 会自动对您的数据进行采样,以实现欺诈率、时间范围和实体数量之间的平衡。

如果您选择的时间范围内的事件不足以成功训练模型,则 Amazon Fraud Detector 会在模型训练期间返回验证错误。对于存储的数据集,EVENT_LABEL 字段是可选的,但必须对事件进行标记才能包含在训练数据集中。配置模型训练时,您可以选择是忽略未标记的事件,为未标记的事件使用合法标签,还是为未标记的事件使用欺诈性标签。

事件变量

除了必需的事件元数据外,用于训练模型的事件类型必须包含至少 2 个变量,这些变量已通过数据验证,最多可包含 100 个变量。通常,您提供的变量越多,模型就越能更好地区分欺诈和合法事件。尽管 Transaction Fraud Insight 模型可以支持数十个变量,包括自定义变量,但我们建议您包括 IP 地址、电子邮件地址、支付工具类型、订单价格和信用卡 BIN。

验证数据

作为训练过程的一部分,Transaction Fraud Insights 会验证训练数据集中是否存在可能影响模型训练的数据质量问题。验证数据后,Amazon Fraud Detector 会采取适当的措施来构建尽可能好的模型。这包括对潜在的数据质量问题发出警告、自动删除存在数据质量问题的变量,或者发出错误并停止模型训练过程。有关更多信息,请参阅数据集验证

Amazon Fraud Detector 将发出警告,但如果唯一实体的数量小于 1,500,则会继续训练模型,因为这可能会影响训练数据的质量。如果您收到警告,请查看绩效指标