自2025年11月7日起,亚马逊欺诈探测器不再向新客户开放。要了解与亚马逊欺诈检测器类似的功能,请浏览亚马逊 SageMaker AutoGluon、和 AWS WAF。
本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
在线欺诈见解
Online Fraud Insights 是一种有监督的机器学习模型,这意味着它使用欺诈和合法交易的历史示例来训练模型。在线欺诈洞察模型可以根据少量历史数据检测欺诈。该模型的输入非常灵活,因此您可以对其进行调整以检测各种欺诈风险,包括虚假评论、滥用促销和访客结账欺诈。
在线欺诈洞察模型使用一组机器学习算法进行数据丰富、转换和欺诈分类。作为模型训练过程的一部分,Online Fraud Insights 使用 IP 地址的地理位置或信用卡发卡银行等第三方数据,丰富了 IP 地址和 BIN 号码等原始数据元素。除第三方数据外,Online Fraud Insights还使用深度学习算法,该算法考虑了亚马逊和 AWS. 使用梯度树增强算法,这些欺诈模式成为模型的输入特征。
为了提高性能,Online Fraud Insights 通过贝叶斯优化过程优化了梯度树增强算法的超参数。它使用不同的模型参数(例如树木数量、树木深度和每片叶子的样本数量)按顺序训练数十种不同的模型。它还使用不同的优化策略,例如增加少数欺诈群体的权重,以应对非常低的欺诈率。
选择数据源
训练在线欺诈洞察模型时,您可以选择根据存储在外部(亚马逊欺诈探测器外部)或存储在亚马逊欺诈探测器中的事件数据训练模型。亚马逊欺诈探测器目前支持的外部存储是亚马逊简单存储服务 (Amazon S3)。如果您使用外部存储,则您的事件数据集必须以逗号分隔值 (CSV) 格式上传到 Amazon S3 存储桶。在模型训练配置中,这些数据存储选项被称为 EXTERNAL_EVENTS(用于外部存储)和 INGESTED_EVENTS(用于内部存储)。有关可用数据源以及如何在其中存储数据的更多信息,请参阅事件数据存储。
准备数据
无论您选择将事件数据存储在何处(Amazon S3 或 Amazon Fraud Detector),对在线欺诈洞察模型类型的要求都是相同的。
您的数据集必须包含列标题 EVENT_LABEL。此变量将事件归类为欺诈性或合法事件。使用 CSV 文件(外部存储)时,必须在文件中为每个事件包含 EVENT_LABEL。对于内部存储,EVENT_LABEL 字段是可选的,但必须标记所有事件才能包含在训练数据集中。在配置模型训练时,您可以选择忽略未标记的事件,为未标记的事件使用合法标签,或者为所有未标记的事件假定一个欺诈性标签。
选择数据
有关选择数据以训练在线欺诈洞察模型的信息,请参阅收集事件数据。
在线欺诈洞察培训过程根据 EVENT_TIMESTAMP 对历史数据进行采样和分区。无需手动对数据进行采样,这样做可能会对模型结果产生负面影响。
事件变量
除了所需的事件元数据外,Online Fraud Insights 模型需要至少两个变量,这两个变量已通过模型训练https://docs.aws.amazon.com/frauddetector/latest/ug/create-event-dataset.html#dataset-validation的数据验证,每个模型最多允许 100 个变量。通常,您提供的变量越多,模型就越能更好地区分欺诈和合法事件。虽然 Online Fraud Insights 模型可以支持数十个变量,包括自定义变量,但我们建议包括 IP 地址和电子邮件地址,因为这些变量通常在识别被评估的实体方面最有效。
验证数据
作为训练过程的一部分,Online Fraud Insights将验证数据集中是否存在可能影响模型训练的数据质量问题。验证数据后,Amazon Fraud Detector 将采取适当的措施来构建尽可能好的模型。这包括对潜在的数据质量问题发出警告、自动删除存在数据质量问题的变量,或者发出错误并停止模型训练过程。有关更多信息,请参阅数据集验证。