返回博客

设计一个团队真正信得过的风险评分

风险评分反欺诈工程

风险评分只有在分析师愿意相信并使用时才有价值。本文聊聊如何设置信号权重、保留判断依据、校准阈值,并持续复盘结果。

几乎每一套反欺诈体系,最终都会落到一个 0 到 100 之间的数字上。好评分和坏评分的差别,往往不在数学模型有多复杂,而在于真正要据此行动的人是否相信它。

给证据打分,而不是给感觉打分

先把原始信号列清楚,并明确每个信号在你自己的流量里到底意味着什么:

| Signal | Typical weight | Why | | --- | --- | --- | | TOR exit node | High | Deliberate anonymity, rare among ordinary customers | | Hosting / datacenter | Medium-high | Servers are not shoppers | | Commercial VPN | Low-medium | Very common among honest users | | Residential proxy | High | Purpose-built to look legitimate | | Mobile carrier | Neutral | Shared, but overwhelmingly real people | | ASN abuse history | Medium | Cheap networks attract cheap attacks |

这些权重应该来自你自己的业务结果,而不是某篇博客文章——当然也包括这篇。拿出一个月内已确认的拒付订单和已确认的正常订单,看看哪些标记真的能在你的数据中把二者区分开。

把判断理由一并保留下来

一个没有解释的 78 分,本质上只是绕了一圈的猜硬币。返回评分时,要同时返回贡献该分数的原因,并在审核界面里展示出来。这样会带来两个直接好处:分析师会帮你发现规则漏洞;而用户申诉也往往能从来回五轮沟通,缩短到一条消息解决。

用三个风险区间校准,而不是一个硬阈值

  • Low — 静默放行。
  • Medium — 增加摩擦:邮箱验证、3-D Secure、延迟打款等。
  • High — 进入人工审核;在政策允许的情况下,也可以直接拒绝。

单一阈值会把一个连续信号硬切成二选一,也几乎注定会让最昂贵的错误集中出现。分层区间的价值在于,你可以消耗一点“摩擦”,而不是直接消耗用户信任。

永远不要让 IP 单独做决定

IP intelligence 回答的是“这是哪一类网络?”它无法回答“这个人是不是他声称的那个人?”因此,应该把它和账号年龄、行为频率、设备一致性、账单地址与收货地址匹配情况、支付历史等信号结合起来看。IP 结论应该影响决策,但很少应该独自决定决策。

明确衡量误伤成本

拦下一个欺诈者,节省的是这笔订单金额。拦错一个真实客户,损失的是订单 以及 关系,而且这种情况通常比团队预估的更常见。两边都要跟踪:

  • 每周确认拦截的欺诈数量。
  • 每周因风险动作产生的支持工单数量。
  • 这些工单的撤销率——也就是审核后确认“拦错了”的比例。

如果撤销率大约高于五分之一,那么不管欺诈拦截数据看起来多漂亮,你的阈值都已经过于激进了。

固定节奏复盘

攻击模式会不断轮换。春天有效的权重,到了秋天可能就成了噪声。给风险评分复盘设置一个固定日程,用最近带标签的案例回放当前规则,再做调整。一个一年没人重新审视过的评分体系,已经不是控制手段,而是遗留系统。

最后的信任测试

随便找一位分析师,让他用一句话解释昨天某个高风险决策。如果他说得清楚,说明评分在发挥作用。如果他只是耸耸肩说“系统标记的”,那你拥有的只是一个数字,而不是一个信号。

你的连接