浏览器指纹 vs IP 信誉:哪种能识别更多欺诈
浏览器指纹和 IP 信誉以不同方式识别不同类型的欺诈。指纹能在 IP 变化时识别设备;IP 信誉则不看设备直接标记基础设施。本文对比两者,并说明为何要同时使用。
「我们应该用 IP 信誉还是设备指纹?」这个问题有一个令人无奈的答案——两个都要用,因为它们以不同方式识别不同类型的欺诈,而且各自的盲区恰好是对方看得最清楚的地方。但这个问题的提法值得认真对待,因为理解它们为什么互补,能告诉你如何为它们加权、各自在哪里失效,以及攻击者要击败其中每一个各需付出什么代价。
本文直接对比二者:各自测量什么、各自能识别什么、各自在哪里失效,以及为何住宅代理是决定这场争论的关键场景。目标读者是正在选择或调优检测栈的工程师和欺诈分析师。
各自真正测量的是什么
IP 信誉和浏览器指纹作用于连接的两端。IP 信誉问的是关于网络路径的问题:这个连接来自哪里,我们对这个来源了解什么?浏览器指纹问的是关于端点的问题:无论连接经由什么路径到达,另一端是什么设备?
IP 信誉将发起连接的 IP 地址与已知上下文进行比对:它是住宅 ISP 还是数据中心?是不是已知的 VPN 或代理出口节点?此前是否与滥用行为关联过?它的 ASN、地理定位、历史记录如何?其输出是对基础设施的判断。它是无状态的,意思是不需要事先见过这个具体用户——IP 本身就带有独立于其背后是谁的信誉。这就是 IP 情报层,它的巨大优点是速度和成本:一次 IP 查询是快速、可缓存的操作,对客户端毫无要求。
浏览器指纹通过组合大量信号来识别设备——canvas 和 WebGL 渲染、已安装字体、硬件特征、网络栈指纹、行为模式——形成一个概率性标识符,对于给定设备而言在多个会话间保持稳定。(完整机制见设备指纹如何工作。)其输出是对行为主体的判断:这是我们上周见过的同一台设备,如今正在使用第四个账户。它是有状态的——其价值来自对同一设备随时间推移的多次观测进行关联。
这一区别是根本性的。一个 IP 地址被许多设备使用(运营商 NAT 后的每一部手机、办公网关后的每一台笔记本)。一台设备使用许多 IP 地址(家里、移动网络、咖啡店、VPN)。IP 信誉解析的是网络;指纹解析的是机器。它们测量的是不同的东西,谁都不能替代谁。
IP 信誉擅长识别什么
IP 信誉能快速、廉价地识别基于基础设施的欺诈——那些源自数据中心、托管服务商和已知恶意地址段的大批量自动化滥用,且无需客户端任何配合。
它的强项很具体:
数据中心流量。 大量粗糙的机器人流量来自云托管——AWS、GCP、Azure,以及长尾的 VPS 服务商。这类流量凭 ASN 就能轻易识别:没有消费者会从一个 EC2 实例上浏览你的结账页面。IP 信誉可以瞬间将其标记出来,而对于很大一部分不成熟的自动化来说,这就是全部检测。
已知滥用基础设施。 有攻击、垃圾信息或抓取历史的 IP 和地址段会把这份信誉带下去。威胁情报源和已观测滥用数据库让你能够拦截或质询那些已经在别处作恶的来源的流量。
商用 VPN 和公共代理。 许多 VPN 和代理服务从可识别的 IP 段运营。对于那些 VPN 流量本身就是风险信号的场景(受地域限制的内容、某些欺诈场景),IP 信誉能直接把它暴露出来。
地理位置和速度异常。 基于 IP 的地理定位支持「不可能的旅行」检测(几分钟内先后从纽约和东京登录)以及地理策略的执行。
其经济性极佳:无需客户端 SDK、无需执行 JavaScript、一次快速可缓存的查询,且对大批量低成熟度流量有效。如果你只能做一件便宜的事,IP 信誉能以最小的代价识别出最明显的滥用。
IP 信誉在哪里失效
IP 信誉栽在两个结构性事实上:IP 是一个粗糙、共享且短暂的标识符,而它擅长发现的那类基础设施,恰恰是成熟攻击者会停止使用的基础设施。
一个 IP 对应多个用户。 运营商级 NAT(CGN)把成千上万的移动用户放在寥寥几个 IP 之后。企业网关、大学网络和公共 Wi-Fi 把许多互不相同的用户聚合在同一个地址下。因为背后某一个用户实施了欺诈就拦截或重罚一个共享 IP,会殃及该 IP 上的其他所有人。当地址是共享的——而对于移动和企业流量,大多数时候都是共享的——IP 信誉太粗糙,无法据此果断行动。
一个用户对应多个 IP。 合法用户在家庭、移动和公共网络间漫游;其 IP 不断变化。滥用者则有意且大规模地这样做,在每个请求上轮换 IP。基于 IP 的身份对于在多个会话间关联单一行为主体毫无用处,因为行为主体的 IP 就是被设计成一次性的。任何依赖「同一个 IP 又回来了」的做法,都会被轻易的轮换击败。
信誉滞后于现实。 IP 信誉是历史性的——一个地址靠过去的行为才挣得信誉。全新的 IP、刚租下的代理池和刚被攻陷的住宅主机都还没有历史。来自干净基础设施的第一波滥用会在信誉赶上之前就已经通过。
而最具决定性的一点:住宅代理。 这是 IP 信誉无法解决的场景,它值得单独一节来讲。
为何住宅代理决定了这场争论
住宅代理几乎能彻底击败 IP 信誉,而它们恰恰是浏览器指纹被设计来应对的场景——这就是为什么在欺诈的高端一侧,指纹能识别出 IP 信誉在结构上无法识别的东西。
住宅代理把攻击者的流量经由一台真实的消费者设备转发——家用路由器、手机、IoT 设备——于是连接看起来来自一个信誉干净、地理定位合理的真实住宅 ISP 的 IP。对 IP 信誉而言,这类流量与合法客户无从区分,因为在网络层面它就是一个合法的住宅连接。该地址没有滥用历史;ASN 是真实的 ISP;地理位置是真实的社区。IP 信誉所依赖的每一个信号都说「正常用户」。
住宅代理网络规模庞大、价格低廉、已高度商品化。任何有心的攻击者——从事支付欺诈、账户接管、抢购,或有组织的虚假账户注册——都会理所当然地经由它们转发。面对一个坚定的对手,IP 信誉的核心信号会被任何人都能做到的一次购买所抵消。
指纹不受此影响,因为它看的不是网络路径。攻击者把 IP 在上千个住宅代理间轮换,但他们仍然坐在同一组有限的设备前。这上千个连接的设备指纹是完全相同的。指纹看到的是一台设备从一百个「不同」的住宅 IP 上开了一百个账户——而这正是攻击者刻意规避 IP 信誉想要隐藏的那种关联。代理击败了网络层的信号,却对端点层的信号毫无作用。
这就是关键所在。在不成熟的一端(数据中心机器人),IP 信誉高效且足够。在成熟的一端(住宅代理),IP 信誉是盲的,而指纹是唯一仍看得清楚的那一层。二者并无高下之分——它们覆盖的是不同的威胁层级。
指纹能识别而 IP 识别不了的东西
浏览器指纹识别的是行为主体级别的欺诈——同一个实体横跨多个 IP、账户和会话运作——而且恰恰是在 IP 信誉被设计来规避的那些场景中做到这一点。
跨轮换 IP 的多账户操作。 一台设备创建许多账户,每个都来自不同的 IP,这对 IP 信誉是隐形的,对指纹则一目了然。这是识别虚假账户团伙、试用滥用和促销滥用的基础。
干净 IP 背后的回访者。 一台已知的恶意设备用一个全新的住宅 IP 回来,靠的是设备匹配而不是地址被识别出来。
一致性违背。 指纹能检测出所声称的环境是否自洽——一台自称是 iPhone 的设备,其 TLS 指纹却说它是 Python 客户端,或其 WebGL 渲染器说它是一台 Linux 服务器。IP 信誉对此毫无可见性;它只看到地址。这些跨层的不一致能识别出那些呈现干净 IP、却伪造不出一台自洽设备的自动化。
反检测与自动化框架。 那些伪造单个浏览器信号的工具,在整套信号集上仍会留下可检测的不一致,而且往往会通过 WebRTC IP 泄露暴露代理背后的真实地址而露出马脚。这些是 IP 信誉无法执行的设备级和浏览器级检测。
指纹相比 IP 信誉更差的地方在于:它需要客户端执行代码(页面上要有 SDK),它需要事先见过这台设备才能关联(有状态,因此对设备的第一次观测所携带的信号较少),而且它的计算成本高于一次缓存的 IP 查询。对于纯数据中心机器人流量,一次 IP 检查更便宜且同样有效。指纹的价值体现在 IP 信誉漏掉的那些成熟流量上。
结论:分层使用,而非二选一
对于「哪种能识别更多欺诈」,诚实的答案是:这完全取决于流量的成熟度,而任何真实的欺诈流量都同时包含这两个层级——所以你要同时运行两层,让它们互相覆盖。
分层逻辑如下:
- IP 信誉先行且成本低。 它在更昂贵的检查之前,先过滤掉大批量明显的、基于基础设施的滥用(数据中心、已知恶意地址段)。它还贡献网络上下文——代理、VPN、ASN、地理位置——作为信号,而非判定。
- 指纹解析行为主体。 对于通过了 IP 过滤的流量(包括所有住宅代理背后的流量),设备身份完成 IP 做不到的关联:同一设备多账户、恶意设备回访、一致性违背。
- IP 信号汇入设备判定。 在成熟的系统里,IP 信誉不是一道独立的关卡——它只是众多输入之一,汇入设备级的实时欺诈评分。「干净住宅 IP 上的已知设备」和「数据中心 IP 上的未知设备」是不同的风险画像,而把网络视角和端点视角结合起来,会产生比任一单独视角都更好的判定。
错误在于把它们当成竞争对手。没有指纹的 IP 信誉对住宅代理欺诈是盲的,也无法跨 IP 关联一个行为主体。没有 IP 上下文的指纹则丢掉了一个针对大批量粗糙自动化的便宜、快速的过滤器,也失去了有价值的网络信号。二者是为不同威胁层级设计的,而这些层级在你的流量里共存。
Tracio 将两者作为一层来运行:用 IP 情报提供网络上下文——数据中心、VPN、代理、ASN、地理位置——与横跨 130 多种信号的设备指纹结合成单一判定。IP 信誉是汇入设备级决策的一个维度,因此那些击败了网络检查的住宅代理流量,仍会在设备层被解析出来,而粗糙的数据中心流量在花掉任何成本之前就被过滤掉。判定在 50 毫秒内返回,同时附带网络和设备两方面的信号。
想看看这两层如何为你的真实流量评分——包括单靠 IP 信誉会漏掉的那部分住宅代理欺诈?