跨设备追踪:无需登录即可关联会话
我们的设备识别算法如何通过概率化信号匹配与图分析,在不同浏览器和设备之间关联匿名会话。
当一位用户上午用笔记本电脑、下午用手机访问你的网站时,大多数分析平台会把这看作两个完全独立的访客。我们的设备识别算法能够以概率化的方式关联这些会话——无需登录——方法是分析信号重叠并构建设备图。
跨设备难题
传统指纹识别会为每个浏览器实例生成一个唯一 ID。笔记本上的 Chrome 生成一个 ID;iPhone 上的 Safari 生成另一个。即便在同一台设备上,不同浏览器也会生成不同的指纹,因为它们有不同的 user agent、不同的特性支持以及不同的渲染特征。
但用户并不以浏览器为单位思考,而是以会话为单位思考。他们在午餐时用手机开始一笔购买,回到家后用笔记本完成它。他们在平板上研究一款产品,然后在台式机上下单。对于欺诈检测和个性化而言,识别出这些会话属于同一个人至关重要。
概率化信号匹配
我们的跨设备关联围绕一张人员图构建,其中包含三类节点:访客(一个浏览器配置文件)、设备(多个浏览器配置文件之下的那台机器),以及由你自己的应用传给我们的、从带签名的邮箱地址或手机号派生出的哈希标识符。正是这些节点之间的边,把两个会话合并成同一个人。
这份清单中被刻意排除的是:IP 地址和 ASN。共享网络是最诱人却也最错误的信号——一间办公室、一座校园或一个运营商级 NAT 会把成千上万互不相关的人置于同一个地址之后,因此基于 IP 的边恰恰会制造出撤销代价最高的那类错误关联。我们真正使用的确定性边——同一台设备、同一个哈希标识符、同一个规范访客根——是共享网络无法凭空伪造出来的。
在此之上还有一个受限的概率化组件:一个访客已确认的行为配对可以作为挂载候选,每个访客的候选数量有上限,并且必须高于置信度下限。它只是扩大确定性边已经锚定的簇,而不会自行开启一个簇。
设备图构建
每一条已确认或高概率的会话关联都会在设备图中生成一条边。该图把浏览器实例连接到设备节点,再把设备节点连接到人的节点。随着时间推移,会话不断累积,图也变得越来越准确。
图的构建采用保守策略。一条确定性的边——同一台设备在两个浏览器配置文件之下被解析出来,或者同一个哈希标识符被提供给两个账户——会直接创建关联。任何比它更弱的证据都只被视为候选而非关联,必须越过置信度下限,并且受到上限约束,使得单个访客无法在身后拖出一个无边界的簇。处于隔离状态的访客或桥接节点会被完全跳过,而不是仅凭可疑就被合并。
欺诈检测应用
跨设备关联在欺诈检测方面尤其强大。一个在多个浏览器配置文件上运营账户的欺诈者,会在这些配置文件解析到底层同一台设备时被识别出来,或者在同一个带签名的标识符出现在其中两个账户背后时被识别出来。一张被盗的信用卡若被用在一台从未与持卡人设备图关联过的设备上,就会立即触发警报。
我们曾见过这样的欺诈团伙:单个操作者运行数十台虚拟机批量创建虚假账户。每台虚拟机呈现出各不相同的浏览器指纹,但它们全都托管在同一套物理硬件上,而设备解析正是把它们重新收敛回同一台机器的手段。那个共享的设备节点就是整张图赖以构建的边——它能从单个被检测到的账户出发揭露整个团伙,无需诉诸任何共享地址。
隐私保护设计
跨设备关联会引发合理的隐私担忧。我们的方案通过若干设计决策来缓解这些担忧。第一,该层默认关闭——它不会随着一次部署自动到来,而是要为某个工作区有意开启,在此之前根本不会构建任何人员图。第二,关联在服务端完成,从不暴露给浏览器,因此客户端无法读取关联图,而且该模式由我们这一侧设定,而不是由页面能够发送的任何内容设定。第三,标识符这条边只有在你自己的应用选择提供带签名的邮箱或手机号时才会存在——我们不会从访客那里推导出它。第四,可以通过你的隐私界面向用户提供关于已关联设备的透明信息。
准确率指标
这个权衡是刻意的,它偏向精确率而非召回率:我们宁可漏掉一条关联,也不愿制造一条错误的关联。这种偏好体现在设计之中,而不是体现在某个招牌数字上——确定性的边才创建关联,弱信号只扩大已有锚点的簇,被隔离的桥接节点会被跳过,每个簇都受上限约束。漏掉一条关联,代价是少发现一种欺诈模式,而这种模式你日后仍可能通过其他方式发现。一条错误的关联却会把两位真实客户合并成同一个人,而这个错误会传导到此后作出的每一个决策中。
在依赖它之前,请先在你自己的流量上做测量。跨设备召回率取决于你的用户中究竟有多少人会完成身份认证——标识符这条边是可用的最强一条边,而它只存在于你的应用主动提供它的地方。