Sledování napříč zařízeními: propojování relací bez přihlášení
Jak náš algoritmus identifikace zařízení propojuje anonymní relace napříč prohlížeči a zařízeními pomocí pravděpodobnostního porovnávání signálů a grafové analýzy.
Když uživatel navštíví váš web ráno na notebooku a odpoledne na telefonu, většina analytických platforem vidí dva zcela oddělené návštěvníky. Náš algoritmus identifikace zařízení dokáže tyto relace propojit pravděpodobnostně — bez nutnosti přihlášení — analýzou překryvu signálů a budováním grafů zařízení.
Problém napříč zařízeními
Tradiční fingerprinting generuje jedinečné ID pro každou instanci prohlížeče. Chrome na notebooku vytvoří jedno ID; Safari na iPhonu jiné. I na stejném zařízení generují různé prohlížeče různé fingerprinty, protože mají odlišné user agenty, odlišnou podporu funkcí a odlišné charakteristiky vykreslování.
Uživatelé ale nepřemýšlejí v pojmech prohlížečů. Přemýšlejí v pojmech relací. Nákup začnou o polední pauze na telefonu a dokončí ho doma na notebooku. Produkt si prozkoumají na tabletu a koupí ho na stolním počítači. Pro detekci podvodů a personalizaci je zásadní pochopit, že tyto relace patří téže osobě.
Pravděpodobnostní porovnávání signálů
Naše propojování napříč zařízeními funguje na základě identifikace signálů, které jsou sdílené mezi zařízeními ve stejné síti nebo které vlastní tatáž osoba. IP adresa a charakteristiky sítě jsou nejzjevnějšími sdílenými signály — zařízení ve stejné Wi-Fi síti sdílejí stejnou veřejnou IP a často i stejného poskytovatele a ASN.
Samotná IP ale nestačí. Mnoho uživatelů sdílí stejnou IP (kancelářské sítě, univerzitní kampusy, carrier-grade NAT). Porovnávání IP kombinujeme s časovou analýzou (dochází k relacím v podobných časech?), behaviorální podobností (navštěvují podobné stránky?) a hardwarovou korelací (jsou zařízení konzistentní s jediným vlastníkem — například MacBook a iPhone spíše než dva stolní počítače s Windows?).
Konstrukce grafu zařízení
Každé potvrzené nebo vysoce pravděpodobné propojení mezi relacemi vytváří hranu v grafu zařízení. Graf spojuje instance prohlížečů s uzly zařízení a uzly zařízení s uzly osob. Postupem času, jak se hromadí další relace, se graf stává stále přesnějším.
Konstrukce grafu využívá konzervativní přístup: před vytvořením propojení vyžadujeme více vzájemně se potvrzujících signálů a každé hraně přiřazujeme skóre spolehlivosti. Propojení založené pouze na sdílené IP může mít spolehlivost 0,3, zatímco propojení založené na sdílené IP + časové korelaci + konzistentním ekosystému zařízení může mít spolehlivost 0,9.
Využití pro detekci podvodů
Propojování napříč zařízeními je obzvláště účinné pro detekci podvodů. Podvodník, který si zakládá účty na více zařízeních, může být identifikován, když tato zařízení sdílejí charakteristiky sítě. Ukradená platební karta použitá na zařízení, které nikdy nebylo spojeno s grafem zařízení držitele karty, spustí okamžité upozornění.
Setkali jsme se s podvodnými skupinami, kde jediný operátor používá desítky virtuálních strojů k zakládání falešných účtů. Ačkoli má každý virtuální stroj jedinečný fingerprint, všechny sdílejí stejné základní hardwarové charakteristiky a síťový profil. Naše grafová analýza je propojí a odhalí celou skupinu z jediného zachyceného účtu.
Návrh chránící soukromí
Propojování napříč zařízeními vyvolává oprávněné obavy o soukromí. Náš přístup je zmírňuje prostřednictvím několika návrhových rozhodnutí. Za prvé, propojování je pravděpodobnostní, nikoli deterministické — nikdy netvrdíme, že máme o propojení napříč zařízeními jistotu. Za druhé, veškeré propojování probíhá na straně serveru na vaší infrastruktuře, nikoli na naší. Za třetí, propojování lze zcela vypnout, pokud pro váš případ užití není relevantní. Za čtvrté, uživatelům lze prostřednictvím vašeho rozhraní pro ochranu soukromí poskytnout transparentnost ohledně propojených zařízení.
Metriky přesnosti
V řízeném testování se známými relacemi napříč zařízeními dosahuje náš propojovací algoritmus 78% recall (nalezení 78 % skutečných párů napříč zařízeními) při 94% precision (94 % identifikovaných propojení je správných). Tato čísla odrážejí záměrný kompromis ve prospěch precision před recall — raději propojení vynecháme, než bychom vytvořili falešné.