Cross-device tracking: łączenie sesji bez logowania
Jak nasz algorytm identyfikacji urządzeń łączy anonimowe sesje w różnych przeglądarkach i urządzeniach dzięki probabilistycznemu dopasowaniu sygnałów i analizie grafów.
Gdy użytkownik rano odwiedza Twoją stronę na laptopie, a po południu na telefonie, większość platform analitycznych widzi dwóch zupełnie różnych odwiedzających. Nasz algorytm identyfikacji urządzeń potrafi połączyć te sesje probabilistycznie — bez wymogu logowania — analizując nakładanie się sygnałów i budując grafy urządzeń.
Problem cross-device
Tradycyjny fingerprinting generuje unikalny identyfikator dla każdej instancji przeglądarki. Chrome na laptopie daje jeden identyfikator; Safari na iPhonie — inny. Nawet na tym samym urządzeniu różne przeglądarki generują różne fingerprinty, ponieważ mają różne user agenty, różny zakres obsługiwanych funkcji i różną charakterystykę renderowania.
Ale użytkownicy nie myślą w kategoriach przeglądarek. Myślą w kategoriach sesji. Zaczynają zakup na telefonie w czasie lunchu, a kończą go na laptopie w domu. Szukają produktu na tablecie, a kupują go na komputerze stacjonarnym. Dla wykrywania oszustw i personalizacji kluczowe jest zrozumienie, że te sesje należą do tej samej osoby.
Probabilistyczne dopasowanie sygnałów
Nasze łączenie cross-device działa poprzez identyfikowanie sygnałów wspólnych dla urządzeń w tej samej sieci lub należących do tej samej osoby. Adres IP i charakterystyka sieci to najbardziej oczywiste wspólne sygnały — urządzenia w tej samej sieci Wi-Fi współdzielą ten sam publiczny adres IP, a często również tego samego dostawcę usług internetowych i ASN.
Ale samo IP to za mało. Wielu użytkowników współdzieli ten sam adres IP (sieci firmowe, kampusy uniwersyteckie, carrier-grade NAT). Dopasowanie IP łączymy z analizą czasową (czy sesje występują w podobnych porach?), podobieństwem behawioralnym (czy odwiedzają podobne strony?) oraz korelacją sprzętową (czy urządzenia są spójne z jednym właścicielem — na przykład MacBook i iPhone, a nie dwa komputery z Windowsem?).
Budowa grafu urządzeń
Każde potwierdzone lub wysoce prawdopodobne powiązanie między sesjami tworzy krawędź w grafie urządzeń. Graf łączy instancje przeglądarek z węzłami urządzeń, a węzły urządzeń z węzłami osób. Z czasem, w miarę gromadzenia się kolejnych sesji, graf staje się coraz dokładniejszy.
Budowa grafu opiera się na podejściu zachowawczym: przed utworzeniem powiązania wymagamy wielu potwierdzających się sygnałów, a każdej krawędzi przypisujemy ocenę pewności. Powiązanie oparte wyłącznie na wspólnym IP może mieć pewność 0,3, natomiast powiązanie oparte na wspólnym IP + korelacji czasowej + spójnym ekosystemie urządzeń może mieć pewność 0,9.
Zastosowania w wykrywaniu oszustw
Łączenie cross-device jest szczególnie skuteczne w wykrywaniu oszustw. Oszust, który zakłada konta na wielu urządzeniach, może zostać zidentyfikowany, gdy te urządzenia współdzielą charakterystykę sieci. Skradziona karta kredytowa użyta na urządzeniu, które nigdy nie było powiązane z grafem urządzeń posiadacza karty, natychmiast wywołuje alert.
Widzieliśmy siatki oszustów, w których pojedynczy operator używa dziesiątek maszyn wirtualnych do zakładania fałszywych kont. Choć każda maszyna wirtualna ma unikalny fingerprint, wszystkie współdzielą tę samą podstawową charakterystykę sprzętową i profil sieciowy. Nasza analiza grafów je łączy, ujawniając całą siatkę na podstawie jednego wykrytego konta.
Projekt chroniący prywatność
Łączenie cross-device budzi uzasadnione obawy o prywatność. Nasze podejście łagodzi je dzięki kilku decyzjom projektowym. Po pierwsze, łączenie jest probabilistyczne, a nie deterministyczne — nigdy nie twierdzimy, że mamy pewność co do powiązań między urządzeniami. Po drugie, całe łączenie odbywa się po stronie serwera, na Twojej infrastrukturze, a nie naszej. Po trzecie, łączenie można całkowicie wyłączyć, jeśli nie jest istotne dla Twojego przypadku użycia. Po czwarte, użytkownikom można zapewnić przejrzystość co do powiązanych urządzeń poprzez Twój interfejs prywatności.
Metryki dokładności
W kontrolowanych testach ze znanymi sesjami cross-device nasz algorytm łączenia osiąga 78% recall (wykrywa 78% prawdziwych par cross-device) przy 94% precision (94% zidentyfikowanych powiązań jest poprawnych). Liczby te odzwierciedlają celowy kompromis na rzecz precision kosztem recall — wolimy pominąć powiązanie, niż utworzyć fałszywe.