Cross-Device трекінг: зв’язування сесій без логіну
Як наш алгоритм ідентифікації пристроїв поєднує анонімні сесії між браузерами й пристроями за допомогою імовірнісного зіставлення сигналів і графового аналізу.
Коли користувач заходить на ваш сайт з ноутбука зранку та з телефона по обіді, більшість аналітичних платформ бачать двох цілком різних відвідувачів. Наш алгоритм ідентифікації пристроїв здатен імовірнісно поєднати ці сесії — без вимоги логіну — аналізуючи перетин сигналів і будуючи графи пристроїв.
Проблема cross-device
Традиційний fingerprinting генерує унікальний ID для кожного екземпляра браузера. Chrome на ноутбуці дає один ID; Safari на iPhone — інший. Навіть на одному пристрої різні браузери генерують різні fingerprint’и, бо мають різні user agent, різну підтримку можливостей і різні характеристики рендерингу.
Але користувачі не мислять категоріями браузерів. Вони мислять категоріями сесій. Вони починають покупку на телефоні під час обіду та завершують її на ноутбуці вдома. Вони досліджують товар на планшеті й купують його на десктопі. Для виявлення шахрайства та персоналізації критично розуміти, що ці сесії належать одній і тій самій людині.
Імовірнісне зіставлення сигналів
Наше cross-device зв’язування працює через виявлення сигналів, спільних для пристроїв в одній мережі або тих, що належать одній людині. IP-адреса та мережеві характеристики — найочевидніші спільні сигнали: пристрої в одній Wi-Fi-мережі мають однаковий публічний IP і часто той самий ISP та ASN.
Але самого лише IP недостатньо. Багато користувачів мають спільний IP (офісні мережі, університетські кампуси, carrier-grade NAT). Ми поєднуємо зіставлення за IP із темпоральним аналізом (чи відбуваються сесії в схожий час?), поведінковою подібністю (чи відвідують вони схожі сторінки?) та апаратною кореляцією (чи узгоджуються пристрої з єдиним власником — наприклад, MacBook і iPhone, а не два десктопи на Windows?).
Побудова графа пристроїв
Кожен підтверджений або високоймовірний зв’язок між сесіями створює ребро у графі пристроїв. Граф поєднує екземпляри браузерів із вузлами пристроїв, а вузли пристроїв — із вузлами людей. З часом, у міру накопичення сесій, граф стає дедалі точнішим.
Побудова графа використовує консервативний підхід: ми вимагаємо кількох підтверджувальних сигналів, перш ніж створити зв’язок, і призначаємо кожному ребру оцінку впевненості. Зв’язок на основі самого лише спільного IP може мати впевненість 0.3, тоді як зв’язок на основі спільного IP + темпоральної кореляції + узгодженої екосистеми пристроїв може мати впевненість 0.9.
Застосування для виявлення шахрайства
Cross-device зв’язування особливо потужне для виявлення шахрайства. Шахрая, який створює акаунти на кількох пристроях, можна ідентифікувати, коли ці пристрої мають спільні мережеві характеристики. Викрадена кредитна картка, використана на пристрої, що ніколи не був пов’язаний із графом пристроїв власника картки, спричиняє негайне сповіщення.
Ми бачили fraud-ринги, де один оператор використовує десятки віртуальних машин для створення фейкових акаунтів. Хоча кожна VM має унікальний fingerprint, усі вони мають однакові базові апаратні характеристики та мережевий профіль. Наш графовий аналіз поєднує їх, викриваючи весь ринг з єдиного виявленого акаунта.
Дизайн зі збереженням приватності
Cross-device зв’язування породжує обґрунтовані занепокоєння щодо приватності. Наш підхід пом’якшує їх завдяки кільком проєктним рішенням. По-перше, зв’язування є імовірнісним, а не детермінованим — ми ніколи не стверджуємо певності щодо cross-device зв’язків. По-друге, усе зв’язування відбувається на боці сервера у вашій інфраструктурі, а не в нашій. По-третє, зв’язування можна повністю вимкнути, якщо воно не релевантне для вашого сценарію. По-четверте, користувачам можна надати прозорість щодо пов’язаних пристроїв через ваш інтерфейс приватності.
Метрики точності
У контрольованому тестуванні з відомими cross-device сесіями наш алгоритм зв’язування досягає 78% recall (знаходить 78% справжніх cross-device пар) при 94% precision (94% ідентифікованих зв’язків є коректними). Ці цифри відображають свідомий компроміс на користь precision над recall — ми радше пропустимо зв’язок, ніж створимо хибний.