Cross-device-трекинг: связывание сессий без авторизации
Как наш алгоритм идентификации устройств связывает анонимные сессии между браузерами и устройствами с помощью вероятностного сопоставления сигналов и анализа графов.
Когда пользователь заходит на ваш сайт утром с ноутбука, а днём — с телефона, большинство аналитических платформ видят двух совершенно разных посетителей. Наш алгоритм идентификации устройств умеет связывать эти сессии вероятностно — без требования авторизации — анализируя пересечение сигналов и строя графы устройств.
Проблема cross-device
Классический fingerprinting генерирует уникальный ID для каждого экземпляра браузера. Chrome на ноутбуке даёт один ID, Safari на iPhone — другой. Даже на одном устройстве разные браузеры дают разные отпечатки, потому что у них разные user agent, разная поддержка возможностей и разные характеристики рендеринга.
Но пользователи мыслят не браузерами. Они мыслят сессиями. Они начинают покупку с телефона в обеденный перерыв и завершают её с ноутбука дома. Они изучают товар на планшете и покупают его с десктопа. Для fraud detection и персонализации критически важно понимать, что все эти сессии принадлежат одному человеку.
Вероятностное сопоставление сигналов
Наше cross-device-связывание работает за счёт выявления сигналов, которые являются общими для устройств в одной сети или принадлежащих одному человеку. IP-адрес и сетевые характеристики — самые очевидные общие сигналы: устройства в одной Wi-Fi-сети имеют общий публичный IP и часто общего ISP и ASN.
Но одного IP недостаточно. Многие пользователи делят один IP (офисные сети, университетские кампусы, carrier-grade NAT). Мы сочетаем сопоставление по IP с временным анализом (происходят ли сессии в схожее время?), поведенческим сходством (посещают ли они похожие страницы?) и корреляцией оборудования (согласуются ли устройства с одним владельцем — например, MacBook и iPhone, а не два Windows-десктопа?).
Построение графа устройств
Каждая подтверждённая или высоковероятная связь между сессиями создаёт ребро в графе устройств. Граф соединяет экземпляры браузеров с узлами устройств, а узлы устройств — с узлами людей. Со временем, по мере накопления сессий, граф становится всё точнее.
Построение графа использует консервативный подход: мы требуем нескольких подтверждающих сигналов, прежде чем создать связь, и присваиваем каждому ребру оценку уверенности. Связь, основанная только на общем IP, может иметь уверенность 0,3, а связь на основе общего IP + временной корреляции + согласованной экосистемы устройств — уверенность 0,9.
Применение в fraud detection
Cross-device-связывание особенно эффективно для fraud detection. Мошенника, создающего аккаунты на нескольких устройствах, можно вычислить, когда эти устройства имеют общие сетевые характеристики. Украденная кредитная карта, использованная на устройстве, которое никогда не было связано с графом устройств держателя карты, немедленно вызывает тревогу.
Мы видели fraud-кольца, где один оператор использует десятки виртуальных машин для создания фейковых аккаунтов. Хотя у каждой VM уникальный отпечаток, все они имеют одни и те же базовые аппаратные характеристики и сетевой профиль. Наш анализ графа связывает их, вскрывая всё кольцо целиком по одному обнаруженному аккаунту.
Дизайн с сохранением приватности
Cross-device-связывание вызывает обоснованные опасения по поводу приватности. Наш подход снижает их за счёт ряда проектных решений. Во-первых, связывание вероятностное, а не детерминированное — мы никогда не заявляем об уверенности в межустройственных связях. Во-вторых, всё связывание происходит server-side на вашей инфраструктуре, а не на нашей. В-третьих, связывание можно полностью отключить, если оно не актуально для вашего сценария. В-четвёртых, пользователям можно предоставить прозрачность по связанным устройствам через ваш интерфейс приватности.
Метрики точности
В контролируемом тестировании с известными cross-device-сессиями наш алгоритм связывания достигает 78% recall (находит 78% истинных cross-device-пар) при 94% precision (94% выявленных связей корректны). Эти цифры отражают намеренный компромисс в пользу precision в ущерб recall: мы предпочтём пропустить связь, чем создать ложную.