크로스 디바이스 추적: 로그인 없이 세션 연결하기
확률적 신호 매칭과 그래프 분석을 활용해, 우리의 디바이스 식별 알고리즘이 브라우저와 기기 전반에 걸친 익명 세션을 어떻게 연결하는지 설명합니다.
사용자가 아침에는 노트북으로, 오후에는 휴대폰으로 사이트를 방문하면, 대부분의 분석 플랫폼은 이를 완전히 별개의 두 방문자로 인식합니다. 우리의 디바이스 식별 알고리즘은 신호 중첩을 분석하고 디바이스 그래프를 구축함으로써, 로그인을 요구하지 않고도 이러한 세션을 확률적으로 연결할 수 있습니다.
크로스 디바이스 문제
전통적인 fingerprinting은 브라우저 인스턴스마다 고유한 ID를 생성합니다. 노트북의 Chrome은 하나의 ID를 만들고, iPhone의 Safari는 또 다른 ID를 만듭니다. 같은 기기에서도 브라우저마다 user agent가 다르고, 지원하는 기능이 다르며, 렌더링 특성이 다르기 때문에 서로 다른 fingerprint가 생성됩니다.
하지만 사용자는 브라우저 단위로 생각하지 않습니다. 그들은 세션 단위로 생각합니다. 점심시간에 휴대폰으로 구매를 시작하고, 집에서 노트북으로 마무리합니다. 태블릿으로 제품을 조사하고, 데스크톱으로 구매합니다. 부정 탐지와 개인화의 관점에서, 이러한 세션들이 같은 사람에게 속한다는 사실을 이해하는 것은 매우 중요합니다.
확률적 신호 매칭
우리의 크로스 디바이스 연결은 같은 네트워크상의 기기들 사이에서 공유되거나 같은 사람이 소유한 신호를 식별함으로써 동작합니다. IP 주소와 네트워크 특성은 가장 명백한 공유 신호입니다. 같은 Wi-Fi 네트워크에 있는 기기들은 동일한 공인 IP를 공유하며, 흔히 동일한 ISP와 ASN도 공유합니다.
하지만 IP만으로는 충분하지 않습니다. 많은 사용자가 동일한 IP를 공유합니다(사무실 네트워크, 대학 캠퍼스, carrier-grade NAT). 우리는 IP 매칭을 시간적 분석(세션이 비슷한 시간대에 발생하는가?), 행동 유사성(비슷한 페이지를 방문하는가?), 하드웨어 상관관계(기기들이 한 명의 소유자와 일관되는가 — 예를 들어 두 대의 Windows 데스크톱이 아니라 MacBook과 iPhone인가?)와 결합합니다.
디바이스 그래프 구성
확인되었거나 높은 확률로 연결된 세션 간의 각 링크는 디바이스 그래프에 엣지를 만듭니다. 그래프는 브라우저 인스턴스를 디바이스 노드에, 디바이스 노드를 사람 노드에 연결합니다. 시간이 지나 더 많은 세션이 쌓일수록 그래프는 점점 더 정확해집니다.
그래프 구성은 보수적인 접근을 취합니다. 우리는 링크를 만들기 전에 여러 보강 신호를 요구하며, 각 엣지에 신뢰도 점수를 부여합니다. 공유 IP만을 기반으로 한 링크는 신뢰도가 0.3일 수 있는 반면, 공유 IP + 시간적 상관관계 + 일관된 기기 생태계를 기반으로 한 링크는 신뢰도가 0.9일 수 있습니다.
부정 탐지 활용
크로스 디바이스 연결은 부정 탐지에서 특히 강력합니다. 여러 기기에서 계정을 생성하는 사기꾼은, 그 기기들이 네트워크 특성을 공유할 때 식별될 수 있습니다. 카드 소유자의 디바이스 그래프와 한 번도 연관된 적이 없는 기기에서 도난당한 신용카드가 사용되면 즉각적인 경보가 발생합니다.
우리는 한 명의 운영자가 수십 대의 가상 머신을 사용해 가짜 계정을 만드는 fraud ring을 목격한 적이 있습니다. 각 VM은 고유한 fingerprint를 갖지만, 이들은 모두 동일한 기저 하드웨어 특성과 네트워크 프로필을 공유합니다. 우리의 그래프 분석은 이들을 연결하여, 탐지된 단 하나의 계정으로부터 전체 ring을 드러냅니다.
프라이버시 보호 설계
크로스 디바이스 연결은 정당한 프라이버시 우려를 낳습니다. 우리의 접근 방식은 몇 가지 설계 결정을 통해 이를 완화합니다. 첫째, 연결은 결정적(deterministic)이 아니라 확률적입니다 — 우리는 크로스 디바이스 연관관계에 대해 결코 확실성을 주장하지 않습니다. 둘째, 모든 연결은 우리가 아니라 고객의 인프라에서 서버 측으로 처리됩니다. 셋째, 사용 사례와 무관하다면 연결을 완전히 비활성화할 수 있습니다. 넷째, 사용자에게는 여러분의 프라이버시 인터페이스를 통해 연결된 기기에 대한 투명성을 제공할 수 있습니다.
정확도 지표
알려진 크로스 디바이스 세션을 대상으로 한 통제된 테스트에서, 우리의 연결 알고리즘은 78% recall(실제 크로스 디바이스 쌍의 78%를 찾아냄)과 94% precision(식별된 링크의 94%가 정확함)을 달성합니다. 이 수치들은 recall보다 precision을 우선하는 의도적인 트레이드오프를 반영합니다 — 우리는 잘못된 링크를 만드느니 링크를 놓치는 편을 택합니다.