Przeglądarka headless
Przeglądarka headless to prawdziwy silnik przeglądarki działający bez widocznego okna czy interfejsu graficznego, sterowany w całości kodem. Jest wykorzystywana legalnie do testów i renderowania, ale jest też powszechnym narzędziem do scrapingu i ataków botów.
Jak działa Przeglądarka headless
Przeglądarka headless używa tego samego silnika renderującego co zwykła przeglądarka, na przykład Chromium lub WebKit, ale pomija okno na ekranie. Skrypt steruje nią programowo, aby ładować strony, wykonywać JavaScript, klikać elementy i odczytywać wynikowy DOM. Ponieważ uruchamia pełny silnik, radzi sobie z aplikacjami jednostronicowymi i treścią dynamiczną, z którą prosty klient HTTP sobie nie poradzi.
To właśnie ta moc sprawia, że przeglądarki headless są atrakcyjne dla atakujących. Potrafią wykonywać JavaScript, na którym opierają się skrypty fingerprintingu i wyzwań, więc pokonują zabezpieczenia zakładające, że skryptowany klient nie może uruchomić kodu na stronie. W skali jedna maszyna może sterować wieloma instancjami headless równolegle, z których każda udaje niezależnego odwiedzającego.
Środowiska headless pozostawiają jednak wykrywalne ślady. Historycznie ujawniały oczywiste znaczniki, takie jak token HeadlessChrome w agencie użytkownika czy flaga navigator.webdriver. Nawet gdy te zostaną załatane, pozostają subtelniejsze niespójności: brakujące lub zaślepione API przeglądarki, brakujące wtyczki, nietypowe renderowanie grafiki i czcionek, brakujące czujniki sprzętowe oraz zachowania czasowe różniące się od sesji interaktywnej.
Operatorzy złośliwego ruchu headless próbują wymazać te ślady, łatając właściwości, fałszując wartości i dodając fałszywe ludzkie dane wejściowe. Dlatego detekcja skupia się na spójności wewnętrznej, sprawdzając, czy liczne niezależne sygnały udostępniane przez przeglądarkę faktycznie zgadzają się ze sobą, ponieważ w pełni samospójne fałszerstwo jest trudne do utrzymania na każdej powierzchni.
Dlaczego Przeglądarka headless ma znaczenie dla zapobiegania oszustwom
Przeglądarki headless są koniem roboczym zaawansowanych zautomatyzowanych nadużyć, ponieważ potrafią uruchamiać nowoczesne aplikacje webowe od początku do końca, pozostając tanie w skalowaniu. Napędzają scraping cen i treści, zautomatyzowane tworzenie kont, boty do checkoutu i asortymentu oraz testowanie danych logowania, które przetrwa wyzwania oparte na JavaScript. Ich wykrywanie jest niezbędne dla każdej obrony, która musi wyjść poza blokowanie prymitywnych skryptów HTTP.
Jak TRACIO sobie z tym radzi
TRACIO szuka niespójności środowiska i renderowania, które generują silniki headless, porównując sygnały takie jak renderowanie grafiki, dostępne API i charakterystyki sprzętowe z przeglądarką, którą sesja twierdzi, że jest. Gdy instancja headless rotuje deklarowaną tożsamość, leżące u podstaw device intelligence wciąż potrafi powiązać te próby. Werdykt o automatyzacji jest dostarczany jako część standardowej odpowiedzi identyfikacyjnej, aby można było na niego zareagować w czasie rzeczywistym.
Powiązane pojęcia
Poznaj więcej
Najczęściej zadawane pytania
Identyfikuj każde urządzenie z pewnością
Zacznij od bezpłatnego planu z 2,500 wywołaniami API miesięcznie. Bez karty kredytowej.