Phát hiện AI agent: Trình duyệt của Claude, ChatGPT và Perplexity khác con người ra sao
AI agent xuất hiện như trình duyệt nhưng hành xử khác hẳn con người — phiên ngắn hướng mục tiêu, click chính xác từng pixel, không lỗi gõ. 11 tín hiệu tách lưu lượng Computer Use, Operator và Perplexity khỏi khách truy cập thật.
Năm 2024, AI agent bước từ những bản demo thử nghiệm vào lưu lượng production. API Computer Use của Claude có thể điều khiển một trình duyệt. Công cụ duyệt web của ChatGPT điều hướng các website để trả lời truy vấn. Answer engine của Perplexity crawl theo thời gian thực. Và một hạng mục ngày càng lớn của các trợ lý dùng AI — Browserbase, Computer Use của Anthropic, OpenAI Operator — thực hiện các tác vụ web đầu cuối thay cho người dùng.
Với một website, điều này tạo ra một hạng mục khách truy cập mới không khớp với nhóm nào trong bot detection truyền thống. AI agent không phải scraper trích xuất dữ liệu ở quy mô lớn. Chúng cũng không phải con người click qua giao diện. Chúng là thứ gì đó ở giữa — một khách truy cập mỗi phiên, một mục tiêu mỗi lần ghé thăm, nhưng thực thi ở tốc độ máy với độ chính xác cơ khí.
Phát hiện chúng có ý nghĩa khác với phát hiện bot. Đôi khi bạn muốn phục vụ chúng (một agent hữu ích đang mua sắm cho khách hàng). Đôi khi bạn muốn chặn chúng (scraping trái phép qua một lớp bọc AI). Dù thế nào, trước hết bạn phải biết chúng có mặt.
AI agent khác nhau về kiến trúc ra sao
Ba kiến trúc chính tạo ra lưu lượng AI agent trên web:
Agent điều khiển trình duyệt chạy một trình duyệt headless hoặc headful được điều khiển bởi một LLM. Computer Use của Anthropic, OpenAI Operator, Browserbase và Skyvern đều thuộc nhóm này. Trình duyệt là Chrome hoặc Chromium thật. Agent ra lệnh cho nó qua thao tác DOM hoặc qua phân tích ảnh chụp màn hình và click theo tọa độ.
Agent chỉ dùng API tải các trang qua thư viện HTTP (Node.js, Python, Go) và chuyển HTML cho một LLM xử lý. Hầu hết các agent của Perplexity và các agent dựa trên tìm kiếm hoạt động theo cách này. Không có trình duyệt — chỉ có một lớp tải nội dung đưa văn bản cho model.
Agent lai dùng trình duyệt cho các site nặng JavaScript và tải qua API cho nội dung tĩnh. Nhiều agent production rơi vào hạng mục này, chọn động dựa trên đối tượng mục tiêu.
Mỗi kiến trúc để lại dấu vết khác nhau.
Tín hiệu 1. Thời gian tồn tại của phiên trình duyệt
Người dùng thật có các phiên dài, không tập trung. Họ mở tab, bị phân tâm, quay lại. Thời lượng phiên trung vị của con người trong một tác vụ ra quyết định là 8–20 phút.
AI agent có các phiên ngắn, tập trung. Một tác vụ Computer Use điển hình — đặt vé máy bay, đặt hàng tạp hóa, trích xuất dữ liệu sản phẩm — mất từ 30 giây đến 3 phút từ đầu đến cuối. Phiên bắt đầu bằng việc tải trang, thực thi 5–30 hành động theo trình tự, rồi kết thúc.
Thời lượng phiên dưới 5 phút với hơn 10 hành động rời rạc và không có chuyển tab trình duyệt là hành vi bất thường với con người và điển hình với agent.
Tín hiệu 2. Độ chính xác click theo tọa độ
Các agent điều khiển trình duyệt của Anthropic và OpenAI dùng phân tích ảnh chụp màn hình để nhận diện phần tử giao diện, rồi click theo tọa độ. Việc tính tọa độ chính xác đến từng pixel.
Người dùng thật click trong các vùng. Một nút kích thước 200x40 pixel nhận các click phân bố khắp toàn bộ diện tích, thiên về trung tâm nhưng với độ biến thiên của con người. AI agent click trong một dải hẹp — thường trong khoảng 2–3 pixel quanh tâm hình học của phần tử. Một trăm click với độ lệch trung bình dưới 3 pixel không phải là phân bố của con người.
Việc phát hiện đòi hỏi thu thập tọa độ click và phân tích chúng tương đối với biên của phần tử. Cách này hoạt động tốt trên dữ liệu cấp phiên.
Tín hiệu 3. Thiếu cuộn khám phá
Con người cuộn để xem có gì trên trang. Họ cuộn xuống, rồi lên lại, rồi được một nửa. Họ dừng ở nội dung thu hút sự chú ý. Vết cuộn của họ lởm chởm.
AI agent chỉ cuộn khi cần. Nếu mục tiêu là click Thêm vào giỏ và nút đó nằm trên nếp gấp (above the fold), agent có thể không bao giờ cuộn. Nếu phần tử mục tiêu nằm dưới nếp gấp, agent cuộn một lần, thẳng đến mục tiêu, rồi thực thi.
Các phiên với ít hơn 2 lần đổi hướng cuộn, hoặc với vận tốc cuộn không đổi trên mọi sự kiện cuộn, cho thấy việc duyệt web hướng tác vụ chứ không phải khám phá.
Tín hiệu 4. Thời điểm nhập văn bản
Người dùng thật gõ với tốc độ 30–60 từ mỗi phút, có các khoảng dừng thay đổi, thỉnh thoảng xóa, và các chỉnh sửa vi mô. Thời điểm gõ phím tuân theo một phân bố có độ biến thiên cao và tỷ lệ xóa khác không.
AI agent điền form bằng cách dán giá trị hoặc mô phỏng gõ phím ở nhịp cố định — thường 50–100 ký tự mỗi giây, đều đặn, không xóa. Một trường được điền trong 200ms với chuỗi 30 ký tự và không có lần nhấn backspace nào không phải là nhập liệu của con người.
Tín hiệu 5. Thiếu lỗi gõ
Liên quan nhưng khác biệt: con người mắc lỗi gõ. Trong 1000 ký tự nhập văn bản, người dùng thật tạo ra 15–40 lần chỉnh sửa. AI agent tạo ra không lần nào. Một lần gửi form với 3 trường tổng cộng hơn 100 ký tự và không có lần chỉnh sửa nào là bất thường với con người.
Tín hiệu 6. Sự không nhất quán của user agent
Một số AI agent dùng user agent tùy chỉnh tự nhận diện rõ ràng: perplexity-user, ChatGPT-User, ClaudeBot. Đây là những agent lịch sự tuân theo quy ước tự nhận diện và thường tôn trọng robots.txt.
Việc phát hiện ở đây là chuyện đơn giản — đọc user agent, đối chiếu với các danh sách đã biết. Giá trị nằm ở việc biết khi nào phục vụ chúng khác đi (hoặc chặn chúng nếu bạn không muốn bị scraping).
Các agent khác chạy framework điều khiển trình duyệt và thừa hưởng bất kỳ user agent nào mà trình duyệt dùng — thường là Chrome. Những agent này khó nhận diện chỉ từ user agent hơn và đòi hỏi các tín hiệu hành vi.
Tín hiệu 7. Kết xuất WebGL dưới chế độ headless
Các agent điều khiển trình duyệt dùng Chromium ở chế độ headless để lộ renderer SwiftShader mà chúng ta đã bàn trong bài viết về Puppeteer. Bất kỳ phiên nào mà renderer WebGL chứa SwiftShader và khách truy cập thực thi hơn 10 hành động có chủ đích gần như chắc chắn là một AI agent điều khiển trình duyệt.
Các framework agent mới hơn (Browserbase, một số thiết lập Skyvern) chạy Chrome headful để tránh tín hiệu này. Chúng trình bày các chuỗi GPU thật. Điều này nghĩa là chỉ riêng WebGL là không đủ để phát hiện các agent hiện đại — cần thiết như một bộ lọc khởi đầu, không phải một giải pháp hoàn chỉnh.
Tín hiệu 8. Tuân thủ hoàn hảo theo cấu trúc trang
Người dùng thật click link ngay cả khi đang có chuyển hướng trang diễn ra. Họ tự ngắt quãng. Họ click đúp khi một click đơn là đủ. Họ click vào những thứ không phải link.
AI agent bám theo DOM. Khi muốn điều hướng, chúng phát ra một hành động nhắm vào một phần tử cụ thể. Chúng không click nhầm phần tử hay refresh giữa lúc tải. Các phiên của chúng diễn ra với sự tuyến tính cơ khí mà không con người bị phân tâm nào tạo ra.
Các vết phiên với sự tuân thủ hoàn hảo — mỗi click vào một phần tử hợp lệ, mỗi trường form được điền theo thứ tự DOM, mỗi lần chuyển trang được đi trước bằng một hành động có chủ đích — đọc như do agent điều khiển.
Tín hiệu 9. Time-to-interactive bằng không
Người dùng thật cần thời gian để xử lý một trang. Họ đọc. Họ quét. Họ hiểu trước khi hành động.
AI agent phân tích DOM ngay lập tức. Thời gian giữa lúc tải trang xong và hành động đầu tiên của người dùng, với một người dùng thật, thường là 1,5–4 giây ngay cả trên các trang đơn giản. Với AI agent, nó có thể dưới 200ms — khoảng thời gian LLM cần để nhận diện phần tử mục tiêu trong DOM.
Thời gian hành động đầu tiên rất nhanh trên một trang đòi hỏi phải hiểu nội dung là một tín hiệu agent mạnh.
Tín hiệu 10. Mẫu tải HTTP cho agent chỉ dùng API
Perplexity, một số luồng dùng công cụ của Claude, và hầu hết các agent dựa trên tìm kiếm không chạy trình duyệt. Chúng tải các trang trực tiếp qua thư viện HTTP.
Các agent này để lại các tín hiệu TLS và HTTP mà chúng ta đã bàn trước đó — fingerprint undici của Node.js, fingerprint requests của Python, fingerprint net/http của Go. Chúng thường không thực thi JavaScript, nên hoàn toàn không kích hoạt việc phát hiện phía client.
Việc phát hiện agent chỉ dùng API diễn ra ở lớp mạng: hash TLS JA4, thứ tự header HTTP, thiếu các hành vi đặc thù của trình duyệt (không tải favicon, không có beacon analytics, không có yêu cầu font). Nếu bạn muốn nhận diện các agent này, bạn phải nhìn vào những gì đang không xảy ra nhiều như những gì đang xảy ra.
Tín hiệu 11. Mục tiêu phiên có hình dạng tác vụ
Tín hiệu mạnh nhất không mang tính kỹ thuật — nó mang tính hành vi. Các phiên AI agent hướng mục tiêu theo những cách mà phiên của con người hiếm khi có.
Một người dùng thật tìm kiếm một sản phẩm có thể xem 8 món, so sánh thông số qua 3 tab, đọc đánh giá, bỏ dở rồi quay lại một giờ sau, rồi mới mua. Một AI agent đi thẳng đến sản phẩm, trích xuất thông số, thêm vào giỏ, thanh toán. Dưới 90 giây. Không đi chệch.
Các hệ thống phát hiện theo dõi tỷ lệ hoàn thành mục tiêu cấp phiên có thể nhận diện lưu lượng agent bằng mật độ hoàn thành tác vụ thành công trong các phiên ngắn. Đây là tín hiệu chậm hơn nhưng rất đáng tin khi kết hợp với các tín hiệu theo từng hành động.
Phục vụ agent theo cách khác
Một khi đã nhận diện, lưu lượng AI agent có thể được xử lý theo vài cách:
-
Chặn — nếu site không muốn bị truy cập tự động, từ chối ngay tại biên. Rẻ và đơn giản.
-
Phục vụ nội dung thay thế — phản hồi bằng một phiên bản tối ưu cho API (JSON, dữ liệu có cấu trúc) rẻ hơn để tạo ra so với trang HTML đầy đủ.
-
Giới hạn tần suất — cho phép agent nhưng ràng buộc tốc độ yêu cầu của chúng để giữ hiệu năng của site.
-
Tính phí — một số site đang bắt đầu tính phí các công ty AI cho việc truy cập dữ liệu của họ theo chương trình. Việc phát hiện là điều kiện tiên quyết để tính tiền.
-
Phục vụ bình thường — nếu agent đang hành động thay cho một khách hàng thật, phục vụ chúng chính là kinh doanh.
Các site khác nhau sẽ đưa ra các lựa chọn khác nhau. Điều quan trọng về mặt kỹ thuật là có sẵn cơ chế phát hiện để lựa chọn đó khả dụng.
Mục tiêu di động
Các framework AI agent cải thiện hàng tháng. Anthropic phát hành các bản cập nhật cho Computer Use bổ sung biến thiên cuộn. Browserbase thêm rung chuột. OpenAI Operator giới thiệu mô phỏng lỗi gõ. Mỗi thế hệ framework khép lại một phần bề mặt phát hiện được mô tả ở trên.
Các kỹ thuật hiệu quả năm 2026 sẽ cần cập nhật vào năm 2027. Nhưng thực tế nền tảng sẽ không thay đổi: AI agent thực thi tác vụ. Con người trải nghiệm website. Sự bất đối xứng đó tạo ra tín hiệu, bất kể agent dùng kỹ thuật cụ thể nào để cố hòa lẫn.
Các stack phát hiện coi AI agent là một hạng mục dai dẳng, không ngừng tiến hóa — chứ không phải một bài toán giải một lần là xong — sẽ duy trì được tầm nhìn. Những stack triển khai một bộ phát hiện duy nhất rồi bỏ đó sẽ thấy độ bao phủ của mình âm thầm suy giảm.