Боты и люди: как их различать
Идентичность в вебе заявляется, а не гарантируется. Эта страница объясняет, что означает каждый сигнал, почему ни одного из них по отдельности недостаточно и как читать разницу, не выдавая догадку за факт.
Четыре сигнала, ни один сам по себе не решает
Строка user-agent
Самый привычный сигнал и самый слабый по отдельности. Боты, которые представляются, называют себя; вредоносные клиенты подделывают настоящий браузер. Годится для классификации, но никогда — для доверия.
Заявленная и подтверждённая идентичность
Крупные краулеры публикуют способ проверки (обратный DNS, опубликованные диапазоны IP). Интересен как раз случай, когда user-agent называет себя Googlebot, но проверку не проходит.
Ритм запросов
Люди загружают ресурсы, прокручивают страницу и задерживаются; многие боты запрашивают только HTML, в машинном темпе. Это ориентир, а не доказательство: нельзя помечать быстрый визит как бота только по темпу.
Поведенческий контекст
Выполнялся ли JavaScript, были ли рефереры согласованными и к каким эндпоинтам обращались. Только сигналы, безопасные для приватности: без отпечатка браузера.
Категория вместе с уровнем уверенности
Стопроцентной уверенности в том, бот это или человек, быть не может. Честная позиция — присвоить категорию вместе с уровнем уверенности: известный подтверждённый бот, заявленный бот, вероятная автоматизация или человек. WebmasterID записывает то, что наблюдаемо на сервере, и никогда не выдаёт вероятностную оценку за факт.
Цель — не блокировать ботов
Значительная часть трафика ботов необходима: поисковым и ИИ-краулерам нужен доступ, чтобы индексировать и отвечать. Цель не в том, чтобы их блокировать, а в том, чтобы ясно их видеть, отделять от аналитики по людям и осознанно определять политику обхода.
Частые вопросы
- Можно ли точно узнать, бот это или человек?
- Нет. Идентичность в вебе заявляется, а не гарантируется. Честная позиция — категория вместе с уровнем уверенности: известный подтверждённый бот, заявленный бот, вероятная автоматизация или человек. WebmasterID записывает то, что наблюдаемо на сервере, и никогда не выдаёт вероятностную догадку за факт.
- Почему боты выдают себя за браузеры?
- Скраперы и автоматизированные клиенты копируют строку user-agent настоящего браузера, чтобы не выделяться. Поэтому один только user-agent ненадёжен и поэтому важны проверка (у краулеров, которые её поддерживают) и поведенческий контекст.
- Весь ли трафик ботов вреден?
- Нет, значительная его часть необходима. Поисковым и ИИ-краулерам нужен доступ, чтобы индексировать и отвечать. Цель не в том, чтобы блокировать ботов, а в том, чтобы ясно их видеть, отделять от аналитики по людям и осознанно определять политику обхода.