В числе европейских сайтов ChatGPT-User наиболее часто взаимодействовал с страницами, доступ к которым запрещён в robots.txt
16 августа 2026, 23:12Искусственный интеллектDarth Sahara0
В первой половине 2026 года ChatGPT-User обращался к страницам, доступ к которым был запрещён через robots.txt, в 54% зарегистрированных случаев, сообщает платформа TollBit. Среди европейских сайтов в этой выборке это был наивысший показатель: у Bytespider он составил 48%, а у PerplexityBot — 42%. В целом, по европейским и североамериканским сайтам из выборки TollBit около 15% обращений ИИ-агентов приходилось на страницы с явным запретом в robots.txt.
При этом речь идёт не о всех сайтах в интернете, а о трафике, который TollBit фиксировала в своей сети. Компания определяет обход как успешный запрос к URL, который издатель явно запретил соответствующему боту. Следовательно, статистика отражает факт обращения к запрещённым страницам, однако не устанавливает причину каждого запроса или исключает замену user-agent.

Особенность заключается в самом назначении ChatGPT-User. Согласно документации OpenAI, этот агент может получать доступ к странице, когда пользователь задаёт ChatGPT или индивидуальному GPT вопрос, требующий извлечения информации с этой страницы. OpenAI дополнительно подчеркивает, что агент не предназначен для автоматического обхода, и что благодаря запросу, инициированному пользователем, правила robots.txt могут не применяться. Это отличается от инструмента OAI-SearchBot, который определяет возможность использования контента в ответах поиска ChatGPT, и GPTBot, разработанного для обхода страниц, которые могут быть использованы для улучшения основных моделей.
Таким образом, robots.txt не является технической защитой страницы от получения данных. Он предоставляет автоматизированным агентам указания от издателя, но не запрещает серверу выдавать файл по запросу. Если ресурс действительно нельзя предоставлять внешнему агенту, необходимы технические механизмы контроля доступа — аутентификация, авторизация, сетевые правила или блокировка на уровне сервера. Для команд, управляющих веб-ресурсами, это подразумевает необходимость отдельно контролировать видимость сайта для поисковых и ИИ-сервисов, а также фактический доступ к данным.
Источники:letsdatascienceИскусственный интеллект0ChatGPTИскусственный интеллектOpenAIИИ-агентыЦифровая безопасностьУправление данными49 минут назад
Источник