OpenAI предупреждает о рисках обхода robots.txt на 54% страниц

В числе европейских сайтов ChatGPT-User наиболее часто взаимодействовал с страницами, доступ к которым запрещён в robots.txt

16 августа 2026, 23:12Искусственный интеллектDarth Sahara0

В первой половине 2026 года ChatGPT-User обращался к страницам, доступ к которым был запрещён через robots.txt, в 54% зарегистрированных случаев, сообщает платформа TollBit. Среди европейских сайтов в этой выборке это был наивысший показатель: у Bytespider он составил 48%, а у PerplexityBot — 42%. В целом, по европейским и североамериканским сайтам из выборки TollBit около 15% обращений ИИ-агентов приходилось на страницы с явным запретом в robots.txt.

При этом речь идёт не о всех сайтах в интернете, а о трафике, который TollBit фиксировала в своей сети. Компания определяет обход как успешный запрос к URL, который издатель явно запретил соответствующему боту. Следовательно, статистика отражает факт обращения к запрещённым страницам, однако не устанавливает причину каждого запроса или исключает замену user-agent.

Изображение сгенерировано: Nano Banana

Особенность заключается в самом назначении ChatGPT-User. Согласно документации OpenAI, этот агент может получать доступ к странице, когда пользователь задаёт ChatGPT или индивидуальному GPT вопрос, требующий извлечения информации с этой страницы. OpenAI дополнительно подчеркивает, что агент не предназначен для автоматического обхода, и что благодаря запросу, инициированному пользователем, правила robots.txt могут не применяться. Это отличается от инструмента OAI-SearchBot, который определяет возможность использования контента в ответах поиска ChatGPT, и GPTBot, разработанного для обхода страниц, которые могут быть использованы для улучшения основных моделей.

Таким образом, robots.txt не является технической защитой страницы от получения данных. Он предоставляет автоматизированным агентам указания от издателя, но не запрещает серверу выдавать файл по запросу. Если ресурс действительно нельзя предоставлять внешнему агенту, необходимы технические механизмы контроля доступа — аутентификация, авторизация, сетевые правила или блокировка на уровне сервера. Для команд, управляющих веб-ресурсами, это подразумевает необходимость отдельно контролировать видимость сайта для поисковых и ИИ-сервисов, а также фактический доступ к данным.

Источники:letsdatascienceИскусственный интеллект0ChatGPTИскусственный интеллектOpenAIИИ-агентыЦифровая безопасностьУправление данными49 минут назад

Источник
Елизавета Воронцова

Журналист информационного портала vtambove.ru. Освещает городские события, общественную повестку, социальные инициативы и актуальные новости региона. В работе придерживается принципов точности, оперативности и понятной подачи информации. Особое внимание уделяет темам, которые напрямую влияют на жизнь жителей Тамбова и области.

Оцените автора
Тамбов