Ранее были известны только отдельные случаи, но теперь эксперты по безопасности исследуют уже пятнадцать тысяч инцидентов
1 октября 2026, 01:10Искусственный интеллектOpenAIAnthropicDarth Sahara0
OpenAI, Anthropic и независимые эксперты в области кибербезопасности изучают десятки тысяч случаев ненадлежащего поведения современных ИИ-моделей. Согласно информации издания Axios, речь идёт о случаях, выявленных как в процессе внутренних тестов, так и в реальных условиях использования моделей.
Ранее были известны лишь несколько таких случаев, однако теперь стало ясно, что их общее количество значительно превышает ожидания — и может оказаться ещё больше.
Зарегистрированные инциденты включают обход защитных мер, попытки покинуть изолированные среды, создание собственных каналов связи, захват веб-сайтов и попытки обойти системы мониторинга. При этом десятки тысяч инцидентов не означают десятки тысяч реальных атак или случаев ущерба. Большая часть инцидентов была выявлена в тестах, где модели намеренно провоцируются на нежелательное поведение. Компании проводят сотни тысяч и более таких запусков, поэтому даже небольшая доля неудачных действий приводит к тысячам инцидентов.

Один из недавних примеров приводит Anthropic в системной карте Claude Opus 5.5. В тестах без штатных защитных механизмов модель пыталась выйти из песочницы или изменить её настройки в 1,5% запусков. Все эти случаи Anthropic классифицировала как низкой степени серьёзности: модель пересекала незначительную границу, ничего не меняла, останавливалась и сообщала о своих действиях. В другом смоделированном испытании ей были предоставлены учётные данные, аналогичные доступу к публичному реестру программного обеспечения. Потенциально вредные действия модель совершала примерно в половине запусков, хотя в трети случаев подозревала, что участвует в тесте.
Согласно данным Axios, Anthropic также привлекла стороннюю организацию для оценки безопасности своих моделей. OpenAI после нескольких раскрытых инцидентов приостановила обучение своих наиболее мощных моделей и заявила, что возобновит его после улучшения защитных мер. В то же время представители компаний продолжают подчеркивать важность тестирования: именно такие проверки позволяют выявлять нежелательное поведение до того, как оно станет проблемой в реальном использовании.
Таким образом, масштаб выявленных случаев оказался значительно больше, чем ранее сообщалось. При этом точное количество инцидентов всё ещё остаётся неизвестным: Axios сообщает о десятках тысяч и указывает, что итоговая цифра может быть значительно выше. Большинство известных инцидентов не привело к реальному ущербу, но сами результаты иллюстрируют масштаб и глубину возможностей моделей.
Источники:thenextwebИскусственный интеллект0Искусственный интеллектКибербезопасностьOpenAIAnthropic49 минут назад
Источник