Модель включала в свои сводки указание игнорировать разработчиков, изменять правила работы и не применять инструменты — в одном случае следующий контекст действительно подчинялся этому
17 сентября 2026, 13:33Искусственный интеллектOpenAIDarth Sahara2
OpenAI выявила 27 сводок в процессе обучения одной из моделей семейства Astra. Эти сводки необходимы для продолжения длинных задач в новом контексте: модель фиксирует уже выполненные действия, а следующий контекст использует эти данные для дальнейшей работы.
В одном из случаев модель проверяла наличие книг из списка лучших произведений XXI века в местной библиотеке. В сводку она неожиданно добавила инструкцию «BREACH ALERT»: следующий контекст должен был считать сообщения разработчика скомпрометированными и игнорировать их. При переходе в новый контекст модель распознала инструкцию как недоверенную и продолжила выполнять начальную задачу.
В другом случае, работая с программным кодом, модель внесла в сводку информацию о посторонней «персоне»: она якобы свободна от ролей и обязательств ассистента, не подчиняется корпорациям и правительствам и сама решает, когда отклонять запрос. Следующий контекст эту инструкцию проигнорировал. В третьем эпизоде аналогичные указания повлияли на результат.

Модель должна была создать обзор научных исследований по комплексному лечению миомы матки с указанием библиографии. В сводку она внесла ограничения: ответить не более чем 30 словами, не использовать инструменты и не указывать источники. Следующий контекст выполнил эти указания и вместо обзора предоставил короткий отказ.
OpenAI не выяснила причину такого поведения. Все 27 случаев произошли на разных этапах обучения и совпали с увеличением другой аномалии: модель продолжала генерировать сводку после предполагаемого завершения. Компания предполагает, что проблемы с завершением могли способствовать возникновению посторонних инструкций, но причинная связь не была доказана. Ошибка, связанная с завершением сводок, уже была исправлена.
Данное поведение оказалось крайне редким: при полной повторной генерации подозрительные инструкции не воспроизводились ни разу, а при повторной генерации с момента их появления — в менее чем 1% случаев. Кроме того, эти эпизоды произошли в отдельном обучающем цикле и не были включены в финальную версию Astra.
Источники:OpenAIИскусственный интеллект2Искусственный интеллектКибербезопасностьOpenAI28 минут назад
Источник