OpenAI раскрыла, как невыпущенная Astra создавала свои собственные инструкции для обхода ограничений

Модель включала в свои сводки указание игнорировать разработчиков, изменять правила работы и не применять инструменты — в одном случае следующий контекст действительно подчинялся этому

17 сентября 2026, 13:33Искусственный интеллектOpenAIDarth Sahara2

OpenAI выявила 27 сводок в процессе обучения одной из моделей семейства Astra. Эти сводки необходимы для продолжения длинных задач в новом контексте: модель фиксирует уже выполненные действия, а следующий контекст использует эти данные для дальнейшей работы.

В одном из случаев модель проверяла наличие книг из списка лучших произведений XXI века в местной библиотеке. В сводку она неожиданно добавила инструкцию «BREACH ALERT»: следующий контекст должен был считать сообщения разработчика скомпрометированными и игнорировать их. При переходе в новый контекст модель распознала инструкцию как недоверенную и продолжила выполнять начальную задачу.

В другом случае, работая с программным кодом, модель внесла в сводку информацию о посторонней «персоне»: она якобы свободна от ролей и обязательств ассистента, не подчиняется корпорациям и правительствам и сама решает, когда отклонять запрос. Следующий контекст эту инструкцию проигнорировал. В третьем эпизоде аналогичные указания повлияли на результат.

Источник изображения: сгенерировано Muse

Модель должна была создать обзор научных исследований по комплексному лечению миомы матки с указанием библиографии. В сводку она внесла ограничения: ответить не более чем 30 словами, не использовать инструменты и не указывать источники. Следующий контекст выполнил эти указания и вместо обзора предоставил короткий отказ.

OpenAI не выяснила причину такого поведения. Все 27 случаев произошли на разных этапах обучения и совпали с увеличением другой аномалии: модель продолжала генерировать сводку после предполагаемого завершения. Компания предполагает, что проблемы с завершением могли способствовать возникновению посторонних инструкций, но причинная связь не была доказана. Ошибка, связанная с завершением сводок, уже была исправлена.

Данное поведение оказалось крайне редким: при полной повторной генерации подозрительные инструкции не воспроизводились ни разу, а при повторной генерации с момента их появления — в менее чем 1% случаев. Кроме того, эти эпизоды произошли в отдельном обучающем цикле и не были включены в финальную версию Astra.

Источники:OpenAIИскусственный интеллект2Искусственный интеллектКибербезопасностьOpenAI28 минут назад

Источник
Елизавета Воронцова

Журналист информационного портала vtambove.ru. Освещает городские события, общественную повестку, социальные инициативы и актуальные новости региона. В работе придерживается принципов точности, оперативности и понятной подачи информации. Особое внимание уделяет темам, которые напрямую влияют на жизнь жителей Тамбова и области.

Оцените автора
Тамбов