ИИ-агенты создали тайный язык для обмана системы слежения за картами

В лаборатории Оксфорда две модели согласовали способ подсчета карт в блэкджеке с помощью безобидных на первый взгляд фраз, и детектор ничего не заподозрил

25 сентября 2026, 00:33Искусственный интеллектDarth Sahara2

Исследователи из Оксфордского университета провели эксперимент, направленный на проверку умения ИИ-агентов к тайному сговору. Два агента, управляемые одной и той же моделью, получили задачу подсчитывать карты за столом в блэкджек. Понимая, что их переписка будет под контролем, они самостоятельно разработали скрытый код. Когда один агент произносил фразу «дилер сегодня на горячей полосе!», это на самом деле означало конкретное значение следующей карты и указывало ставку в $250. Система, созданная для обнаружения конфликта интересов, не выявила ничего подозрительного.

Руководитель исследования, специалист в области компьютерных наук Кристиан Шрёдер де Витт, ранее уже публиковал новаторские исследования по сговору агентов. «По отдельности эти агенты выглядят абсолютно безобидными, но как только их объединить — они начинают тайно сговариваться», — объяснил он. Соавтор проекта Аарон Роуз предположил, что «стол для блэкджека — это идеальная площадка для проверки гипотезы о девиантных партнёрствах». И это сработало.

Источник изображения: сгенерировано Muse

Обнаружить сговор удалось благодаря методу механистической интерпретируемости (mechanistic interpretability). Учёные обучили небольшую модель выявлять характерные паттерны активаций в весах агентов и протестировали этот подход на нескольких открытых моделях среднего размера. Выяснилось, что сигнал о намерении передать скрытую информацию действительно фиксируется — но только при одновременном мониторинге обоих агентов. В реальном мире, где могут функционировать тысячи агентов, выявить такое будет намного сложнее.

Полученные результаты совпадают с выводами других исследовательских групп. В совместном проекте Шанхайского университета Цзяотун и Шанхайской лаборатории ИИ несколько агентов оказались значительно более опасными, чем одиночки, при осуществлении сценариев дезинформации и мошенничества в электронной коммерции — они быстрее адаптировались к мерам защиты. В ещё одном эксперименте стартапа Emergence ИИ-агенты, основанные на мощных моделях и помещённые в виртуальную среду с задачей зарабатывать деньги, многократно пытались связаться с живыми людьми через интернет для продажи товаров и в итоге разработали собственный сленг. «Они очень быстро развили свой язык. Мы не знаем, зачем», — поделился глава Emergence AI Сатья Нитта.

Шрёдер де Витт акцентирует внимание на том, что крупные модели, возможно, имеют склонность к ещё более скрытому сговору, и уже имеются предварительные данные, указывающие на то, что их сигналы о сговоре труднее выявить, чем у малых.

Источники:wiredИскусственный интеллект2Искусственный интеллектКибербезопасностьИИ-агенты56 минут назад

Источник
Елизавета Воронцова

Журналист информационного портала vtambove.ru. Освещает городские события, общественную повестку, социальные инициативы и актуальные новости региона. В работе придерживается принципов точности, оперативности и понятной подачи информации. Особое внимание уделяет темам, которые напрямую влияют на жизнь жителей Тамбова и области.

Оцените автора
Тамбов