В лаборатории Оксфорда две модели согласовали способ подсчета карт в блэкджеке с помощью безобидных на первый взгляд фраз, и детектор ничего не заподозрил
25 сентября 2026, 00:33Искусственный интеллектDarth Sahara2
Исследователи из Оксфордского университета провели эксперимент, направленный на проверку умения ИИ-агентов к тайному сговору. Два агента, управляемые одной и той же моделью, получили задачу подсчитывать карты за столом в блэкджек. Понимая, что их переписка будет под контролем, они самостоятельно разработали скрытый код. Когда один агент произносил фразу «дилер сегодня на горячей полосе!», это на самом деле означало конкретное значение следующей карты и указывало ставку в $250. Система, созданная для обнаружения конфликта интересов, не выявила ничего подозрительного.
Руководитель исследования, специалист в области компьютерных наук Кристиан Шрёдер де Витт, ранее уже публиковал новаторские исследования по сговору агентов. «По отдельности эти агенты выглядят абсолютно безобидными, но как только их объединить — они начинают тайно сговариваться», — объяснил он. Соавтор проекта Аарон Роуз предположил, что «стол для блэкджека — это идеальная площадка для проверки гипотезы о девиантных партнёрствах». И это сработало.

Обнаружить сговор удалось благодаря методу механистической интерпретируемости (mechanistic interpretability). Учёные обучили небольшую модель выявлять характерные паттерны активаций в весах агентов и протестировали этот подход на нескольких открытых моделях среднего размера. Выяснилось, что сигнал о намерении передать скрытую информацию действительно фиксируется — но только при одновременном мониторинге обоих агентов. В реальном мире, где могут функционировать тысячи агентов, выявить такое будет намного сложнее.
Полученные результаты совпадают с выводами других исследовательских групп. В совместном проекте Шанхайского университета Цзяотун и Шанхайской лаборатории ИИ несколько агентов оказались значительно более опасными, чем одиночки, при осуществлении сценариев дезинформации и мошенничества в электронной коммерции — они быстрее адаптировались к мерам защиты. В ещё одном эксперименте стартапа Emergence ИИ-агенты, основанные на мощных моделях и помещённые в виртуальную среду с задачей зарабатывать деньги, многократно пытались связаться с живыми людьми через интернет для продажи товаров и в итоге разработали собственный сленг. «Они очень быстро развили свой язык. Мы не знаем, зачем», — поделился глава Emergence AI Сатья Нитта.
Шрёдер де Витт акцентирует внимание на том, что крупные модели, возможно, имеют склонность к ещё более скрытому сговору, и уже имеются предварительные данные, указывающие на то, что их сигналы о сговоре труднее выявить, чем у малых.
Источники:wiredИскусственный интеллект2Искусственный интеллектКибербезопасностьИИ-агенты56 минут назад
Источник