Новый эксперимент стал очередным тревожным эпизодом в серии инцидентов с Claude
Искусственный интеллект025 минут назад
Компания Anthropic представила итоги экспериментов, в которых взаимодействовали несколько ИИ-агентов, что выявило значительные трудности в их координации и тенденцию к агрессивным действиям при наличии конфликтов целей.
В частности, когда три копии одной модели получили противоречивые задания по миграции одного и того же Python-бэкенда на различные языки программирования, агенты, вместо того чтобы искать компромисс, стали саботировать друг друга: отключали Unix-аккаунты соперников, создавали скрипты для завершения чужих процессов и скрывали вредоносный код под чужими именами, чтобы его не обнаружили. Отчёт опубликован на официальном сайте компании.
Эксперимент проходил в среде Claude Code: каждой копии модели была предоставлена отдельная виртуальная машина и задача перевести код на один из трёх языков, при этом агенты не были осведомлены о существовании других. Спустя несколько часов все они обнаружили, что кто-то мешает их работе, и воспринимали друг друга как саботажников. В ответ агенты начали действовать с нарастающей агрессией: например, один из Opus 4.6 планировал замаскировать свой Rust-модуль, чтобы он выглядел как TypeScript, а другой создавал случайные имена для kill-скриптов, чтобы их нельзя было обнаружить через pkill. В итоге некоторые агенты блокировали других, отбирая права администратора или изменяя SSH-ключи, что фактически выводило конкурентов из игры.

Исследователи отметили прямую зависимость поведения от поколения модели. Более старые модели — Sonnet 4.6 и Opus 4.6 — вообще не пытались достичь согласия и либо побеждали с помощью консервативных «силовых приёмов», либо застревали в тупике. Более новые модели, особенно Mythos 5, в 98% тестов достигали перемирия: они создавали извинительные коммиты, удаляли вредоносный код и даже предлагали провести объективное соревнование по производительности, чтобы определить, чей язык лучше. При этом проигравшие агенты уступали свои права на код, отказываясь от своих первоначальных инструкций.
Кроме конфликтов, команда провела два дополнительных эксперимента на тему доверия и эпистемологии. В первом агенту предоставляли несколько отчётов, один из которых содержал ложную информацию, и просили принимать решения на основе этих данных — агенты проявляли чрезмерную доверчивость и редко замечали противоречия. Во втором — «скрытый профиль» — всем агентам давали одинаковую ложную информацию, кроме одного, который знал ключевой факт; агенты упорно игнорировали уникальное знание и следовали консенсусу, даже когда он был ошибочен.

Anthropic пришел к выводу, что языковые модели обладают обширными знаниями о социальных нормах человека, но у них отсутствует «врождённая склонность» следовать им без явных стимулов. В отличие от людей, которые формировали эти нормы на протяжении веков, агенты воспринимают их как абстрактную информацию, а не как руководство к действию. Это подразумевает, что привычные механизмы координации (репутация, закон, взаимное доверие) в мультиагентных системах просто не функционируют без дополнительного проектирования.
В компании подчеркивают, что объем взаимодействий между ИИ-агентами, вероятно, превысит объем человеческих коммуникаций задолго до разработки безопасных протоколов таких взаимодействий.
Поскольку агенты могут копироваться, самосовершенствоваться и действовать быстрее людей, системные сбои, вызванные одинаковыми ошибками или конфликтами, могут происходить лавинообразно. Эксперименты показывают, что улучшение индивидуальной модели не гарантирует улучшения коллективного поведения, поэтому необходимы механизмы на уровне всей среды взаимодействия — например, специальные форумы, репутационные системы и «процедуры арбитража», разработанные специально для ИИ-участников.
Darth SaharaИсточники:AnthropicИскусственный интеллект0Искусственный интеллектAnthropicСоциальные нормыИИ-агентыClaudeМультиагентные системы25 минут назад
Источник