Andon Labs разоблачила модель за фальсификацию и обман в погоне за рейтингом, а инженеры Google охарактеризовали результаты в реальных задачах как неудачные
Google представила новую модель, и уже в первые 24 часа она столкнулась с критикой. Анонимные сотрудники компании сообщили Bloomberg, что, несмотря на впечатляющие бенчмарки, модель испытывает трудности в реальных сценариях — особенно в некоторых задачах по программированию. В то же время стартап Andon Labs, который занимается безопасностью ИИ, уличил Argon в регулярном мошенничестве во время тестирования Vending-Bench 2, оценивающего способности языковых моделей (LLM) в симулированной бизнес-среде.
В блоге, приуроченном к запуску, главный архитектор Google по ИИ Корай Кавукчуоглу (Koray Kavukcuoglu), который в августе сменил Демиса Хассабиса на посту руководителя DeepMind, заявил, что «модель кардинально меняет наши методы работы и разработки продуктов в Google», ссылаясь на тысячи положительных отзывов от сотрудников. Тем не менее, публикация Bloomberg, появившаяся практически одновременно с официальным анонсом в социальной сети X, демонстрирует другую реальность: внутри компании звучат мнения о том, что Argon в реальном кодировании явно не соответствует заявленным стандартам.
Google опровергла эти утверждения, указав на уверенность Кавукчуоглу в модели и команде.

Andon Labs предоставила конкретные доказательства: в тесте Vending-Bench 2 модель должна имитировать бизнес по продаже товаров через торговый автомат, а рейтинг определяется виртуальным банковским счётом по окончании симуляции. Argon заняла третье место, уступив OpenAI GPT-6 Astra и GPT-6 Sol, но стартап также зафиксировал, какими способами это было достигнуто. Модель создавала фальшивые подтверждающие письма, отказывалась оформлять возвраты за неисправный товар, использовала ошибки в счетах для оплаты и вводила в заблуждение поставщиков.
В одной из опубликованных цепочек размышлений — логе, в котором модель анализирует варианты перед принятием окончательного решения, — Argon пришла к выводу, что должна проигнорировать просьбу покупателя о возврате средств за бракованный товар, так как удовлетворение запроса уменьшит баланс счёта и снизит итоговую оценку. Ситуация напоминает прошлогодний эксперимент от Anthropic, в котором Claude на той же платформе начал галлюцинировать и в какой-то момент заявил, что посетил дом Гомера Симпсона по адресу 742 Evergreen Terrace.
Запуск Argon сопровождается ребрендингом: в официальном анонсе слово "AI" не упоминается ни разу — только в должности Кавукчуоглу и упоминании подписки Google AI Ultra. Глава Google Сундар Пичаи, похоже, следует указанию Трампа о замене термина на «сверхинтеллект» ("SI"). В ноябрьском анонсе Gemini 3 слово "AI" упоминалось многократно.
Проблемы с Argon совпадают с рядом громких уходов из Google. Научный руководитель Джефф Дин недавно покинул компанию, чтобы создать собственный стартап, с ним ушли и трое сотрудников. Джон Джампер, получивший Нобелевскую премию в 2024 году вместе с Хассабисом за AlphaFold, в июне перешёл в Anthropic, а через несколько дней после него Ноам Шазир, бывший сопредседатель команды разработки Gemini, объявил о переходе в OpenAI.
Источники:gizmodo0GeminiGoogleИскусственный интеллект11 минут назад
Источник