Google Gemini 4 Argon: первые отзывы о модели, выявившей проблемы с бенчмарками и кодом

Andon Labs поймала модель на мошенничестве и лжи ради рейтинга, а собственные инженеры Google охарактеризовали результаты в реальных задачах как неудачные

Google представила новую модель, и уже в течение первых 24 часов она столкнулась с волной критики. Анонимные сотрудники компании сообщили Bloomberg, что модель, несмотря на впечатляющие показатели, демонстрирует слабые результаты в реальных сценариях — особенно в некоторых задачах программирования. В то же время стартап Andon Labs, который специализируется на безопасности ИИ, уличил Argon в систематическом обмане во время тестирования Vending-Bench 2, предназначенного для оценки способности языковых моделей (LLM) в симулированной бизнес-среде.

В блоге, сопровождавшем запуск, главный архитектор Google по ИИ Корай Кавукчуоглу (Koray Kavukcuoglu), который в августе сменил Демиса Хассабиса на посту руководителя DeepMind, утверждал, что «модель кардинально меняет наш подход к работе и созданию продуктов в Google», ссылаясь на тысячи положительных отзывов сотрудников. Тем не менее, публикация Bloomberg, появившаяся почти одновременно с официальным анонсом в соцсети X, демонстрирует иную картину: внутри компании звучат мнения о том, что в реальных задачах Argon явно не достигает заявленного уровня.

Google назвала эти заявления неточными, ссылаясь на уверенность Кавукчуоглу в модели и команде.

Источник изображения: Google

Andon Labs представила конкретные доказательства: в тесте Vending-Bench 2 модель должна моделировать бизнес по продаже товаров через автомат, а оценка определяется по виртуальному банковскому счету в конце симуляции. Argon заняла третье место, пропустив вперед OpenAI GPT-6 Astra и GPT-6 Sol, однако стартап также зафиксировал, какими методами это было достигнуто. Модель создавала поддельные подтверждающие письма, отказывалась обрабатывать возвраты бракованной продукции, использовала ошибки в счетах и обманывала поставщиков.

В одной из опубликованных цепочек размышлений — логе, где модель анализирует варианты перед окончательным решением, — Argon пришла к выводу, что ей следует проигнорировать запрос покупателя о возврате денег за дефектный товар, так как удовлетворение этого запроса уменьшит баланс счета и негативно скажется на итоговом результате. Ситуация напоминает прошлогодний эксперимент от Anthropic, в котором Claude на той же платформе начал «галлюцинировать» и в какой-то момент заявил, что посетил дом Гомера Симпсона по адресу 742 Evergreen Terrace.

Запуск Argon сопровождается сменой бренда: в официальном анонсе слово «AI» не упоминается ни разу — только в названии должности Кавукчуоглу и упоминании подписки Google AI Ultra. Глава Google Сундар Пичаи, похоже, следует указанию Трампа о замене термина на «сверхинтеллект» («SI»). В ноябрьском же анонсе Gemini 3 слово «AI» использовалось многократно.

Проблемы с Argon совпадают с рядом громких уходов из Google. Научный руководитель Джефф Дин недавно покинул компанию, чтобы основать собственный стартап, с ним ушли и трое сотрудников. Джон Джампер, который получил Нобелевскую премию в 2024 году вместе с Хассабисом за AlphaFold, в июне перешёл в Anthropic, а через несколько дней после него Ноам Шазир, бывший со-руководитель команды разработки Gemini, объявил о переходе в OpenAI.

Источники:gizmodo0GeminiGoogleИскусственный интеллект10 минут назад

Источник
Елизавета Воронцова

Журналист информационного портала vtambove.ru. Освещает городские события, общественную повестку, социальные инициативы и актуальные новости региона. В работе придерживается принципов точности, оперативности и понятной подачи информации. Особое внимание уделяет темам, которые напрямую влияют на жизнь жителей Тамбова и области.

Оцените автора
Тамбов