Хедж-фонд Bridgewater и стартап бывшего технического директора OpenAI Миры Мурати сообщили, что дообученная открытая модель обошла ведущие коммерческие ИИ
Искусственный интеллект051 минуту назад
Хедж-фонд Bridgewater Associates и компания Thinking Machines Lab, основанная экс-техническим директором OpenAI Мирой Мурати, опубликовали итоги внутреннего исследования, которое показало, что специализированная дообученная модель с открытыми весами оказалась более эффективной, чем крупнейшие коммерческие ИИ-системы при анализе финансовых данных. По словам исследователей, она также требует почти в 14 раз меньше вычислительных ресурсов.
Исследование было сосредоточено на одной из самых трудоёмких задач инвестиционного анализа — постоянной оценке значимости информации для принятия решений. Аналитики ежедневно обрабатывают огромные объемы новостей, отчетов компаний, аналитических обзоров, писем и регуляторных документов, при этом ключевую роль играют многочисленные мелкие экспертные оценки.
Авторы выделили 6 типовых задач из повседневной практики инвесторов. Среди них — определение значимости финансовых новостей для руководителей компаний и оценка того, указывают ли документы центральных банков на возможные изменения процентных ставок. В исследовании отмечается, что подобные решения специалисты принимают интуитивно, но часто сталкиваются с трудностями при формальном описании логики своих выводов.

В процессе тестирования крупные коммерческие модели продемонстрировали неожиданно низкие результаты. Базовые версии систем семейства GPT, Claude и Gemini при стандартных запросах достигали точности лишь около 50%. Даже после введения сложных инструкций и применения трёхуровневой системы оценки — «важно и интересно», «важно, но неинтересно» и «неважно» — точность возросла лишь до примерно 75%, что оказалось ниже установленного исследователями порога надежности в 80%.
Авторы также утверждают, что новые поколения крупных моделей показывают всё меньший прирост эффективности по сравнению с затратами. В качестве примера приведена модель GPT 5.4, которая, согласно исследованию, требует на 43% больше ресурсов по сравнению с версией 5.2, обеспечивая лишь незначительное увеличение точности.
Для решения проблемы исследователи применили метод дообучения открытой модели на специализированных корпоративных данных. Первоначально разметка документов проводилась внешними исполнителями, однако качество этих данных оказалось недостаточным. Вместо полной повторной проверки всех материалов команда использовала промежуточную модель, которая выявляла наиболее вероятные ошибки разметки и отправляла на экспертную оценку лишь спорные случаи.
Дообучение осуществлялось на платформе Tinker, разработанной Thinking Machines Lab, с использованием открытой модели Qwen3-235B. По внутренним оценкам авторов, итоговая система достигла точности 84,7%, тогда как лучшая из протестированных коммерческих моделей показала результат 78,2%.
Авторы исследования акцентируют внимание, что результаты получены в рамках собственной методологии и не представляют собой независимую внешнюю оценку. Тем не менее работа указывает на важную тенденцию: значительная часть наиболее ценной информации и экспертных знаний остаётся внутри компаний и недоступна разработчикам универсальных ИИ-моделей.
Darth SaharaИсточники:the-decoderИскусственный интеллект0Искусственный интеллектинвестицииOpenAIБольшие языковые моделиThinking Machines LabBridgewaterQwen3Финансовая аналитикаFine-tuning51 минуту назад
Источник