Российская модель GigaChat Audio: распознавание эмоций и анализ разговоров до трех часов

Обновленный GigaChat Audio различает собеседников и отвечает без предварительного перевода речи в текст

Искусственный интеллект033 минуты назад

Сбер представил обновленную модель GigaChat Audio, которая может обрабатывать аудиозаписи и голосовые сообщения напрямую, без предварительного перевода речи в текст. Нейросеть анализирует интонацию, тембр голоса и особенности произношения, определяя эмоциональную окраску речи пользователя.

Модель поддерживает обработку аудиофайлов продолжительностью до трех часов. Она способна находить нужные фрагменты беседы, создавать краткие пересказы с таймкодами, отвечать на вопросы по содержанию записи и различать несколько спикеров.

Изображение Grok

Еще одной новой функцией стала долговременная память. GigaChat Audio способен запоминать факты, озвученные пользователем в голосовом диалоге, и использовать их в будущих беседах. При этом пользователь может просматривать, редактировать или полностью отключить сохраненную информацию в настройках.

По информации Сбера, во внутренних испытаниях новая модель показала результаты, сопоставимые с ведущими зарубежными решениями. В тесте Arena Hard Audio, где другие нейросети вслепую сравнивают ответы различных моделей на одни и те же голосовые вопросы, GigaChat Audio набрал 75% побед, приблизившись к Gemini-3-Flash-preview (77,5%) и опередив Gemini 2.5 Pro (62%). Точность распознавания эмоций составила 80%, что выше показателей Qwen3-Omni-30B (70%) и Kimi-Audio (62%).

JinИсточники:ТАССИскусственный интеллект033 минуты назад

Источник
Елизавета Воронцова

Журналист информационного портала vtambove.ru. Освещает городские события, общественную повестку, социальные инициативы и актуальные новости региона. В работе придерживается принципов точности, оперативности и понятной подачи информации. Особое внимание уделяет темам, которые напрямую влияют на жизнь жителей Тамбова и области.

Оцените автора
Тамбов