VKAE: как один GPU увеличил скорость инференса ИИ в 23 раза без нового оборудования

Система продемонстрировала многократный рост производительности на Nvidia B200 и позволила воспроизвести результаты через готовый контейнер

Искусственный интеллект056 минут назад

На фоне продолжающейся гонки за вычислительными ресурсами в сфере искусственного интеллекта все большее значение приобретает не разработка новых моделей, а оптимизация работы. Компания Vidraft, занимающаяся языковыми моделями и ИИ-инфраструктурой, представила результаты тестирования системы ускорения инференса VKAE, которая, по словам разработчиков, позволяет в некоторых сценариях увеличить производительность существующих графических процессоров до 23 раз без изменения аппаратного обеспечения.

Интерес к таким технологиям объясняется экономикой современных ИИ-сервисов. Обучение крупной языковой модели происходит один раз, в то время как её использование — инференс, генерация ответов для пользователей — осуществляется постоянно. Именно затраты на инференс определяют эксплуатационные расходы облачных сервисов, корпоративных систем ИИ и ИИ-платформ.

Разработчики предлагают рассматривать подобные системы как своего рода «программное расширение» существующих ускорителей. В отличие от производителей чипов, создающих новые поколения GPU, системы ускорения инференса стремятся извлечь больше производительности из уже имеющегося оборудования за счет оптимизации низкоуровневого программного обеспечения, включая вычислительные ядра и механизмы планирования выполнения задач.

Согласно опубликованным данным, тестирование проводилось на графическом процессоре Nvidia B200. Для ряда моделей были достигнуты кратные ускорения по сравнению с базовыми системами обработки запросов, при этом разработчики отдельно подчеркивают, что в ходе измерений не было выявлено снижения качества ответов или деградации точности моделей.

Одним из наиболее ярких результатов стало демонстрация работы модели Qwen3.5-35B-A3B. При высокой конкурентной нагрузке система продемонстрировала общую производительность свыше 10 тысяч токенов в секунду. При этом авторы отдельно уточняют важную особенность измерений: показатель зависит от характера нагрузки. Для более разнообразных реальных запросов производительность этой же модели составила около 455 токенов в секунду.

Измеренные данные VKAE — с учетом зафиксированных условий, представлены ниже в таблице. Пропускная способность одного потока на одной видеокарте Nvidia B200, с использованием единого измерительного оборудования, сравнивается между базовым режимом и оптимизированным режимом. Во всех запусках не наблюдалось ухудшения качества (точности) выходных данных.

Источник: Vidraft

Разработчики VKAE подчеркивают, что ускорение не является универсальным свойством и существенно зависит от архитектуры конкретной модели. Некоторые модели показывают многократный рост производительности, тогда как другие ускоряются значительно слабее. Это связано с различиями в вычислительных узких местах, организации памяти и внутренней структуре архитектур.

Одной из наиболее необычных особенностей проекта стала акцентуация на воспроизводимости результатов. Вместе с показателями производительности разработчики предоставляют единый контейнер, который включает как веса модели, так и оптимизированную среду выполнения. Благодаря совместимости с интерфейсами OpenAI API это решение может быть интегрировано в существующую инфраструктуру практически без изменений.

По мнению авторов проекта, именно возможность самостоятельно проверить производительность на собственном оборудовании должна стать основным критерием доверия к подобным заявлениям. В условиях, когда результаты бенчмарков могут значительно зависеть от выбранных параметров тестирования, воспроизводимость становится важнее самих численных показателей.

Тем не менее конкретный механизм ускорения, используемый в VKAE, пока не раскрывается. Разработчики сообщают, что подробное описание технологии готовится к публикации в формате препринта.

Darth SaharaИсточники:huggingfaceИскусственный интеллект0Искусственный интеллекттокеныNvidiaGPUОблачные вычисленияЯзыковые моделиДата-центрыИИ инфраструктураИнференсОптимизация вычисленийTensorRT-LLMVLLMСтоимость вычисленийПроизводительность GPU56 минут назад

Источник
Елизавета Воронцова

Журналист информационного портала vtambove.ru. Освещает городские события, общественную повестку, социальные инициативы и актуальные новости региона. В работе придерживается принципов точности, оперативности и понятной подачи информации. Особое внимание уделяет темам, которые напрямую влияют на жизнь жителей Тамбова и области.

Оцените автора
Тамбов