Система продемонстрировала многократный рост производительности на Nvidia B200 и позволила воспроизвести результаты через готовый контейнер
Искусственный интеллект056 минут назад
На фоне продолжающейся гонки за вычислительными ресурсами в сфере искусственного интеллекта все большее значение приобретает не разработка новых моделей, а оптимизация работы. Компания Vidraft, занимающаяся языковыми моделями и ИИ-инфраструктурой, представила результаты тестирования системы ускорения инференса VKAE, которая, по словам разработчиков, позволяет в некоторых сценариях увеличить производительность существующих графических процессоров до 23 раз без изменения аппаратного обеспечения.
Интерес к таким технологиям объясняется экономикой современных ИИ-сервисов. Обучение крупной языковой модели происходит один раз, в то время как её использование — инференс, генерация ответов для пользователей — осуществляется постоянно. Именно затраты на инференс определяют эксплуатационные расходы облачных сервисов, корпоративных систем ИИ и ИИ-платформ.
Разработчики предлагают рассматривать подобные системы как своего рода «программное расширение» существующих ускорителей. В отличие от производителей чипов, создающих новые поколения GPU, системы ускорения инференса стремятся извлечь больше производительности из уже имеющегося оборудования за счет оптимизации низкоуровневого программного обеспечения, включая вычислительные ядра и механизмы планирования выполнения задач.
Согласно опубликованным данным, тестирование проводилось на графическом процессоре Nvidia B200. Для ряда моделей были достигнуты кратные ускорения по сравнению с базовыми системами обработки запросов, при этом разработчики отдельно подчеркивают, что в ходе измерений не было выявлено снижения качества ответов или деградации точности моделей.
Одним из наиболее ярких результатов стало демонстрация работы модели Qwen3.5-35B-A3B. При высокой конкурентной нагрузке система продемонстрировала общую производительность свыше 10 тысяч токенов в секунду. При этом авторы отдельно уточняют важную особенность измерений: показатель зависит от характера нагрузки. Для более разнообразных реальных запросов производительность этой же модели составила около 455 токенов в секунду.
Измеренные данные VKAE — с учетом зафиксированных условий, представлены ниже в таблице. Пропускная способность одного потока на одной видеокарте Nvidia B200, с использованием единого измерительного оборудования, сравнивается между базовым режимом и оптимизированным режимом. Во всех запусках не наблюдалось ухудшения качества (точности) выходных данных.

Разработчики VKAE подчеркивают, что ускорение не является универсальным свойством и существенно зависит от архитектуры конкретной модели. Некоторые модели показывают многократный рост производительности, тогда как другие ускоряются значительно слабее. Это связано с различиями в вычислительных узких местах, организации памяти и внутренней структуре архитектур.
Одной из наиболее необычных особенностей проекта стала акцентуация на воспроизводимости результатов. Вместе с показателями производительности разработчики предоставляют единый контейнер, который включает как веса модели, так и оптимизированную среду выполнения. Благодаря совместимости с интерфейсами OpenAI API это решение может быть интегрировано в существующую инфраструктуру практически без изменений.
По мнению авторов проекта, именно возможность самостоятельно проверить производительность на собственном оборудовании должна стать основным критерием доверия к подобным заявлениям. В условиях, когда результаты бенчмарков могут значительно зависеть от выбранных параметров тестирования, воспроизводимость становится важнее самих численных показателей.
Тем не менее конкретный механизм ускорения, используемый в VKAE, пока не раскрывается. Разработчики сообщают, что подробное описание технологии готовится к публикации в формате препринта.
Darth SaharaИсточники:huggingfaceИскусственный интеллект0Искусственный интеллекттокеныNvidiaGPUОблачные вычисленияЯзыковые моделиДата-центрыИИ инфраструктураИнференсОптимизация вычисленийTensorRT-LLMVLLMСтоимость вычисленийПроизводительность GPU56 минут назад
Источник