Платим блогерам
Блоги
This_is_the_way

Текст опубликован в личном блоге и его автор не имеет отношения к администрации сайта

Специалисты Группы Rubytech провели комплексные испытания отечественных больших языковых моделей на графических ускорителях из Китая. Эксперименты на платформе «Машина искусственного интеллекта» подтвердили стабильность работы и сопоставимую с решениями NVIDIA производительность в ключевых сценариях.
реклама

Специалисты Rubytech, протестировали отечественные LLM на китайских графических процессорах. Эксперименты проводились на собственной платформе вендора — «Машина искусственного интеллекта». Инженеры оценивали пригодность такой сборки для создания коммерческих ИИ-сред. Результаты зафиксировали устойчивую работу российских моделей на тестируемой инфраструктуре. Это доказывает возможность формирования закрытых вычислительных контуров без ускорителей NVIDIA и расширяет простор ассортимента при реализации ИИ-проектов.

Изображение: Reve Art

На разработку коммерческих нейросетей оказывает влияние не только качество алгоритмов, но и доступность вычислительных мощностей. При организации ИИ-сервисов внутри собственного периметра предприятиям необходимо принимать во внимание цену аппаратного обеспечения, потенциал масштабирования, безопасность и зависимость от поставщика. Долгое время отраслевым стандартом оставались чипы NVIDIA, однако дефицит и рост цен вынудили рынок искать альтернативы.

реклама

В РФ этот вопрос особенно важен: технологический суверенитет требует собственной вычислительной базы для развёртывания LLM внутри защищённого контура. Наибольший спрос на такую инфраструктуру исходит от госсектора, компаний с госучастием и объектов критической информационной инфраструктуры.

В рамках исследования специалисты Rubytech развернули LLM Cotype 3 от MWS AI на видеокартах из Китая, подготовив окружающую среду без использования решений NVIDIA. Работа оценивалась по нескольких ключевым параметрам.

Модификация «Скала^р» (c 8 китайскими GPU) показала производительность, сопоставимую с конфигурациями на NVIDIA H100. При обработке 27 тысяч токенов среднее время до первого токена (mean TTFT) — около 8 тысяч миллисекунд, межтокенная задержка (TPOT) — от 111 миллисекунд, что соответствует техническому заданию. Из-за оптимальной настройки драйверов и оркестрации в отдельных режимах удалось достичь характеристик в 2–2,2 раза выше исходных показателей этих GPU. Контейнерная архитектура упрощает развёртывание и сокращает переход от исследований к непосредственной работе.

Источник: cnews.ru
Теперь в новом формате

Наш Telegram-канал @overclockers_news
Подписывайся, чтобы быть в курсе всех новостей!

Популярные новости