Текст опубликован в личном блоге и его автор не имеет отношения к администрации сайта
Американская технологическая компания NVIDIA выпустила уменьшенную открытую модель искусственного интеллекта (ИИ), которая предназначена для обработки повторяющихся, высокопроизводительных задач, обеспечивающих работу автономных агентов, с целью снижения стоимости и задержки длительных рабочих нагрузок агентов.
Модель под названием Nemotron 3.5 Lightning, имеет в общей сложности 30 миллиардов параметров, однако активирует только 3 миллиарда для каждого токена. Согласно заявлению NVIDIA, новый продукт, созданный с учётом опыта различных специалистов, позволяет обеспечить производительность более крупной модели, с использованием вычислительных ресурсов, близким к ресурсам гораздо меньшей модели.
Новая модель ориентирована на исполнительный уровень автономных агентов, где системы многократно вызывают инструменты, проверяют результаты, выполняют команды и делегируют задачи. То есть предназначена для выполнения повторяющихся задач. Вместо использования большой модели рассуждений на каждом шаге разработчики могут использовать Lightning для рутинной работы, оставляя более крупные модели для планирования и принятия сложных решений.
Nemotron 3.5 Lightning также предназначен для локальной работы, в том числе на системах NVIDIA DGX Spark, Jetson и видеокартах GeForce RTX 5090. Продукт можно развернуть в центрах обработки данных, предоставив разработчикам возможность запуска ресурсоемких задач ближе к месту их возникновения.
Корпорация NVIDIA позиционирует Nemotron 3.5 Lightning в качестве одного из элементов более широкого перехода к системам, использующим несколько моделей, а не полагающимся на одну модель для выполнения каждой конкретной задачи. Более крупные модели рассуждений могут заниматься планированием и координацией, в то время как более мелкие модели отвечают за выполнение поставленных задач.
Сообщается, что модель была обучена с учетом популярных систем управления агентами, включая OpenClaw и Hermes Agent. NVIDIA заявила, что такое обучение помогает агентам более точно запрашивать инструменты, одновременно снижая задержку при выполнении повторяющихся задач. Компания разместила модель в открытом доступе под лицензией OpenMDW-1.1. Разработчики могут дорабатывать её с помощью инструментов NVIDIA NeMo или проводить обучение с подкреплением и оценку на основе окружающей среды.
Согласно заявлению NVIDIA, Nemotron 3.5 Lightning обеспечивает в четыре раза большую скорость вывода изображения по сравнению с моделями аналогичного размера. В тесте PinchBench новый инструмент достиг точности 86%, выполнив 10000 задач на 30% быстрее, чем Qwen3.6 35B при аналогичной точности. Модель также поддерживает спекулятивное декодирование. Это метод, который позволяет предлагать несколько токенов и затем эффективно их проверять. NVIDIA включила предсказание нескольких токенов во время обучения и предоставляет две дополнительные черновые модели, DSpark и DFlash, для различных рабочих нагрузок вывода.
В рамках презентации нового продукта также была представлена библиотека NVIDIA NeMo Switchyard, предназначенная для маршрутизации задач между моделями, позволяющая направлять различные задачи к разным моделям. Сложный запрос может быть отправлен более мощной модели рассуждений, а выполнение рутинных задач – к Nemotron 3.5 Lightning.