Предыстория
В марте прошлого года вышла флагманская модель управления компьютером Holo3. Разработчики, корпоративные заказчики и технологические партнёры немедленно приступили к промышленному внедрению: автоматизация браузера и бизнес-приложений, внутренние инструменты, настольные программы. По мере роста аудитории и масштаба внедрений стало очевидно, что одной производительности в «стандартной» среде недостаточно.
Команды, переходившие от пилотных проектов к промышленной эксплуатации, постоянно сталкивались с одной и той же проблемой: высокие результаты на одной платформе не воспроизводились в другой. Мобильные устройства, альтернативные агентные оркестраторы и различные фреймворки исполнения вносили собственный сдвиг распределения — так называемый distribution shift, — из-за которого поведение модели становилось непредсказуемым.
Пользователи также хотели запускать одни и те же агентные функции как на настольных, так и на мобильных устройствах, с бесшовной интеграцией в различные агентные фреймворки и гибкостью развёртывания — от облачного инференса до полностью локального исполнения непосредственно на устройстве. Ответом на эти запросы стало семейство Holo3.1.
Мобильность и оркестраторы
Holo3.1 расширяет возможности предшественника за пределы управления браузером и рабочим столом, обеспечивая существенный прирост на мобильных платформах. На бенчмарке AndroidWorld — стандартном наборе тестов для оценки мобильной автоматизации — флагманская модель 35B-A3B улучшает результат с 67% до 79,3%. Более компактные варианты 4B и 9B выросли с 58% до 72%.
Для команд, встраивающих Holo во внешние агентные стеки, в Holo3.1 добавлена нативная поддержка протоколов вызова функций (function-calling) в дополнение к структурированным JSON-выводам, уже доступным в Holo3. На бенчмарках OSWorld (тест автоматизации рабочего стола) и внутренней тестовой системе, охватывающей сценарии электронной коммерции, бизнес-ПО и инструментов для совместной работы, function-calling и нативное исполнение теперь демонстрируют практически равные результаты.
Дополнительно Holo3.1 показывает улучшение более чем на 25% по сравнению с Holo3 при оценке внутри собственного продуктового оркестратора Holotab. Именно эти три оси — среды исполнения, агентные фреймворки и целевые платформы — разработчики называют ключевыми для повышения надёжности в реальных условиях.
Квантование и скорость
Holo3.1 — первый выпуск в линейке, включающий квантованные веса. На старте доступны контрольные точки модели 35B-A3B в трёх форматах: FP8 (8-битная точность с плавающей запятой), Q4 GGUF (4-битное квантование в формате для локального запуска через llama.cpp и аналогичные инструменты) и NVFP4 (формат NVIDIA для аппаратно-ускоренного инференса).
Для формата NVFP4 применялся инструментарий NVIDIA Model Optimizer в конфигурации W4A16 — то есть веса квантуются до 4 бит, тогда как активации остаются в 16-битном представлении. Это позволяет сохранить качество вывода при существенном снижении требований к памяти. По данным разработчиков, FP8 и NVFP4 показывают результаты на OSWorld примерно на два процентных пункта ниже, чем контрольная точка в полной точности BF16, — что считается приемлемой деградацией для большинства прикладных сценариев.
Прирост скорости существенный. На DGX Spark — серверной рабочей станции NVIDIA, позиционируемой для локального AI-инференса — режим NVFP4 W4A16 обеспечивает суммарную пропускную способность по токенам в 1,41× больше, чем FP8, и в 1,74× больше, чем BF16. Это делает NVFP4 основным форматом для сценариев, где критична задержка.
Локальный инференс на потребительском оборудовании
Контрольные точки Q4 GGUF ориентированы на локальное развёртывание агентов управления компьютером на потребительском оборудовании — без необходимости в серверной инфраструктуре. Сам агент работает локально на машине под управлением Windows или macOS, тогда как модель может исполняться либо на том же устройстве (приведены показатели для Apple Silicon), либо на DGX Spark в той же локальной сети.
В обоих случаях исполнение остаётся полностью приватным: никакие данные не покидают сеть пользователя. Это принципиально для корпоративных заказчиков, работающих с чувствительными данными или в регулируемых отраслях, где облачная передача информации ограничена.
На DGX Spark оптимизации агентного оркестратора, разработанные совместно с NVIDIA, в сочетании с квантованием NVFP4 обеспечивают совокупное ускорение примерно в 2× относительно базового варианта FP8. Среднее время одного шага агента сокращается с 6,8 секунды до 3,3 секунды — разница, непосредственно влияющая на практическую применимость агента в интерактивных рабочих процессах.
Линейка и доступность
Семейство Holo3.1 представлено в четырёх размерах с чётко разграниченными целевыми платформами. Holo3.1-0.8B предназначена для сверхлёгких локальных агентов с минимальными требованиями к ресурсам. Holo3.1-4B ориентирована на экономичное развёртывание там, где важна стоимость инференса. Holo3.1-9B занимает баланс между производительностью и задержкой. Holo3.1-35B-A3B — флагманский вариант для задач, требующих максимальной точности.
Помимо базовых весов, одновременно выпускаются оптимизированные контрольные точки FP8, NVFP4 и Q4 GGUF для локального и периферийного развёртывания. Разработчики позиционируют Holo3.1 как шаг к концепции универсальных агентов управления компьютером — систем, способных работать в любых средах, встраиваться в любой агентный стек и запускаться там, где выполняется рабочий процесс, будь то облако, локальная сеть или пользовательское устройство.