Архитектура
Mellum2 построена на архитектуре Mixture-of-Experts (MoE, «смесь экспертов»): из 12 млрд параметров при обработке каждого входящего токена активируются только 2,5 млрд. Принцип MoE позволяет одновременно сохранить высокую общую ёмкость модели — она «знает» столько же, сколько полноразмерная dense-сеть аналогичного масштаба — и существенно снизить вычислительную нагрузку при инференсе. По данным JetBrains, по скорости обработки запросов Mellum2 более чем в 2 раза превосходит сопоставимые по числу параметров модели.
Технический отчёт с описанием архитектуры, процедуры обучения и методологии оценки опубликован на arXiv. Модель распространяется под лицензией Apache 2.0 — одной из наиболее открытых в индустрии, допускающей коммерческое использование без ограничений. Веса доступны для загрузки на Hugging Face.
От автодополнения к широкому кругу задач
Первая версия Mellum создавалась JetBrains как узкоспециализированный инструмент автодополнения кода — задача, органичная для IDE-экосистемы компании (IntelliJ IDEA, PyCharm, WebStorm и др.). В Mellum2 область применения расширена: модель ориентирована на более широкий круг задач в разработке программного обеспечения и обработке естественного языка. При этом ключевые конструктивные приоритеты — эффективный инференс и простота развёртывания — сохранены в качестве основных.
Роль в многокомпонентных системах
JetBrains позиционирует Mellum2 не как автономного ассистента, а как «фокусный» компонент для встройки в многомодельные AI-системы. Современные производственные AI-системы, как правило, строятся из набора специализированных модулей: ретриверы (retrieval-модули для поиска и извлечения данных), роутеры (маршрутизаторы запросов), модели с пониманием кода, валидаторы, вызыватели инструментов и более крупные модели для сложного рассуждения. Mellum2 нацелена на высокочастотные операции внутри таких пайплайнов — там, где применение фронтирных моделей было бы вычислительно избыточным.
Среди задекларированных сценариев применения — роутинг и оркестрация в многомодельных системах (классификация промптов, выбор инструментов, управление потоком выполнения), конвейеры RAG (Retrieval-Augmented Generation, генерация с дополнением из базы знаний) с компрессией контекста и постобработкой, работа в роли суб-агента для планирования и трансформации данных. Отдельно выделяется развёртывание в изолированных корпоративных инфраструктурах — для организаций, работающих с проприетарным кодом или внутренними чувствительными данными и не готовых передавать их во внешние API.