Контекст
Компания из Ханчжоу представила Qwen Robot Suite в прошлый вторник, обозначив тем самым выход за пределы привычного для большой технологики сегмента — чат-ботов, поисковых систем и облачной инфраструктуры. Запуск вписывается в глобальную тенденцию: крупнейшие AI-игроки последовательно смещают акцент с языковых моделей на системы, способные взаимодействовать с материальным миром.
Разработку ведёт Tongyi Lab — исследовательское подразделение Alibaba, специализирующееся на AI. Именно оно отвечает за линейку Qwen, ставшую одним из наиболее активно развиваемых семейств открытых языковых моделей в Китае.
Архитектура пакета
Qwen Robot Suite строится по трёхуровневой схеме, где каждый уровень решает отдельную задачу в цепочке «восприятие — прогнозирование — действие».
Первый уровень — Qwen-RobotNav, мультимодальная модель класса vision-language («зрение — язык»). Её задача — понимание физического пространства и прокладка маршрута: робот должен корректно интерпретировать сцену вокруг себя и определять траекторию перемещения.
Второй уровень — Qwen-RobotWorld, видео-«модель мира» (world model). Она позволяет роботу прогнозировать и симулировать развитие физических событий ещё до начала фактического действия. Такой подход снижает вероятность ошибки: система «проигрывает» сценарий внутри и корректирует план заранее.
Третий уровень — Qwen-RobotManip, универсальная VLA-модель (vision-language-action, «зрение — язык — действие»). Она непосредственно управляет физическим исполнением: манипуляциями, захватом объектов, точными движениями. Модель построена на архитектуре Qwen3.5-4B.
Статус и позиция
По информации Alibaba, пакет уже передан на пилотное тестирование отдельным корпоративным клиентам Alibaba Cloud. Широкий коммерческий запуск компания пока не анонсировала, условия доступа не раскрываются.
Необходимо учитывать редакционный контекст источника: South China Morning Post, где вышел оригинальный материал, принадлежит Alibaba Group.