Глобальный фон
Разработчики ИИ-моделей по всему миру столкнулись с одной из самых серьёзных структурных проблем отрасли: объём качественных публично доступных текстовых и мультимодальных данных для обучения постепенно исчерпывается. Крупнейшие лаборатории — от OpenAI до Google DeepMind — уже ищут синтетические альтернативы или заключают соглашения с правообладателями контента.
На этом фоне Китай избрал путь государственного регулирования предложения данных. Вместо того чтобы ждать, пока рынок выработает решение, Пекин переходит к централизованному формированию датасетов как инфраструктурного ресурса — аналогично тому, как в своё время государство обеспечивало строительство дорог или энергосетей.
Содержание плана
В понедельник Национальная администрация данных (National Data Administration) — профильный регулятор КНР — опубликовала проект масштабного общенационального плана. Документ содержит развёрнутую дорожную карту по расширению предложения, оборота и коммерциализации отраслевых наборов данных.
Инициатива встроена в директивную программу «ИИ Плюс» — государственную стратегию по системному внедрению искусственного интеллекта в промышленную и сервисную структуру второй по величине экономики мира. Фактически план по данным становится ресурсным фундаментом для этой программы: без достаточного объёма качественных датасетов обучение моделей промышленного уровня невозможно.
К 2028 году ведомство планирует сформировать разветвлённую экосистему верифицированных наборов данных — то есть прошедших проверку на качество, полноту и соответствие требованиям регулятора.
Охват по отраслям
В периметр программы вошли девять ключевых секторов экономики: научные исследования, промышленное производство, сельское хозяйство, энергетика, транспорт, финансы, здравоохранение, образование и электронная коммерция. Набор отражает приоритеты Пекина в части цифровой трансформации реального сектора.
Отдельным блоком в план включены передовые технологические направления: воплощённый ИИ (embodied AI — системы с физическим телом, в первую очередь роботы), автономное вождение, авиация малых высот (дроны и аэротакси) и биопроизводство. Именно эти сегменты считаются следующим фронтом применения ИИ и одновременно наиболее требовательными к специализированным обучающим данным.
Технические параметры
План предусматривает акцент на мультимодальных данных — то есть наборах, включающих одновременно несколько типов информации: текст, программный код, изображения, аудио и видео. Именно такие данные необходимы для обучения современных мультимодальных моделей, способных работать с разными форматами входных сигналов.
Согласно документу, данные должны обеспечить обучение систем, способных к сложным рассуждениям, агентному поведению (самостоятельному планированию и выполнению многошаговых задач) и управлению роботизированными устройствами. Это прямо соответствует тому направлению, в котором развивается мировая frontier-разработка: от чат-ботов к агентам и физическим системам.