Проблема
Современные компании активно внедряют генеративные модели ИИ для анализа рыночной конъюнктуры: финансовые отчёты и обзоры рынков насыщены графиками, обработка которых отнимает значительное время у аналитиков. Однако даже новейшие мультимодальные языковые модели — VLM (vision-language models, системы, способные одновременно обрабатывать текст и изображения) — нередко справляются с этой задачей неточно.
Графики представляют собой особый тип мультимодальных данных: для их интерпретации модель должна одновременно «видеть» визуальную структуру, считывать числа и понимать текстовый контекст. Такая совместная обработка трёх типов информации — задача качественно иного уровня сложности по сравнению с анализом обычных изображений или текста. Компания, вложившая средства в современную VLM, рискует получить неполные или ошибочные аналитические данные.
Главный сдерживающий фактор — дефицит обучающих данных. Большинство существующих датасетов для VLM содержат ограниченное число изображений из открытых источников и, как правило, не располагают ни необходимым масштабом, ни достаточными аннотациями. «В отличие от нашего мозга, мультимодальной модели может потребоваться тысячи примеров при обучении, чтобы уверенно распознавать линейный график», — поясняет Йована Кондич, аспирантка кафедры электротехники и информатики MIT и ведущий автор статьи о ChartNet. Запрос индустрии при этом вполне конкретен: «Финансовая индустрия строится на графиках. Если мультимодальные модели смогут извлекать из них информацию — например, описания трендов — это упростит множество связанных рабочих процессов», — добавляет Дхирадж Джоши, старший научный сотрудник IBM Research.
Устройство ChartNet
Для устранения этого разрыва исследователи из MIT и MIT-IBM Computing Research Lab разработали ChartNet — датасет, целенаправленно ориентированный на обучение VLM интерпретации графиков. Датасет включает более миллиона разнообразных изображений, каждое из которых сопровождается тремя типами структурированных данных: визуальным (само изображение), лингвистическим (текстовое описание) и числовым (таблица с исходными значениями). Кроме того, каждый элемент содержит пары «вопрос — ответ», обучающие модель корректно отвечать на вопросы по изображению.
Такой многокомпонентный формат принципиально отличает ChartNet от большинства предшественников. «Эти дополнительные форматы данных помогают модели соотносить и согласовывать различные компоненты информации, закодированной в изображении графика», — объясняет Кондич. Прежние обучающие датасеты, по её словам, были сориентированы преимущественно на ответы на простые вопросы по графику — ChartNet нацелен на всестороннее понимание визуальных данных.
Наряду с синтетическими данными датасет включает выборку элементов, аннотированных экспертами вручную. Это расширяет охват за счёт дополнительных типов графиков и обеспечивает верификацию достоверности разметки. По словам Джоши, аннотированные данные открывают возможность для fine-tuning — дообучения существующих VLM под конкретные прикладные задачи, что дополнительно повышает точность на узкоспециализированных применениях.
Метод генерации
В основе ChartNet лежит двухэтапная конвейерная система синтетической генерации данных. На первом этапе автоматизированная система транслирует любой существующий набор изображений графиков в программный код. На втором — итеративно модифицирует этот код, варьируя параметры каждого графика: тип, значения данных, тематику, цветовую схему и прочие характеристики.
«Мы берём один график как исходный и получаем сотни его вариаций. Именно так нам удалось собрать датасет из более чем миллиона разнообразных изображений», — объясняет Кондич. Для контроля качества в систему встроена автоматическая верификация: она проверяет исполняемость кода и точность итоговых изображений. «Нам важно не просто генерировать разнообразные примеры, но и следить за тем, чтобы информация была представлена осмысленно», — добавляет исследователь.
Ставка на синтетические данные — осознанное методологическое решение. Синтетические данные, генерируемые алгоритмически для воспроизведения статистических свойств реальных данных, позволяют масштабировать датасет далеко за пределы того, что достижимо при ручной разметке. Это особенно критично для задачи интерпретации графиков, где разнообразие форматов, стилей оформления и предметных областей потенциально бесконечно.
Результаты
Для оценки ChartNet исследователи обучили на его основе линейку моделей IBM Granite Vision — серию мультимодальных открытых моделей IBM — а также ряд других открытых моделей разного размера. Датасет улучшил показатели точности всех участвовавших моделей по четырём направлениям: восстановление графика, извлечение данных, составление текстовых описаний и ответы на вопросы.
Наиболее показательный результат: небольшие открытые модели, обученные на ChartNet, стабильно превзошли значительно более крупные коммерческие аналоги. Этот результат меняет логику выбора инструментов: конкурентоспособная точность интерпретации графиков перестаёт быть прерогативой крупных поставщиков с дорогостоящими проприетарными системами. Технология становится доступной для компаний с ограниченным бюджетом на ИИ-инфраструктуру.
«Мы задумывали ChartNet как универсальное решение для понимания графиков — охватывающее всё, что может потребоваться как AI-модели, так и специалисту, который её обучает. Мы рассчитываем, что наша работа мотивирует исследователей достигать передовых результатов с моделями меньшего размера, не требующими колоссальных вычислительных ресурсов», — говорит Кондич.
Применение и перспективы
Практические приложения ChartNet охватывают широкий круг индустрий. Наиболее очевидный — финансовый сектор, где автоматическая интерпретация трендов способна разгрузить аналитические процессы. Помимо финансового анализа, датасет применим для моделей, работающих с научными иллюстрациями: исследователи из самых разных областей регулярно сталкиваются с необходимостью извлекать данные из публикаций, где результаты представлены в графическом виде.
В дальнейшем исследователи планируют расширять ChartNet за счёт данных с более высоким уровнем сложности и учитывать обратную связь от научного сообщества. Работа частично финансировалась MIT-IBM Computing Research Lab. Статья написана в соавторстве с Пенъюань Ли (IBM Research), Дхирадж Джоши (IBM Research), Айзеком Санчесом (IBM Research), Ауде Оливой (директор по стратегическому взаимодействию с индустрией MIT Schwarzman College of Computing и директор MIT-IBM Computing Research Lab) и Рожерио Ферисом (главный научный сотрудник и руководитель группы MIT-IBM Computing Research Lab).