Проблема калибровки уверенности
Современные языковые модели плохо различают, когда они знают ответ, а когда лишь предполагают. Это явление называется некалиброванностью: модель выдаёт одинаково уверенный тон как для хорошо задокументированных фактов, так и для суждений, находящихся за пределами её обучающей выборки. Пользователь при этом не получает никакого сигнала о том, насколько можно доверять конкретному ответу.
Новый метод обучения направлен именно на эту проблему: повысить достоверность оценок уверенности, то есть сделать так, чтобы модель корректно сигнализировала о своей неопределённости вместо того, чтобы уверенно заполнять пробелы в знаниях правдоподобно звучащими, но ложными утверждениями.
Reasoning-модели и галлюцинации
Особую сложность представляют так называемые reasoning-модели — архитектуры, которые перед выдачей ответа генерируют развёрнутую внутреннюю цепочку рассуждений (chain-of-thought). К этому классу относятся, в частности, модели серии o1/o3 от OpenAI и DeepSeek-R1. Их достоинство — способность решать многошаговые задачи — одновременно является источником специфического риска: ошибка на раннем шаге рассуждения распространяется дальше и приводит к уверенно сформулированному, но неверному выводу.
Авторы нового метода рассматривают неверную калибровку уверенности именно как одну из коренных причин этого явления. Если модель «знает», что сомневается в промежуточном шаге, но не сигнализирует об этом ни внутри цепочки, ни в финальном ответе, итоговая галлюцинация становится фактически неизбежной.
Суть подхода
Новый метод встраивается в процедуру обучения модели и учит её формировать более достоверные оценки собственной уверенности. Ключевое заявленное свойство подхода — отсутствие деградации производительности: модели, обученные по новой схеме, сохраняют качество ответов на стандартных бенчмарках, тогда как их способность честно обозначать неопределённость улучшается.
Это важное практическое ограничение: предшествующие попытки улучшить калибровку нередко сопровождались снижением точности или скорости. Авторы заявляют, что им удалось обойти этот компромисс.
Значение для отрасли
Надёжная оценка уверенности — одно из ключевых условий для применения ИИ-систем в областях с высокими требованиями к достоверности: медицине, праве, финансовом анализе. Модель, которая умеет говорить «я не уверен», потенциально полезнее модели, которая всегда отвечает уверенно, но периодически ошибается без предупреждения.
Если заявленные результаты подтвердятся независимой проверкой, метод может стать стандартным компонентом пайплайнов дообучения reasoning-моделей.