Цифра и то, что за ней
Anthropic отчиталась: больше 80% кода компании теперь пишет Claude. Эту цифру подали как успех — показатель зрелости внутренних AI-инструментов и роста скорости разработки.
Но в той же отчётности есть другой показатель, который прошёл без акцентов. Автоматический проверяющий — тоже на базе Claude — ловит лишь треть ошибок, которые ранее были зафиксированы вручную. То есть две трети пропускает.
Сама по себе каждая из этих цифр звучит как рабочий момент. Вместе они описывают конкретную конфигурацию: одна языковая модель генерирует код, другая его проверяет — и обе слепнут примерно в одних и тех же местах.
Слепая зона двух моделей
Когда код пишет человек, а проверяет другой человек — у них принципиально разные ментальные модели, разный контекст, разные паттерны внимания. Независимость здесь структурная: она встроена в саму разницу людей.
Когда код пишет языковая модель, а проверяет аналогичная языковая модель — речь идёт о схожих архитектурных паттернах, схожих обучающих данных, схожих систематических ошибках. Второй контур не добавляет независимую точку зрения — он дублирует первый с незначительными вариациями.
Результат: «проверка» становится не защитным механизмом, а общей слепой зоной. Ошибки, которые первая модель не увидит, вторая с высокой вероятностью тоже не увидит. Именно это и подтверждает цифра из отчётности Anthropic — 67% пропуска.
Независимость как инженерный критерий
Разбираю на инженерном уровне, почему «проверка ИИ» не равна независимой проверке — и как это описать в количественных терминах. Ключевой вопрос: как измерить слепое пятно системы?
Если верификатор обучен на тех же данных, что и генератор, или использует ту же базовую архитектуру — корреляция ошибок будет ненулевой. Мера независимости проверки в таком случае близка к нулю, даже если формально это «два разных агента». Именно поэтому в системах с высокими требованиями к надёжности независимость верификатора — не опция, а жёсткое структурное требование.
Урок из промышленной безопасности
Для понимания проблемы хорошо подходит аналогия из промышленной безопасности — стандарт IEC 61508, регулирующий функциональную безопасность электронных систем управления в энергетике, на производстве и транспорте.
IEC 61508 требует, чтобы резервные контуры безопасности были не просто технически независимы, но и диверсифицированы: если первый контур реализован на одной аппаратной или программной платформе, второй должен строиться на принципиально другой. Иначе общий отказ одной платформы выводит из строя оба контура одновременно.
Переводя в термины AI-разработки: если генератор и верификатор — это модели одного класса с одной архитектурой, двухконтурная схема не обеспечивает реальной диверсификации. Второй контур в такой конфигурации — не страховка, а иллюзия страховки.