Эксперимент
Сижу, читаю отчёт GPTZero по своему же тексту. Текст писал я — руками, без всяких подсказок от ИИ. Детектор уверенно говорит: 78% вероятность, что это ИИ. Открываю соседний материал, который накидал через Webwize с парой моих правок, прогоняю — 2%, «скорее всего, человек».
И вот тут начинается самое интересное. Потому что это не баг конкретного сервиса. Это дыра во всей логике, по которой сейчас поисковики и детекторы пытаются отделить машинный текст от человеческого.
Одна сторона уравнения
Все обсуждают проблему ИИ-текстов с одной стороны: контент стал массовым, выдача замусоривается, Google и Яндекс должны как-то с этим бороться. Окей, согласен. Но мало кто говорит вслух о другой части уравнения — а по каким именно признакам они собираются ловить машину.
Когда начинаешь смотреть на эти признаки внимательно, понимаешь: ловят они не ИИ. Ловят хороший текст.
Пять маркеров машины
Если разобрать, что считается маркером «машинности» в популярных детекторах вроде GPTZero и в логике алгоритмов поисковиков, картина получается показательная. Маркер первый — точный и технический подбор слов. Маркер второй — единообразный стиль на протяжении всего материала. Третий — точность и последовательность изложения. Четвёртый — отсутствие творческих отступлений, лирики, ухода в сторону. Пятый — чёткая структура с заголовками, подзаголовками, списками и логичными переходами.
Я осознанно опускаю истории про длинное тире, «в современном мире», «это не X, а Y» и прочие самые очевидные ИИ-маркеры. Потому что с ними умеет бороться уже любой мало-мальски уважающий себя генератор текста — эта задача давно решена на уровне промпта или постобработки. Детекторы это знают, и потому смотрят глубже. А глубже — именно те признаки, которые я перечислил выше.
Логика ловушки
Получается замкнутый круг. Хочешь писать точно — маркер. Держишь единый стиль — маркер. Выстраиваешь логику без лирических отступлений — маркер. Структурируешь материал — маркер. Чем профессиональнее текст по формальным признакам редактуры, тем выше вероятность, что детектор запишет его в машинный.
И это не просто курьёзный результат одного эксперимента. Это структурная проблема: системы верификации обучились на паттернах, которые описывают качество текста, а не его происхождение. Поисковики и детекторы оказываются в ситуации, где они буквально штрафуют авторов за то, что те пишут хорошо.