GPTZero нашёл следы нейросети в Конституции США, другой сервис забраковал отрывок из романа 1916 года. Просто они так устроены: детектор измеряет, насколько текст предсказуем для языковой модели, — эта метрика называется «перплексия». Чем ниже перплексия, тем предсказуемее текст и тем подозрительнее он для алгоритма. Но предсказуемо пишут не только нейросети:
- Школьники следуют стандартной структуре сочинения, когда знают критерии оценки.
- Студенты предсказуемы в курсовой — научный стиль вообще состоит из устойчивых оборотов.
- Практически любой человек, когда пишет не на родном языке, пользуется простой лексикой и стандартными оборотами.
Последнее проверили в Стэнфорде. Семь детекторов протестировали на эссе американских школьников и TOEFL-эссе китайских студентов. Носителей языка алгоритмы распознавали почти безошибочно, а работы неносителей объявляли машинными в среднем в 61% случаев, причём один детектор забраковал почти все. За каждым таким вердиктом — живой человек, который писал старательно и просто.
Почему детекторы такие неточные
Длинный нетронутый нейротекст лучшие детекторы ловят неплохо. Но на коротких, отредактированных и смешанных текстах точность падает у всех — это видно по сводке исследований британского центра Jisc.
Но типичный современный текст — он и есть смешанный: человек набросал структуру, нейросеть помогла с формулировками, человек переписал половину. Невозможно сказать однозначно, кого считать автором — человека или ИИ. Но детектор всё равно обязан выдать процент.
Отсюда консенсус, который разделяют даже разработчики детекторов: высокий процент — повод присмотреться к работе, но результаты сервисов нельзя использовать как единственный или главный аргумент при обвинении ученика или коллеги.
Как работают хуманизаторы текста
Раз есть детекторы сгенерированного текста, появились и сервисы, которые пытаются их обойти. Они используют простые приёмы: заменяют частые слова на редкие, изменяют структуру некоторых предложений, чередуют короткие фразы с длинными, добавляют разговорные обороты. Иногда — намеренно делают текст чуть хуже.