Задача обнаружения текста, сгенерированного ИИ, возникла как ответ на быстрое распространение систем, способных писать связные ответы, эссе, новости, отчёты и фрагменты научного текста. Для пользователя такой результат выглядит естественным, когда в нём выдержана тема, сохранён академический регистр, правильно расставлены термины и заметных грамматических ошибок нет. Поэтому простое экспертное чтение перестаёт быть достаточным способом проверки. Возникает инженерная задача: найти признаки, по которым можно оценить вероятность машинного происхождения текста, не подменяя эту оценку окончательным суждением об авторстве.
Первый класс методов связан со статистическими характеристиками текста. GLTR как инструмент анализа рангов токенов показывает, что машинно-сгенерированные фрагменты часто используют слова, которые сама языковая модель считает наиболее вероятными в этом контексте. На этой идее строится визуальная и числовая оценка рангов токенов, энтропии и предсказуемости. Такой подход хорошо объясним: если текст слишком часто выбирает ожидаемые продолжения, он может отличаться от человеческого письма. Однако этот признак не универсален. Сильно отредактированный текст, специализированный жанр или формальная инструкция могут сделать человеческий текст таким же предсказуемым.
Второй подход опирается на стилометрию. В традиционной автороведческой задаче анализируются частоты слов, длина предложений, пунктуация, синтаксические конструкции и устойчивые речевые привычки. Для ИИ-текста эти признаки тоже могут быть полезны, потому что модели часто сглаживают ритм, избегают резких тематических переходов и выбирают безопасные формулировки. Но исследование ограничений стилометрии для машинно-сгенерированных новостей показывает, что такой метод плохо работает как универсальный детектор. Он зависит от языка, жанра и того, какая именно модель использовалась для генерации.
Третий класс решений — обучаемые классификаторы. Они получают набор человеческих и машинных текстов, извлекают признаки или используют представления трансформерных моделей и затем выдают вероятность принадлежности фрагмента к одному из классов. Такой детектор можно адаптировать под конкретный жанр: академическое эссе, отзыв, новостной текст или ответ на экзамене. Цена этой адаптации — зависимость от обучающего набора. Если классификатор обучен на текстах одной модели, а проверяет тексты другой модели или тексты после ручной правки, качество обнаружения может заметно снизиться.
Методы семейства DetectGPT устроены иначе: они не требуют обучения отдельного классификатора на размеченном корпусе. DetectGPT использует идею вероятностной кривизны: текст, созданный языковой моделью, должен находиться в области, где небольшие перефразировки обычно уменьшают его вероятность. Fast-DetectGPT развивает эту идею и снижает вычислительные затраты. Этот подход позволяет проверять текст без подготовки большого набора примеров для каждого нового генератора. Но он требует доступа к языковой модели или близкому вероятностному оценщику, а качество зависит от того, насколько проверяемый текст похож на распределение, с которым работает этот оценщик.
Водяные знаки предлагают другой механизм. Во время генерации модель может немного смещать выбор токенов так, чтобы в тексте возникал статистически проверяемый след. Проверяющая сторона затем анализирует распределение токенов и оценивает наличие такого следа. В отличие от классификатора, водяной знак создаёт признак на этапе генерации, а не пытается восстановить авторство только по готовому тексту. Такой механизм работает только при двух условиях: генератор действительно встраивает знак, а проверяющий знает правило обнаружения. Кроме того, перефразирование, перевод или глубокая редактура могут ослабить след.
Перефразирование остаётся одним из главных способов обхода детекторов. Исследования показывают, что автоматическое или ручное переписывание может снижать качество классификаторов, методов семейства DetectGPT и водяных знаков. Это важно для практики: проверяемый текст редко бывает «чистым» результатом одного запроса к модели. Автор может попросить ИИ написать черновик, затем сократить его, добавить собственные фрагменты, заменить термины или прогнать через другую систему перефразирования. В таком случае задача обнаружения становится не бинарной, а смешанной: нужно оценить степень участия ИИ и характер последующей человеческой правки.
Для академической среды особенно опасны ложноположительные срабатывания. Работа о смещении GPT-детекторов против авторов, для которых английский не родной, показывает, что детекторы могут чаще ошибочно относить такие тексты к машинным. Механизм понятен: студент, пишущий на неродном языке, может использовать более простые синтаксические конструкции и предсказуемую лексику, что совпадает с признаками, на которые опирается часть детекторов. Поэтому результат автоматической проверки нельзя использовать изолированно. Он должен запускать дополнительное рассмотрение, а не заменять его.
Проблема осложняется языковой спецификой. Большая часть ранних работ и коммерческих инструментов ориентировалась на английский язык. Для русского языка нужны отдельные корпуса, потому что морфология, порядок слов, пунктуационные привычки и жанровые нормы отличаются. Задача RuATD показывает, что для русского языка требуется собственная оценка методов обнаружения искусственно сгенерированного текста, а не прямой перенос англоязычных результатов. Это особенно важно для образовательных организаций, где проверяются студенческие работы на русском языке и где ошибка классификации может повлиять на академическую репутацию.
Надёжная оценка детекторов требует специальных тестовых наборов. RAID предлагает рассматривать устойчивость к разным генераторам, видам атак, стратегиям выборки и жанрам. Такой подход ближе к реальной эксплуатации, чем тестирование на одном наборе «человек против ChatGPT». Детектор должен проверяться на текстах от моделей, не входивших в обучение, на перефразированных версиях, на смешанных текстах и на текстах разных авторских групп. Без такой проверки высокая точность на лабораторном наборе может создать ложное ощущение надёжности.
Практический процесс обнаружения ИИ-текста должен строиться как многоступенчатая проверка. На первом этапе автоматический детектор может выделить фрагменты с повышенным риском. На втором этапе эксперт оценивает жанр, стиль автора, историю правок, соответствие текста заданию и наличие источников.
Если риск остаётся высоким, проверка должна переходить к процедурным действиям: запросу пояснений автора, анализу черновиков, сравнению с промежуточными версиями или устной защите результата. Такой процесс медленнее, чем одноразовая проверка в автоматическом инструменте, но он снижает вероятность несправедливого решения.
Следовательно, методы обнаружения текста, сгенерированного ИИ, полезны только при правильном понимании их границ. Статистические признаки, стилометрия, классификаторы, DetectGPT-подходы и водяные знаки решают разные подзадачи и ломаются в разных условиях. Сильный детектор не доказывает нарушение, а даёт вероятностный сигнал, который нужно сопоставлять с контекстом создания текста. Поэтому в образовании, науке и документообороте такие методы должны использоваться вместе с конкретными правилами: раскрытием факта применения ИИ, хранением черновиков, допустимым уровнем машинной правки, процедурой апелляции и экспертной проверкой спорных случаев.
Литература:
- Gehrmann S., Strobelt H., Rush A. M. GLTR: Statistical Detection and Visualization of Generated Text. — 2019. — URL: https://arxiv.org/abs/1906.04043.
- Schuster T., Schuster R., Shah D. J., Barzilay R. The Limitations of Stylometry for Detecting Machine-Generated Fake News. — 2019. — URL: https://arxiv.org/abs/1908.09805.
- Guo B., Zhang X., Wang Z., Jiang M., Nie J., Ding Y., Yue J., Wu Y. How Close is ChatGPT to Human Experts? Comparison Corpus, Evaluation, and Detection. — 2023. — URL: https://arxiv.org/abs/2301.07597.
- Mitchell E., Lee Y., Khazatsky A., Manning C. D., Finn C. DetectGPT: Zero-Shot Machine-Generated Text Detection using Probability Curvature. — 2023. — URL: https://arxiv.org/abs/2301.11305.
- Bao G., Zhao Y., Teng Z., Yang L., Zhang Y. Fast-DetectGPT: Efficient Zero-Shot Detection of Machine-Generated Text via Conditional Probability Curvature. — 2023. — URL: https://arxiv.org/abs/2310.05130.
- Kirchenbauer J., Geiping J., Wen Y., Katz J., Miers I., Goldstein T. A Watermark for Large Language Models. — 2023. — URL: https://arxiv.org/abs/2301.10226.
- Krishna K., Song Y., Karpinska M., Wieting J., Iyyer M. Paraphrasing evades detectors of AI-generated text, but retrieval is an effective defense. — 2023. — URL: https://arxiv.org/abs/2303.13408.
- Liang W., Yuksekgonul M., Mao Y., Wu E., Zou J. GPT detectors are biased against non-native English writers. — 2023. — URL: https://arxiv.org/abs/2304.02819.
- Weber-Wulff D., Anohina-Naumeca A., Bjelobaba S., Foltýnek T., Guerrero-Dib J., Popoola O., Šigut P., Waddington L. Testing of Detection Tools for AI-Generated Text. — 2023. — URL: https://arxiv.org/abs/2306.15666.
- Sadasivan V. S., Kumar A., Balasubramanian S., Wang W., Feizi S. Can AI-Generated Text be Reliably Detected? — 2023. — URL: https://arxiv.org/abs/2303.11156.
- Liu Z., Yao Z., Li F., Luo B. On the Detectability of ChatGPT Content: Benchmarking, Methodology, and Evaluation through the Lens of Academic Writing. — 2023. — URL: https://arxiv.org/abs/2306.05524.
- Dhaini M., Poelman W., Erdogan E. Detecting ChatGPT: A Survey of the State of Detecting ChatGPT-Generated Text. — 2023. — URL: https://arxiv.org/abs/2309.07689.
- Yang L., Jiang F., Li H. Is ChatGPT Involved in Texts? Measure the Polish Ratio to Detect ChatGPT-Generated Text. — 2023. — URL: https://arxiv.org/abs/2307.11380.
- Zaitsu W., Jin M. Distinguishing ChatGPT(-3.5, -4)-generated and human-written papers through Japanese stylometric analysis. — 2023. — URL: https://arxiv.org/abs/2304.05534.
- Dugan L., Hwang A., Trhlik F., Ludan J. M., Zhu A., Xu H., Ippolito D., Callison-Burch C. RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors. — 2024. — URL: https://arxiv.org/abs/2405.07940.
- Shcherbakov A., Artemova E., Malykh V. RuATD 2022: Shared Task on Artificial Text Detection in Russian. — 2022. — URL: https://aclanthology.org/2022.bsnlp-1.26/.

