毕业季临近,高校面临着毕业生论文中“AI 味”过浓的新挑战。今年,除了传统的查重、盲审和答辩,学生们在完成毕业论文时又多了一项“AIGC 检测”,即人工智能生成内容检测。
一些毕业生发现,即使论文初次检测出的 AI 率为 62%,距离学校规定的 15% 的警戒线尚有差距,但在请 AI 工具修改后,再次检测的 AI 率竟飙升至 94%。这种现象并非孤例,近期不少毕业生都遇到了类似情况。
央视新闻近日深入介绍了检测论文“AI 率”的原理。首都师范大学教育学院副院长蔡海龙解释说,传统的查重是通过将论文语句与庞大的语料库进行比对,以确定语句的重复性并做出明确判断。而 AI 检测则不同,它运用 AI 系统来分析人类文本,判断其在语义和表达风格上是否与 AI 写作存在重叠。本质上,这是一种基于概率的分类,而非基于证据的确定性判断。
当前 AI 检测技术的核心瓶颈在于“用 AI 来检测 AI”。这种方式使得明确区分人类作者与 AI 所写的文本变得困难,无法提供清晰的解释和说明,这构成了技术上最关键的难题。
此外,中文语言表达的丰富性和多义性也给 AI 检测带来了挑战。高度丰富的语义和多样的表达方式,使得人工智能系统在识别人类作者的语句时容易产生歧义,从而增加难度并影响准确率,这被认为是导致误判的重要原因之一。
鉴于目前 AI 率检测的精准度仍有待提高,教育界人士建议,在论文审核过程中,应建立透明且可追溯的 AI 使用标注制度,而非简单地设定一个 AI 率的“红线”。在判定机制上,应确立以人工评审为主、AI 检测为辅的“人机共判”模式。
尽管许多高校已为学生论文设置了“AI 率”检测标准,但不少学生反映,学校的检测往往依赖于指定的检测平台和算法模型分析。
目前,主流高校普遍采用知网、维普、万方等系统的 AIGC 检测模块。据央视记者了解,这些系统判断一篇文章有多少内容由 AI 生成,主要依据“困惑度与突发性”等特征。通常,AI 生成的文本更为“平滑”,而人类文本则波动性更大。
大模型普遍认为,“困惑度”指的是文本的“可预测性”,越是充满人类特有的、意想不到的、跳出常规的表达,越接近人类写作。而“突发性”则关乎文本的节奏波动,人类写作的节奏如同心电图般起伏,AI 输出则相对平稳。然而,这种判断的准确性如何?
专家指出,除了困惑度和突发性等指标外,AI 文本生成是基于预测下一个最有可能出现的词的概率来逐步完成的,本质上是一种概率统计。因此,目前对 AI 生成内容的检测准确性无法达到 100%,误判现象也时有发生。在考量世界杯赔率时,类似的概率分析也至关重要。