AI痕迹自查指南:别让AI给的"天花乱坠"模型,拖垮你的论文
组委会最新报告显示,97.8%的学生在竞赛中使用AI,但近一半学生无法判定AI输出的对错。AI直出的论文表面结构完整、图文并茂,实则内容空泛、参数随便设、约束漏缺、模型华而不实。本期发布AI痕迹自查Skills——分语言风险与模型考量两层检测,帮助发现AI直出论文中的实质性问题,并提供提示词文档版备选方案。本文是Skills系列的最后一个板块。
01 AI时代数模竞赛现状:数据与冲突
要理解AI痕迹自查的必要性,首先需要看清AI时代数模竞赛的真实现状。
查重率:AI出现后不升反降。
根据组委会最新报告中的自建库通报比例数据,在AI出现之前,论文查重率是逐年上升的。但AI出现后,出现了一个反常识的现象:查重率不仅没有上升,反而下降了。
原因在于:AI可以生成大量的文字,使得整个查重的分母(论文总字符数)显著增加,最终相似度反而比预期更低。从数据上可以明显看到,2025年各赛区的查重上限远小于2024年。这意味着,单纯依靠查重率已经无法有效识别AI的使用。
参赛学生AI使用情况:
组委会在今年六七月份发放了1000多份问卷,调查了指导老师和学生,得到以下结果:
- 97.8%的学生声称在竞赛中使用AI;
- 14%的学生表示没有AI就无法参赛;
- 将近一半的学生认为AI的输出对错无法判定。
这组数据揭示了真正的风险所在:绝大多数学生在用AI,但近一半人无法判断AI给出的东西是对是错。这也正是过去近30期视频中,我们不断开发数模字典、赛题翻译等工具来帮助判断AI输出正确性的原因。但即便有了这些工具,有时仍然无法完全判定——因此,我们需要一款专门的AI痕迹自查工具,这也是本期Skills系列的最后一块拼图。
02 组委会视角:AI的三个工作与三个死穴
在讲自查工具之前,有必要了解组委会如何看待AI在数模中的作用。以下内容来自组委会唐老师的PPT,并非个人观点。
AI对应的三个工作板块:
唐老师指出,AI在数模中通常对应三个方面的工作:
- 语言描述——对应论文写作;
- 编程——对应模型求解;
- 信息检索——对应基于信息检索的建模。
这三个方面恰好覆盖了数模竞赛的全部核心工作。
AI的三个死穴:
唐老师同时指出,AI在这三个工作中容易出现以下问题:
- 推理过程中间断裂——逻辑链条不完整,前后推导脱节;
- 编造不存在的文献——引用虚构的参考文献;
- 忽略关键约束——AI认为不重要的约束条件就直接忽略,而这些约束往往正是题目核心。
此外,AI的问题抽象能力不完整——数模需要将实际问题抽象简化为数学模型,AI在这一步往往缺乏评委老师的思想角度,抽象得不够准确或不够深入。
最终结果:表面光鲜,实则经不起推敲。
AI直出的论文看起来往往结构完整、章节整齐、图文并茂、术语丰富——确实如此,我们点评过很多智能体生成的论文都是这样。但如果真正去读、去评阅,就会发现大部分论文经不起推敲:
- 内容空泛,没有实质深度;
- 假设与参数很多是随便设的,没有任何依据;
- 前后不一致,符号、数据、结论互相矛盾;
- 约束漏缺,题目中的关键条件被忽略。
这些问题在AI直出论文中非常非常常见。组委会的建议是:人为判断,AI负责辅助,人为主体。但现实是,很多新手做不到这一点,仍然大量使用AI直出。因此,AI痕迹自查工具的价值就在于:帮助这些参赛者发现AI直出论文中的实质性问题,而不是仅仅停留在表面。
03 AI痕迹自查Skills:两层检测体系
本期发布的AI痕迹自查Skills,蒸馏了市面上多种AIGC检测工具的核心逻辑(包括the nature writing以及几个中文AIGC检测Skills),并结合数模竞赛的特殊性,设计了两层检测体系。
第一层:语言风险检测
这一层仅针对语言写作方向进行检测,占整体检测权重的约60%。检测维度包括:
- 高频连接词的异常使用;
- 排比句、对仗句的过度使用;
- 被动语态占比异常;
- 无证据的陈述与断言;
- 其他网上公认的AI写作特征维度。
这一层的目标是识别论文中"AI味"过重的语言表达,但需要强调的是:语言风险检测只是手段,不是目的。真正的目的是通过语言层面的异常,定位到内容层面的实质性问题。
第二层:模型考量(数模特有)
数模论文不单纯是科研论文,其中包含大量的模型内容。而当前参赛者面临的最大问题之一是:AI给的模型,很多评委老师都不知道是什么——毫无疑问,这种模型往往是不对的。
数模的本质是:用较少的思路、尽可能基础的模型来实现完整的求解。能用简单的就不用复杂的,能用基础的就不用高级的,不能舍本逐末。但AI很多时候给的模型天花乱坠,老师都不理解、都没见过——这种模型在评审中往往会适得其反。
因此,模型考量层设计了四个检测维度:
- 常用性:判断论文使用的模型是不是数模中的常用模型。如果是非常冷门、评委都不熟悉的模型,需要高度警惕;
- 复杂度收益是否正比:论文提高了模型复杂度,但带来的收益是否成正比?如果复杂度提升很多但收益基本没有或不多,说明还是应该回归基础模型;
- 华而不实:模型是为了回答问题而建立,还是为了做而做、为了提升复杂度炫技而建立?这是判断模型是否有实际价值的核心;
- 三问法:对每个模型追问三个问题——本质是什么?为什么这么做?为什么选这个模型而不选别的模型?如果回答不了,说明模型选择缺乏依据。
综合语言风险与模型考量两层检测,Skills会输出一份完整的自查报告,同时提供简洁版和完整版两个版本。
04 输出与演示:红色标注问题严重程度
自查报告的输出形式如下:
- 简洁版:快速概览论文的整体AI风险等级、主要问题类别与核心改进建议;
- 完整版:逐层、逐维度的详细检测结果,每个问题都有具体的位置标注、问题判别与修改建议。
实际演示效果(两篇论文对比):
第一篇论文问题较多:报告中问题严重的部分会以红色背景标注,明确指出具体哪里有问题、问题判别是什么、哪些属于比较严重的问题(例如"自证式结论"——用结论本身来证明结论)、以及应该如何改进。每个检测层、每个维度下的常见问题都会逐一列出。
第二篇论文相对较好:整体风险较低,报告中红色标注较少,主要是一些细节层面的优化建议。
通过这种方式,参赛者可以直观地看到自己论文中AI痕迹较重的位置,以及对应的实质性问题,从而有针对性地进行修改。
05 备选方案:豆包文档版(无Skills也能用)
考虑到最近很多参赛者反映对Skills的使用有一定难度(如网络环境、配置问题等),我们还提供了一个备选方案——豆包文档版。
这个方案参考了数学建模领域内容创作者的做法:将检测逻辑写好成一个Word文档,参赛者只需把自己的论文和这个文档一起发给豆包,然后说一句"基于这个Word文档来对AI痕迹进行检查",豆包就会直接生成一篇检查文档,效果相当不错。
与Skills版的性能对比:
- 豆包文档版能够模仿Skills的检测逻辑,也能做到比较精细的检查,包括逐页判断是否有拔高、是否无数据支撑等常见AI痕迹;
- 但在性能上终究没有Skills精准:以同一篇问题较多的论文为例,Skills版可能只给20多分(问题严重),而豆包文档版可能给到60多分——说明豆包版对部分问题的检测不够敏感,存在漏检;
- 建议:如果有能力使用Skills,尽量使用Skills;如果没有条件,豆包文档版也能做到相当程度的精细检查,是一个可用的备选方案。
06 如何使用与注意事项
推荐使用流程:
- 论文初稿完成后,将论文输入AI痕迹自查Skills;
- 获取简洁版与完整版报告,重点关注红色标注的严重问题;
- 针对语言风险层面的问题,修改AI味过重的表达,补充证据与依据;
- 针对模型考量层面的问题,逐一核查模型的常用性、复杂度收益、是否华而不实,必要时回归更基础的模型;
- 修改完成后,可再次运行自查,确认问题已修复。
重要注意事项:
- AI痕迹自查的目的不是"消除AI痕迹"去作弊,而是为了发现AI直出论文中的实质性问题——内容空泛、参数无依据、约束漏缺、模型华而不实等。自查是提升论文质量的工具,不是规避检测的手段;
- 模型越复杂不代表越好。数模的核心是用基础模型实现完整求解,天花乱坠的复杂模型往往适得其反;
- 人为主体、AI辅助。自查工具只能辅助发现问题,最终的判断和修改必须由人来完成;
- 没条件使用Skills的参赛者,可以使用豆包文档版作为备选,同样能发现大部分问题。