为什么要用 283 万字语料量化「AI 味」?解读 lieflat-less-ai-tone 去 AI 味的对照语料库研究方法
【免费下载链接】lieflat-less-ai-tone一个基于 283 万字语料统计的去 AI 味 skill · An AI-tone removal skill grounded in a 2.83-million-character corpus study项目地址: https://gitcode.com/gh_mirrors/li/lieflat-less-ai-tone
lieflat-less-ai-tone 是一个基于 283 万字语料统计的去 AI 味 skill:它用对照语料库的语言学方法,把"什么是 AI 味"从主观感觉变成可复算的频率数据,再将有区分度的特征转写成改写规则,帮你把中文文本里的 AI 生成痕迹清理掉。
一、为什么「AI 味」不能只靠感觉?
🤔 写作者圈子里流传着一份判别清单:破折号用太多、"不是 A 而是 B"反复出现、句长太均匀、比喻包装抽象概念……这些条目靠社交传播,几乎成了常识。
问题在于:这些条目从未被系统检验过。其中哪些真有统计区分力?哪些只是观察者偏差?甚至有没有方向是反的?
lieflat-less-ai-tone 的研究目标不是发明新清单,而是对既有清单逐项做对照实验,并给出可复算的判定程序——这就是"为什么要用 283 万字语料量化 AI 味"的由来:只有样本足够大、两侧足够对齐,倍率数字才站得住。
二、对照语料库是怎么搭起来的?
整个方法的核心是一个严格控制的对照语料库:
| 侧 | 篇数 | 汉字数 | 句数 | 段数 |
|---|---|---|---|---|
| AI 生成(5 个模型 × 60 篇) | 300 | 1,179,105 | 37,642 | 14,549 |
| 人类写作 | 329 | 1,647,867 | 57,909 | 31,172 |
| 合计 | 629 | 2,826,972 | 95,551 | 45,721 |
1. 控制三类混淆因素
要让"AI 写的"和"人写的"差异可归因,必须先排除干扰:
- 主题与文体对齐:两侧写同类话题,否则测出的可能是文体差异;
- 五个模型各 60 篇:单一模型的"癖好"容易被误读成 AI 的共性——早期用 2 个模型 30 篇测出的"破折号是某模型独有",扩样后就被推翻了;
- 生成条件干净:不联网、不下风格指令,只给话题,测出的才是模型默认倾向。
2. 人类侧分组统计
329 篇人类文章按来源分组独立统计,用来检验组间一致性——如果某特征只在个别组偏高,说明那是个人风格,不是人类共性。单字虚词和破折号就是靠这一步被识别为"不可靠指标"的。
三、26 项候选特征实测:11 项通过,3 个反直觉发现
研究检验了 26 项候选特征,逐项计算频率比R= AI 侧频率 ÷ 人类侧频率,R≥ 2.0 才纳入。结果11 项通过、15 项排除,其中三项与流行认知方向相反 🧪:
| 流行认知 | 实测结果 |
|---|---|
| AI 爱用比喻包装抽象概念 | 人类比喻频率是 AI 的2.4 倍 |
| AI 爱设问自答 | 正文设问句,人类是 AI 的17 倍 |
| AI 句长过于均匀 | 修正切分缺陷后比值为 0.87,无差异 |
通过检验的 11 项集中在篇章与结构层面,区分力最强的是段首零回指评论(R= 4.4):AI 在新段落开头直接抛评论、不交代对象,读者得回头找。
模型间的「AI 味」各不相同
| 特征(每千字) | Claude | DeepSeek | Gemini | GPT | Kimi |
|---|---|---|---|---|---|
| 破折号 | 4.25 | 5.16 | 0.51 | 0.11 | 2.32 |
| 提示性冒号 | 0.38 | 0.43 | 0.22 | 0.25 | 0.32 |
| 问句小标题 | 0.043 | 0.086 | 0.173 | 0.008 | 0.000 |
同一特征跨模型极差可达40 倍。所谓"AI 文风"并非单一形态——这也是为什么语料必须覆盖多个模型。
四、从统计到规则:改写规则怎么来的?
统计显著 ≠ 可执行。11 项通过的特征被转写成改写规则时,附加了三重硬约束:
- 白名单原则:只处理清单内的 11 项,未命中的句子逐字保留,标题层级、段落次序一律不动;
- 信息守恒:不许新增姓名、数字、日期、因果,也不许删减观点与限定词——把"可能提升"改成"提升"属于篡改,不属于去 AI 味;
- 排除语义判断:比喻贴不贴切、案例算不算堆砌,无法转写成可执行规则,一律不碰。
规则全文见 SKILL.md,完整结果表与被推翻的预设记录在 RESEARCH.md。
五、研究方法中最值得学的 3 个点
- 分母选错会给出反向结论:AI 每篇小标题约 10 个、人类 1–2 个。用"每千字"算,问句小标题是 32 倍;换成"占小标题比例",差异直接消失。分母要匹配被测特征依附的语言单位。
- 先抽样检视再采信数字:正则匹配的是字面形态而非语义,算子过宽会误纳实例。研究公开记录了6 次因算子设计缺陷导致的测量失误及其修正(如"问句小标题 32 倍"最终被证伪),规程是:任何算子采信前,先抽查 20 条命中实例。
- 公开失败与局限:文末如实讨论语料不可核验、话题未严格配对、结论有时效性等局限——频率数值应视为特定时点的观测。
六、如何使用这个去 AI 味 skill?
📦 拿到仓库后有两种用法:
# 方式一:安装到本地 Agent git clone https://gitcode.com/gh_mirrors/li/lieflat-less-ai-tone npx skills add larashero3-dotcom/lieflat-less-ai-tone- 方式一:安装后直接丢一段文本进去,即按 11 条规则处理;
- 方式二:把 SKILL.md 直接当作 system prompt,适配任何支持自定义指令的写作工具。
如果你只想复算统计数字,仓库 scripts/ 目录下有三个脚本按目录读取.md文件即可跑全部指标:
| 脚本 | 用途 |
|---|---|
| scripts/compare-human-ai.py | 句层:各特征在两侧语料的频率与比值 |
| scripts/check-structure.py | 段落层:相邻句同构、段首零回指 |
| scripts/check-translationese.py | 译文句式频率 |
算子定义位于各脚本首部,可直接修改与复核;替换成自有语料即可复算全部指标。
七、小结
lieflat-less-ai-tone 的价值不在于又给出一份"AI 味清单",而在于演示了一条完整的研究路径:用 629 篇对照语料把流行判断逐项送检,15 项被证伪、11 项存活,再把存活项落成带硬性边界、可验收的改写规则。对于被 AI 写作痕迹困扰的新手来说,这套对照语料库方法同样可以迁移:先控制话题与文体,再选对分母,最后用你自己的语料复算——感觉之外的数据,才值得写进规则里。
【免费下载链接】lieflat-less-ai-tone一个基于 283 万字语料统计的去 AI 味 skill · An AI-tone removal skill grounded in a 2.83-million-character corpus study项目地址: https://gitcode.com/gh_mirrors/li/lieflat-less-ai-tone
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考