有学术论文背书:yomiyasu 语法转换14原则的底层依据全解析
【免费下载链接】yomiyasuAI生成の日本語を自然な日本語へ推敲するAgent Skill / Agent Skill for Refining AI-Generated Japanese into Natural Japanese项目地址: https://gitcode.com/gh_mirrors/yo/yomiyasu
yomiyasu 是一个把 AI 生成的不自然日语润色成自然日语的 Agent Skill(智能体技能)。它的核心不是"禁用某些词",而是一套体系化的语法转换规则——共 14 条原则,每一条背后都有学术论文、大规模语料统计或 Markdown 语言规范的实证依据。本文为你逐条拆解 yomiyasu 语法转换 14 原则的底层逻辑,让你明白它凭什么比"黑名单式提示词"更能去掉文章的"AI 味"。
为什么单词黑名单治不好"AI 味"?
很多人第一次处理 AI 味文章时会这样做:在提示词里写"不要用『手触り』『解像度』『地味に効く』"。结果 AI 只是换个说法继续犯病——把"手触り"换成"实态",把"地味に効く"换成"効果を発揮する",句子骨架依然僵硬难读。
问题出在哪?社区研究和 7 万篇文章的量化分析(Qiita 平台 70,524 篇)都指向同一个结论:AI 味的根源在语法结构,而不是选词。
- 形式通胀:太字出现频率增至约 3 倍,列表增至 1.8 倍,破折号激增至约 10 倍
- 比喻动词激增:"壊れる(坏掉)"出现率约 16 倍、"効く(管用)"约 11 倍、"静かに(静静地)"约 49 倍
- "谁做了什么"的主谓结构被省略,读者被迫脑补因果
所以 yomiyasu 选择直接重构语法,把每条规则锚定在可信的研究结论上。这套规则的完整定义在 references/gemini-syntax.md,入口说明见 SKILL.md。
14 原则 × 学术依据:一表看懂底层逻辑
| # | 原则 | 一句话做什么 | 底层依据 |
|---|---|---|---|
| 1 | SVOCM 完全复原 | 让每句话"谁・做了什么・怎么样"自成一体 | nasuvitz 的语法病理分析:AI 味主因是主谓结构崩坏与指示代词滥用 |
| 2 | 按文档立场统一文末 | 先判断全文是"劝告/规定/说明",再统一"〜します""〜しましょう" | Chen et al.(Discover Education 2025):AI 会过度添加敬语和寒暄,破坏自然距离感 |
| 3 | 拆解非生物主语 | "代码在诉说"→ 客观描述文档里写了什么 | nasuvitz:拟人化非生物主语迫使读者做过度上下文补全 |
| 4 | 比喻动词具体化 | "静悄悄地坏掉"→"不知不觉变得不可用" | ktrmnm 的 AI 语解剖 + Qiita 量化调查证实"壊れる"等比喻动词激增 |
| 5 | 整理自我标签与否定对比 | 删掉"重要的是""结论是"这类空前置;有意义的"A 不是 B"保留 | nasuvitz / ktrmnm:self-labeling 与修辞性否定对比的病理分析 |
| 6 | 语义保持 + 禁止乱加信息 | 不删原文的参数与数值,也不加原文没有的原因和例子 | Jeong et al.(ACL 2026)、Ide et al.(2026):内容脱落与信息凭空添加需分开验证 |
| 7 | 文长 30~45 字、每句 0~2 个读点 | 控制句长和汉文密度(注:此为运营参考值,非论文实验值) | Yamashita et al.(LREC 2026):日语平易化 4 基准,汉字密集与长复句显著损害可读性 |
| 8 | 排除文末整齐划一 | 仅在"〜です"等同一结尾连续 3 句以上时调整节奏 | Zaitsu et al.(PLOS ONE 2025)、三浦・久保山(JSAI 2026):文体计量学证实 AI 表面流畅、结构趋同 |
| 9 | 排除破折号(em dash) | "〜——特别是〜——"改用助词连接 | 逆瀬川 2026 量化调查:Qiita 文章破折号 7 年间增约 10 倍 |
| 10 | 排除不增信息的补充括号 | "不自然的日语(所谓 AI 味)"→ 去掉重复括注 | 160 篇验证语料的经验规则 |
| 11 | 排除日英之间半角空格 | "AI が 書いた 文章"→"AIが書いた文章" | 日语排版规范:助词与拉丁字母间不插空格 |
| 12 | 完全排除 emoji 与句末冒号 | 装饰符号一律删除 | Zhang et al.(ACL 2025):RLHF 奖励模型独立于文章质量偏好加粗、列表、emoji 的"格式偏见" |
| 13 | 重整段落逻辑结构 | 一段一话题;"接下来有个要点"这类空预告句并入正文 | 逆瀬川 2026:AI 普及后正文文字量倍增但实质信息稀薄化 |
| 14 | 太字必须能正确渲染 | 把**「太字」**改成「**太字**」等可显示写法 | CommonMark 规范 0.31.2 与 GitHub Flavored Markdown 0.29 的强调定界符规则 |
可以看到一个清晰的设计思路:结构问题交给语言学结论,符号问题交给格式偏见研究,语义问题交给信息完整性研究。规则不是拍脑袋定的,每条都有出处可查。
yomiyasu 由 ALGO ARTIS 团队的工程师大贺爱一郎开发,规则细节与学术文献的对应关系完整列在 README.md 的"致谢与参考文献"一节中。
原则之间如何协作:以"静悄悄地坏掉"为例
单独看一条原则容易,yomiyasu 的精髓在于多原则叠加。拿 AI 文中最高频的病句"データが静かに壊れます(数据会悄悄坏掉)"演示:
- 原则 3(非生物主语):数据不会自己"坏",要找动作的发起者
- 原则 4(比喻动词具体化):"壊れる"对数据是英语silently break的直译比喻,应还原为"变得不可用/出现异常"这类宽度相当的日常表达
- 原则 1(SVOCM 复原):补出主语与对象——"如果程序重复处理同一消息,数据就会不知不觉出现不一致"
- 原则 6(语义保持):不擅自加"因为网络波动"这类原文没有的原因
- 原则 7(文长控制):控制在 45 字左右一口气读完
最终产出类似 evals/comparison_benchmark.md 中展示的对照效果:
改前(AI 原文):単にメッセージを流すだけでは、背後でデータが静かに壊れます。(只传消息的话,背后的数据会悄悄坏掉。)
改后(yomiyasu 输出):メッセージの二重送信が発生しても不整合を起こさないよう、受信側のプログラムで冪等性を担保する設計が不可欠です。(为避免消息重复发送引发不一致,接收侧程序必须做幂等性设计。)
因果链完整、主谓清晰、没有比喻,读者不用脑补。更多真实改写对照可在 tests/corpus/yomiyasu_rewritten/ 目录下的 48 篇改写稿中查看。
规则不是空谈:语料验证 + 可执行检查
yomiyasu 配套了一个 160 篇文档的验证语料库(8 类实务场景 × 3 种语气 × 多个模型 + 人工写作 16 篇 + 边界用例 48 篇),其中边界用例专门用来防止误伤——比如"おにぎりを握る(捏饭团)"不该被"握る"规则命中。
同时同捆了一个零依赖的静态检查脚本,可以量化 AI 味:
python3 scripts/yomiyasu_lint.py 你的文章.md它会输出加粗密度、列表占比、比喻动词、emoji、句末冒号等指标并打分(满分 100)。检查项与 14 原则一一对应,源码见 scripts/yomiyasu_lint.py,被判定词表的整理在 references/slop-catalog.md。这样"改没改好"不再靠感觉,而是可复核的数字。
快速上手:yomiyasu 安装与使用步骤
📦 安装(Claude Code、Codex、Cursor 等环境通用):
npx skills add nanaism/yomiyasu📝 使用:把 AI 生成的初稿贴给 Agent,说一句"把这篇文章改得通顺些"即可。也可以指定领域适配不同文体:
ドメイン tech(技术文章):列表控制在 15% 以下,恢复可复现的操作步骤,详见 references/domains/tech.mdドメイン business(业务规格书):保留比喻背后的理由,明确边界条件与责任主体,详见 references/domains/business.mdドメイン essay(随笔):避免夸张的教训化,保留朴素情感,详见 references/domains/essay.md
⚠️ 小提示:如果同一环境里还启用了其他日语校对类技能,建议先禁用,避免指令互相干扰。
写在最后
yomiyasu 14 条语法转换原则的价值,不在于"多",而在于每一条都站在实证结论的肩膀上:格式偏见来自 ACL 2025 的奖励模型研究,平易化基准来自 LREC 2026,信息完整性来自 ACL 2026,节奏多样性来自 PLOS ONE 与 JSAI 的文体计量学。这套"学术依据 → 转换规则 → 语料验证 → 脚本量化"的闭环,正是它区别于普通提示词技巧的地方。
如果你经常被 AI 味日语折磨,不妨从跑一次 lint 脚本开始,看看你的文章能拿几分。
【免费下载链接】yomiyasuAI生成の日本語を自然な日本語へ推敲するAgent Skill / Agent Skill for Refining AI-Generated Japanese into Natural Japanese项目地址: https://gitcode.com/gh_mirrors/yo/yomiyasu
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考