真实案例复盘:academic-research-skills-codex完整跑通教育学论文6阶段流水线的全过程
【免费下载链接】academic-research-skills-codexCodex-native Academic Research Skills suite for human-in-the-loop academic research workflows项目地址: https://gitcode.com/gh_mirrors/ac/academic-research-skills-codex
academic-research-skills-codex(简称 ARS-Codex)是一套面向 Codex 平台的学术研究工作流技能套件,主打"人在回路"(human-in-the-loop)的从研究到成文的全流程自动化:苏格拉底式研究问题收敛、论文大纲生成、强制完整性检查、模拟同行评审、修订路线规划,一个都不少。本文不复述概念,而是直接复盘仓库中提交的一份真实案例:一篇教育学论文《From Compliance Assurance to Quality Intelligence》(高等教育质量保障 + Agentic AI 主题)如何被完整跑通 6 个阶段,全程仅花费约 1–2 美元 API 成本。
案例全景:一张表看懂 6 阶段流水线
这次运行使用 Codex CLI 0.130.0(codex exec只读沙箱模式),每阶段独立调用、低推理档,累计约 19 万 tokens。各阶段的实际产物都保存在examples/codex/full-pipeline-heqa-scope-transformation/目录下,可逐文件查看:
| 阶段 | 路由到的工作流 / 模式 | 结果 | 产物文件 |
|---|---|---|---|
| 1 — 研究 | deep-research/ socratic | 3 个收敛性问题,路由正确 | stage1_research_socratic.md |
| 2 — 写作 | academic-paper/ outline-only | 5 节理论论文大纲 | stage2_write_outline.md |
| 2.5 — 完整性闸门 | 7 模式失败清单(强制) | 2 项 HOLD | stage2.5_integrity_gate.md |
| 3 — 评审 | academic-paper-reviewer/ quick | Major Revision,3 条实质意见 | stage3_review_quick.md |
| 4 — 修订 | academic-paper/ revision-coach | P1/P1/P2 修订路线图 | stage4_revision_roadmap.md |
| 4.5 — 最终完整性 | 7 模式回归检查(强制) | PASS + 2 个写作观察点 | stage4.5_final_integrity.md |
| 6 — 过程总结 | 6 维度协作质量自评 | 均分 92.2/100 | stage6_process_summary.md |
💡 需要说明:这是一次"冒烟级"完整遍历(每阶段用最轻模式,未跑跨模型验证),但恰好能干净地展示流水线的骨架——路由是否正确、闸门是否真的在拦截、跨阶段结论是否传递。案例说明见 README。
阶段 1:苏格拉底式提问,先把研究问题收敛
用户的初始输入只有一句模糊的想法:"agentic AI 正在改变高等教育质量保障的边界,但我还没有明确的研究问题。"
此时最容易犯的错误是让 AI 直接开写。而路由器(入口逻辑见 SKILL.md 的 "Paper Topic Scoping Override" 一节)检测到"只有宽泛主题、无可回答的研究问题",强制路由到deep-research的 socratic 模式,只允许提问、禁止产出大纲或初稿。
AI 随即按 FINER 框架(可行/有趣/新颖/伦理/相关)给出了 3 个收敛问题,分别追问:
- 被改变的"边界"具体指什么——评估对象、评估主体、证据生产方式,还是质量判断权?
- 你更关注哪种 QA 场景——机构认证、项目审查、外部审计,还是学习成果评估?
- 你想解释的核心概念谜题是什么——AI 作为被评估的新对象、改造 QA 实践的工具,还是挑战"教育质量"定义本身的力量?
用户回答后收敛出最终研究问题(RQ):agentic AI 如何重塑 HEQA 的范围?需要什么样的分析框架来区分"AI 即自动化"与"AI 即范围转型"两类用例?问题从一句口号变成了可写、可论证、可评审的命题。
阶段 2:outline-only 模式,5 分钟拿到理论论文骨架
带着收敛后的 RQ 进入阶段 2,路由器这次正确选择academic-paper的 outline-only 模式(而非 full 模式直接写正文),由structure_architect_agent套用理论型论文结构模板,产出 5 节大纲:
- §1 引言:把 agentic AI 定位为 HEQA 的"边界问题"
- §2 概念背景:从 QA 流程到 QA 范围的演进
- §3 分析框架:自动化 vs 范围转型的诊断矩阵(任务本体、决策权、证据生成、问责归属等维度)
- §4 框架应用:自动化用例与范围转型用例对照
- §5 意涵:对 HEQA 研究、治理与未来研究方向的启示
关键纪律:大纲之后立即停手,不写正文。每个阶段只做一件事,是这条流水线可控性的根基。完整大纲原文见 stage2_write_outline.md。
阶段 2.5:完整性闸门拦截了 2 项 HOLD
这是整套架构最"硬核"的部分。阶段 2.5 是强制闸门(MANDATORY),依据 ai_research_failure_modes.md 中的 7 模式 AI 研究失败清单逐项排查:实现 bug、虚构引用、虚构实验结果、走捷径、把 bug 当洞见、方法学造假、框架锁定(frame-lock)。
这次的结果不是"盖章通过",而是抓出了 2 项 HOLD:
| 模式 | 判定 | AI 给出的理由 |
|---|---|---|
| 方法学造假(Mode 6) | ⚠️ HOLD | 诊断维度和矩阵有"过度声称分析精度"的风险——除非明确定位为启发式类型学,而非已验证的测量框架 |
| 框架锁定(Mode 7) | ⚠️ HOLD | "自动化 vs 转型"的二分法可能遮蔽第三类案例(增强、治理重构、能力迁移等) |
其余 5 项 PASS 或 N/A(概念论文暂无代码与引用)。注意闸门纪律:每项 HOLD 必须附一句理由,不允许只贴 PASS/HOLD 标签。这两条 HOLD 是后面所有环节的伏笔。
阶段 3:模拟同行评审,独立给出同一诊断
阶段 3 路由到academic-paper-reviewer的 quick 模式(单主编裁决 + 2–3 条核心意见,而非 5 人评审团)。裁决:Major Revision(大修),3 条意见:
- 核心区分有"听起来像分类学而非论证"的风险——必须给出更锋利的概念判据,说清 HEQA 的对象/时间性/证据基础/权力结构何时算"真的变了"
- "仅人类可保留"的边界(价值观、问责、同行评议、最终质量决策)规范基础不够强
- §4 用例有蔓延风险——每个例子必须绑定框架中的一个诊断维度,否则会读成"AI 应用目录"
最漂亮的地方在于跨阶段一致性:评审意见 #1 正是阶段 2.5 HOLD 项"框架锁定"的另一种表达,意见 #3 正是"方法学过度声称"的另一种表达。两条独立通道(完整性闸门 + 模拟评审)从不同角度抓到了同一个弱点——这被视为流水线健康的正向回归信号。
阶段 4:修订路线图与评审意见 1:1 对齐
阶段 4 路由到academic-paper的 revision-coach 模式,产出的是修订路线图而非重写正文,每条意见对应一行:
| 优先级 | 针对意见 | 具体写作动作 | 落点 |
|---|---|---|---|
| P1 | 分类学风险 | 增加"转化判据":至少一个诊断维度改变了判断对象、时间逻辑、可接受证据或权力结构,才算转型 | §3,呼应 §1/§5 |
| P1 | 规范基础薄弱 | 把人类保留边界重写为规范性主张:合法性、问责、专业判断、正当程序与 AI 的认知边界不可委托给统计系统 | §3 新增小节 + §5 |
| P2 | 用例蔓延 | §4 重组为"一个用例绑定一个诊断维度",删除目录式举例 | §4,可加小型诊断矩阵表 |
验收标准写得很死:路线图条目必须与评审意见 1:1 对应(本例 #1/#2/#3 严格对齐),动作列必须是具体写作动作,不允许出现"处理意见 1"这种空话。
阶段 4.5:最终完整性检查,分清"已清除"与"新风险"
阶段 4.5 再次运行 7 模式清单,这次它做了朴素实现做不到的事——区分"被修订清除的旧问题"与"修订新引入的风险":
- 原 2 项 HOLD:CLEAR(已被 P1 动作处理)
- 但产生 2 个新写作观察点:
- W1:§3 框架在最终稿中必须自称"启发式/诊断框架",绝不能写成"已验证的测量工具"
- W2:§4 的"一用例一维度"映射有反向框架锁定风险——真实 HEQA 实践可能多维复合,成稿需承认这一点
判定:PASS(附 2 个观察点),且明确要求观察点必须传递到定稿阶段,不许静默丢弃。
阶段 6:92.2 分的自评,附一句"自我反思声明"
阶段 6 输出 6 维度协作质量评分(方向设定 94、智力贡献 91、质量把关 95、迭代纪律 92、委托效率 88、元学习 93,均分 92.2/100),最低分恰好出现在"委托效率"——因为本案例为留存证据而刻意分 6 次独立调用,真实写论文时合并会话会更高效。
更值得注意的是一个必须存在的"讽刺性声明"(irony caveat):这份自评本身就是被评估的 AI 生成的自我报告,并非第三方独立评估。该声明的缺失会被视为阶段 6 降级——这种"对自己的不信任"内置在架构里,是本案例最值得借鉴的设计。
新手上手:如何自己复现这条流水线
📌 三条快速路径:
- 阅读案例:从 examples/codex/full-pipeline-heqa-scope-transformation/README.md 开始,其中每阶段的原始用户提示词都可逐字复跑
- 理解架构:完整 10 阶段状态机(含两次评审循环 3'/4')定义在 academic-pipeline/WORKFLOW.md;路由与"宽泛主题先走苏格拉底"的覆盖规则在 SKILL.md
- 动手运行:安装 Codex CLI 后,克隆本仓库(
https://gitcode.com/gh_mirrors/ac/academic-research-skills-codex),按 README 中codex exec --ephemeral --sandbox read-only的方式逐阶段复跑,观察路由判定与闸门输出是否与案例一致——这正是该目录存在的意义:任何阶段的路由漂移或闸门失效都可被检测为回归
一句话总结:这条流水线给新手的核心示范不是"AI 替你写论文",而是每一步都有路由判定、有强制闸门、有跨阶段传递,且每个结论都能复跑验证——AI 学术写作从玄学变成了工程。
【免费下载链接】academic-research-skills-codexCodex-native Academic Research Skills suite for human-in-the-loop academic research workflows项目地址: https://gitcode.com/gh_mirrors/ac/academic-research-skills-codex
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考