- 文档
- 教程
- 人工智能
- 大模型
【免费下载链接】awesome-generative-ai-guide
A one stop repository for generative AI research updates, interview resources, notebooks and much more!
本文基于仓库 youtube/claude-code-16-tips.md 整理成文,配套视频速览见 youtube/claude-code-5-levels.md。这是一份可直接交给你的 Agent 执行的 16 条清单,覆盖从上下文审核、提示词优化、任务隔离、故障恢复到循环工程共 5 个层级;读完本文你可以掌握一套系统化方法:先审计并搭建上下文、再优化提问方式、通过任务隔离保持长任务质量、用回退与交接修复坏掉的会话,最后把可校验目标、独立检查、上限与闸门、持久记忆四要素组合成能自主运行且不失控、不烧钱的自动化循环。
这份清单怎么用
原始清单本身就是一个可以直接"喂"给 Agent 的提示词文件。把它作为配套检查单交给你的 Agent,让它对照 16 条逐一评估你的项目现状:
Read the checklist file in this repository: youtube/claude-code-16-tips.md Go through all 16 tips. Tell me which ones we already do, which ones apply to this project, and which ones do not. For the ones that apply and we are not doing, propose the specific change and wait for me to approve each one before you make it.关键原则:层级是层层叠加的。在一个连 Level 1 都没做好的项目上直接套用 Level 5,只会得到"一条自动化产线更快地产出错误答案"。先打好上下文基础,再谈自主循环。
Level 1:上下文审核与初始化(Context Audit & Setup)
这一层解决的核心问题是:在向 Agent 提问之前,先确保喂给它的"原料"是对的。上下文就是你交给 Agent 的文档、数据、文件与笔记;这一层做扎实,上层的一切都会更轻松。本层共 4 条技巧。
Tip 1:先审计你的上下文,再信任它
过时、互相冲突的文件会让 Agent 自信地给出错误答案——因为它无法判断哪个版本才是当前有效的。因此在依赖任何资料之前,先加入一步审计:
Audit these files before I rely on any of them. List everything that conflicts, is duplicated, is out of date, or is missing, and point to the exact file. Do not fix anything yet. Then we go through the list together and fix them one at a time, based on my calls.注意最后两句:先只列问题、不修任何东西,然后由你逐条决策修复。审计的产出是分类整理的问题清单:数据冲突、重复表述、空头承诺(有承诺但无支撑的信息)、过时术语等。这一步能让你在进入下一步之前就看清数据不一致的全貌。
Tip 2:自己写一份身份文件(Identity File),并保持精炼
身份文件是 Agent 每次会话开始时都会读取的简短简介,常见载体包括CLAUDE.md、AGENTS.md或你所用工具的 custom instructions。两个要点:
- 自己写(至少亲自审校)。相关研究显示,LLM 生成的身份文件反而表现更差、且让用户推理成本上升超过 20%——自己写,核心价值在于"掌控 Agent 的行为",而不是省事。
- 保持精简。该文件在每次会话都会加载,臃肿意味着每次任务在你输入任何字之前就白白消耗 token。一个可工作的范例:
# Working with me ## Who I am I run Acme Analytics. We sell a lightweight analytics tool to early-stage founders. ## How I like to work - Plain, direct language. No corporate filler, no exclamation points. - Show me the option you'd pick and why, then the alternatives. Don't make me choose blind. - Match the writing examples in ./examples when I ask for anything customer-facing. ## Hard nos - Never invent a number, a date, or a customer name. If you're unsure, ask. - Never send anything external (email, Slack, social) without showing me first. ## Gotchas - "Revenue" here always means recognized revenue, not bookings. - Current pricing lives in pricing_current.md. Ignore any older pricing file.结构上建议包含四块:Who I am(你是谁/公司做什么)、How I like to work(协作偏好与沟通风格)、Hard nos(红线,如禁止编造数字、禁止未经确认外发)、Gotchas(领域陷阱词与文件时效规则)。写完后用一条测试验收每一行:删掉任何一句"缺失也不会改变 Agent 行为"的句子。关于身份文件的设计细节,仓库中 youtube/how-ai-agents-work.md 也把它列为 AI Agent 四大组成部件之首(identity、tools、triggers、memory),可交叉阅读。
Tip 3:用真实范例展示"好是什么样"
与其用形容词描述你想要什么,不如直接指向真实范例。写冷邮件时:
Connect to my Gmail, pull the cold emails I wrote to [X, Y, Z], and write this new one in the same style.更进一步,把范例沉淀为可复用模板:
Look at those emails and build me a style template for cold emails to potential clients.技巧要点:给一个范围——一个直白的范例加一个更难的范例,让 Agent 抓住意图而非复制表面模式。演示中 Agent 能自动提炼出范例邮件里的"触发价值点 + 软性请求"等模式,此后每封新邮件都复用同一套模板,行为就被"编码化"了。
Tip 4:关掉你不用的工具
每个已连接的工具都会把完整工具描述加载进上下文,且是在每条消息中都加载——即使你从不调用它。连接的工具越多,选错工具的路径也越多。相关基准测试显示:同一任务在 46 个可用工具下失败、缩减到 19 个工具(仍在上下文窗口内)后通过。只保留你实际调用的工具,其余一律关闭,既省 token 又提准确率。这一条与 youtube/how-ai-agents-work.md 中"工具连接必须关注 scopes(读/写/发送权限)、先只连邮件/日历/任务系统三个核心场所"的建议互为印证。
Level 2:提示词优化(Prompt Optimization)
Level 1 保证了 Agent 拿得到正确的信息,这一层解决如何问。共 3 条技巧,其中第 7 条能在长对话中省下约 90% 的成本。
Tip 5:让它先"采访"你
模型通常能察觉请求含糊,但很少停下来追问,而是直接猜测。与其第一次就写出完美提示词,不如让 Agent 先问够问题:
Before you write anything, ask me questions one at a time until you have everything you need. Do not start until I say go.演示中,Agent 提出的问题甚至包含你自己没想到的细节,帮你把需求钉得更牢,而不是让你一个人预先穷举所有变量。
Tip 6:要求它引用来源
这是降低幻觉最有效的一招。只要任务基于某份文档,就强制它指向原文行:
Using only the document above, answer [question]. Quote the exact line behind every claim. If the answer is not in the document, say "not stated".注意:可以跳过"think step by step"——当前模型在未被告知的情况下也会自行推理,这属于提示词层面的老技巧,见仓库 free_courses/agentic_ai_crash_course/part6_planning_in_agents_reasoning_models.md 中对 Chain-of-Thought 演进为"按设计训练推理(LRM)"的论述。
Tip 7:上下文在前,问题在后(利用前缀缓存)
面对一份大文档 + 一串问题,把文档只粘贴一次放在最上面,问题堆叠在其下。稳定块在顶部会被缓存复用,后续每个问题都比重新粘贴更便宜、更快:
[paste the document] Using only the document above, [your question].Next, from the same document: [another question].原理是各大模型 API 的prompt caching / prefix caching:从顶部开始缓存,保持不变的稳定前缀命中缓存,缓存价格可比新提示词低至 90%。规则:稳定的东西放上面当前缀,问题与对话放下方。
Level 3:任务隔离(Task Isolation)
对话越长,Agent 质量越容易劣化——这是有研究支撑的现象(context rot,上下文腐烂)。本层 3 条技巧解决"如何在长而乱的任务里让 Agent 保持锐利"。
Tip 8:每个任务开新对话
上一任务的一切都留在上下文里争夺注意力、烧 token。切换任务时务必开新会话。收益双份:质量大幅提升(不再被无关上下文干扰),成本下降(不再为别的任务的 token 付费)。一句话:一个任务,一个对话(one task, one chat)。
Tip 9:只给它该给的东西
跨 18 个模型的研究(Chroma,"Context Rot")表明:同样的信息放在短聚焦提示词里,效果优于埋在大段文本里。能塞进上下文窗口 ≠ 能被用好。做任务时只拉取与当前任务相关的数据,例如限制 Agent 可访问的文件夹,或建设一个 wiki 作为统一知识源。
Tip 10:把进展压缩进一个文件
任何跨越多个会话的任务,都应该主动做"压缩":
Write a compact progress file called progress.md with exactly this: the goal, the key decisions we have made and why, what is still open, and the single most important thing to do next. Keep it tight, no filler.Agent 自带的自动压缩会替你做决定、决定什么该存活;自己写则意味着你来选择。长任务中途还可以用这一条反向检查它到底记住了什么:
Summarize everything you currently have in context.Level 4:故障恢复(Failure Recovery)
长对话中途"腐烂"(反复忘记、重复已修复的错误)时的两条关键动作,都是现代 Agent 最被低估的能力。
Tip 11:回退到最后一个正确的点
一条稍微跑偏的指令,可能被后续所有工作层层叠加放大;就地修正只会把更多混乱堆在上面。Claude Code 中双击 Escape 或输入/rewind,选中跑偏之前的那条消息,其后所有内容退出上下文,再带着你已知的信息从干净节点重新提问。Codex 提供轻量版本(编辑更早的消息,但不会撤销文件改动)。
Tip 12:整条线程烂透时,交接并重启
重置,但要保留决策。触发信号:同一件事被纠正超过两次。
Write a handoff into progress.md: keep [the specific things worth keeping], and drop everything else.然后开新会话、加载该文件、继续。不要和腐烂的线程硬扛——这是 Anthropic 官方博客也认可的做法。这与 Level 3 的 Tip 10 衔接成一套"压缩 → 交接 → 重启"流水线。
Level 5:循环工程(Loop Engineering)
这一层让 Agent 脱离"逐轮 babysit",自主运行并随时间改进。一个循环必须同时具备以下 4 个要素,缺一个就会空转、卡死或账单飞涨:
| 要素 | 作用 | 缺失后果 |
|---|---|---|
| 可自我校验的目标 | 有明确完成标准 | 永远"做不完" |
| 独立于执行的检查 | 判定通过/失败的人与干活的人分离 | 自我打分偏向通过 |
| 上限与闸门(Cap & Gate) | 停止条件 + 可接触范围 | 无限跑、无限烧钱 |
| 可持续学习的记忆 | 运行前读、运行后写的文件 | 每次运行都从零开始 |
Tip 13:给出它能自行校验的目标
"Keep an eye on the competition"永远不会完成;"Check all 5 competitors and report what changed since yesterday"可以。写不出可校验的目标,说明任务还没准备好变成循环。
Tip 14:检查必须与执行分离
判定通过/失败的一方要与产出工作的一方分离——让 Agent 给自己的产出打分,它天然偏向"通过"。
Tip 15:加上上限和闸门,且设在工具层
cap防止它无限运行烧钱;gate限定它能触碰的范围。这两者要在工具(权限/配额)层面设置,而不是只写在提示词里——只活在提示词里的规则,模型可以说服自己绕过它。
Tip 16:给它一份会学习的记忆
一个开始前读取、结束后更新的文件,让每次运行都知道上一次看到了什么。这正是 free_courses/agentic_ai_crash_course/part7_memory_in_agents.md 中讨论的长期记忆(semantic/episodic/procedural)在操作层面的最小实现:写结构化记忆 → 按需检索 → 用于 grounding 下一步动作。
四要素合一的完整循环指令
Every morning, check these 5 competitors: [their pricing pages, blogs, and LinkedIn]. Compare each against the snapshot in progress.md and flag only what actually changed, then save the updated snapshot back to that file. Post a short summary to my Slack: what changed, and for which competitor. Stop once you've been through all five, and don't take any action beyond reading and posting that summary.逐条对照:可校验目标(5 家竞品逐一检查并报告)、独立检查(与 progress.md 快照对比、只 flag 真实变化)、cap 与 gate(遍历完 5 家即停、只读+发摘要不做其他动作)、记忆(读写 progress.md 快照)。
运行纪律:先盯住第一轮运行,陪它跑一两轮再放手让它无人值守;确认它在检查"真实的东西",而不是玩弄检查机制宣布自己完成。另外,循环只适合你足够了解、知道"完成"定义、能写出停止标准的任务——否则你连 check 和 gate 都定义不出来。关于可校验目标、独立评估的思想,可进一步参考仓库的评估主题页 topics/evaluation.md 与 ai_evals_for_everyone;想把这一整套能力落到真实 Agent 系统上,可沿着 paths/agent-builder.md 的路线(Agentic AI Crash Course → Agentic RAG → Evals → 安全)推进。
这 16 条背后的研究依据
清单并非拍脑袋,配套视频页 youtube/claude-code-5-levels.md 给出了关键结论的来源,此处如实转述:
- Gloaguen 等人(ETH Zurich 与 LogicStar.ai,2026 年 2 月):在 138 个真实 Python 任务上,LLM 生成的仓库级上下文文件使任务成功率下降约 2~3%,同时推理成本上升超 20%;开发者手写文件同样存在成本上升,因此"自己写"的理由是对行为的掌控,而非免费收益。(Tip 2)
- Chroma《Context Rot》(2025 年 7 月):跨 18 个模型,同一事实放在短提示词中优于埋在大文本中。(Tip 9)
- Liu 等人《Lost in the Middle》(2023):上下文窗口中的位置决定信息被利用的程度。(Tip 7、9)
- Drew Breunig《How Long Contexts Fail》(2025 年 6 月):量化版 Llama 3.1 8b 在 GeoEngine 基准上,46 个工具可用时任务失败、19 个工具时通过,且两者都在上下文窗口之内——工具过载的证据。(Tip 4)
- Anthropic《Effective context engineering for AI agents》:"最小集合、高信号 token"这一框架,正是 Level 3 背后的思想。(Tip 9)
快速复盘:五级进阶一览
- Level 1 上下文审核与初始化:先审计资料(Tip 1)→ 自己写精炼身份文件(Tip 2)→ 用范例展示好输出(Tip 3)→ 关掉无用工具(Tip 4),让 Agent 停止猜测。
- Level 2 提示词优化:让它采访你(Tip 5)→ 要求引用来源(Tip 6)→ 上下文在前、问题在后吃前缀缓存红利(Tip 7)。
- Level 3 任务隔离:每任务新会话(Tip 8)→ 只给相关上下文(Tip 9)→ 主动压缩进展到文件(Tip 10)。
- Level 4 故障恢复:回退到最后正确点(Tip 11)→ 线程烂透就交接重启(Tip 12)。
- Level 5 循环工程:可校验目标 + 独立检查 + 工具层上限/闸门 + 会学习的记忆,四要素缺一不可(Tip 13–16)。
大多数用户止步于 Level 2;完整走完五级,你才从"会用提示词"进阶到"会运营 Agent"。全套清单与逐条提示词在 youtube/claude-code-16-tips.md,更多视频配套资源见 youtube/README.md。
- 文档
- 教程
- 人工智能
- 大模型
【免费下载链接】awesome-generative-ai-guide
A one stop repository for generative AI research updates, interview resources, notebooks and much more!
相关推荐
Claude Code 与 Codex 的五个操作层级:16 条研究支撑的提效与降本实践指南
Claude Code 与 Codex 的五个操作层级:16 条研究支撑的提效与降本实践指南 导读 本文以本仓库 youtube/claude code 5 l
文档教程人工智能大模型生成式 AI 综述论文速查手册:基于 awesome-generative-ai-guide 的九大主题研究地图
生成式 AI 综述论文速查手册:基于 awesome generative ai guide 的九大主题研究地图 本篇技术指南围绕仓库中的 research_u
文档教程人工智能大模型10倍提升AI效率:Awesome Generative AI项目性能优化终极指南
10倍提升AI效率:Awesome Generative AI项目性能优化终极指南 在当今AI驱动的时代,生成式人工智能(Generative AI)正以前所未
人工智能大模型文档
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考