2026/7/24 18:28:49
网站建设
项目流程
一、底层引擎:LLM
定义与架构
- LLM 全称:Large Language Model(大语言模型),简称大模型
- 底层架构:基于Transformer(2017年Google团队在论文《Attention Is All You Need》中提出)
- 工作原理:本质是文字接龙游戏,通过预测下一个概率最高的词生成连续文本
发展历程
| 时间 | 事件 | 意义 |
|---|
| 2017年 | Transformer架构提出 | 奠定大模型的技术基础 |
| 2018年 | GPT-1发布 | 开启新的范式转变 |
| 2022年11月 | GPT-3.5发布 | 首个达到可用级别的大模型 |
| 2023年3月 | GPT-4发布 | 大幅提升AI能力天花板 |
| 2023年后 | Claude、Gemini等应用出现 | AI赛道从OpenAI独角戏变为多强竞争 |
二、数据处理单元:Token
核心特性
- 定义:大模型处理文本的最小单位(词元化),通过Tokenizer(分词器)将用户输入的文本切分为片段给到大模型
- 编码过程:User->Tokenizer->LLM。两步走——1.切分文本为N个Token,2.映射Token(文字)为Token ID(数字)。
- 解码过程:LLM->Tokenizer->User。一步走——将1个Token ID(数字)映射为Token(文字)。
Token 与自然语言单位的关系
| 语言 | 与 Token 的关系 | 示例 |
|---|
| 中文 | 非一一对应,可能被拆分 | “工作坊” => “工作”+“坊” |
| 简单英文单词 | 常见词通常对应1个Token | “hello” => 1 Token |
| 复杂英文单词 | 可能被拆分 | “helpful” => “help”+“ful” |
| 特殊字符 | 可能需要多个Token展示 | √ => 3 Token |
Token 量化参考
- 1 个 Token ≈ 0.75 个英文单词
- 1 个 Token ≈ 1.5-2 个汉字
- 40万 Token ≈ 60-80万汉字 或 30万英文单词
三、临时记忆体:Context(上下文)
核心概念
- 定义:大模型每次处理任务时接收的信息总和,相当于模型的“临时记忆”
- 容量限制:由上下文窗口(Context Window)定义,即Context能容纳的最大Token数量
主流模型 Context Window 对比
| 模型 | Context Window (Token) | 约对应汉字数量 |
|---|
| GPT-5.4 | 105万 | 约157.5万 |
| Gemini 3.1 Pro | 100万 | 约150万 |
| Claude Opus 4.6 | 100万 | 约150万 |
突破Context Window限制的方案
- RAG 技术(检索增强生成):从知识库中抽取与问题最相关的片段,仅将关键信息送入模型,降低Token消耗
四、指令交互:Prompt(提示词)
定义与分类
- Prompt:大模型接收的具体问题或指令,直接决定模型的输出质量
- Prompt类型:
–User Prompt:用户输入的具体任务(如:帮我写一首诗 or 请帮我写一首五言绝句,主题是秋天的落叶,风格要悲凉一点)
–System Prompt:开发者后台配置的人设与做事规则(如:你是一个耐心的数学老师,当学生问你数学问题时,不要直接给答案,而是要一步步引导学生思考,帮助他们理解解题的思路)
Prompt Engineering(提示词工程)
- 核心原则:清晰、具体、明确(研究怎么把问题/指令说清楚,让大模型更精准地理解你的意图)
- 现状:曾经重要,但重要性逐渐下降,主要是大模型能力提升快,越来越会推测模糊问题/指令的意图
五、外部能力扩展:Tool(工具/函数)
核心作用
- 定义:大模型调用的外部函数,使其能够感知和影响外部环境
- 解决痛点:弥补大模型无法获取实时信息(如天气)、计算能力有限等弱点
核心作用
- 用户提问->平台转发至大模型(转发内容还包含目前可用的工具列表,如天气查询工具、计算器工具)
- 大模型分析->生成工具调用指令
- 平台执行调用->平台获取结果->平台返回调用结果至大模型
- 大模型整理结果->自然语言输出
![]()
角色分工
| 角色 | 职责 |
|---|
| 用户 | 输入问题/指令 |
| 大模型 | 1.选择工具、生成调用参数,2.归纳总结工具执行结果 |
| 工具 | 执行具体功能(如查询天气) |
| 平台(Agent) | 串联流程:转发信息、执行工具调用(传话筒角色,因为用户、大模型和工具无法直接对话) |
六、工具调用:MCP
- 全称:Model Context Protocol(模型上下文协议)
- 本质:统一的工具接入规范,解决不同平台接入规范不一致的问题(比如:OpenAI、Anthropic、Google三个平台各自有接入规范,需要写多个接入规范,只想弄一个统一的技术规范标准)
- 价值:工具开发者只需按MCP规范开发一次,即可在所有支持MCP的平台使用(类比手机都统一用Type-C充电口)
七、自主决策系统:Agent
- 定义:能够自主规划、自主调用工具,持续工作直至完成用户任务的系统
- 核心能力:多步骤推理、工具选择、流程控制
- 代表产品:Claude Code、Codex、Gemini CLI等
- 典型构建模式:React、Plan and Execute等
八、任务定制:Agent Skill
核心能力
- 定义:给Agent的说明文档,包含任务规则、执行步骤、输出格式等
- 结构:
–元数据层:name(名称)、description(描述)
–指令层:目标、执行步骤、判断规则、输出格式、示例
技术实现
- 存储形式:Markdown文档(文档必须为"SKILL.md")
- 存放位置:特定目录(如Claude Code找到用户目录的".claude/skills"文件夹)
- 加载机制:仅在用户问题与技能名称/描述相关时加载完整指令
九、概念体系回顾
核心引擎 => 数据单位 => 记忆空间 => 交互接口 => 外部能力 => 工具标准 => 决策系统 => 任务定制
- LLM:大模型
- Token:大模型处理数据的最基本单元
- Context:大模型每次处理任务时接收到的信息总和
- Context Window:大模型的Context最多能够存储的Token量
- Prompt(User/System):用户或系统当前给大模型下达的具体指令或问题
- Tool:大模型用来感知和影响外部环境的函数
- MCP:统一了工具接入格式的标准协议
- Agent:能自主规划和调用工具、直至解决用户问题的程序
- Agent Skill:给Agent看的说明文档
十、补充细节
- Transformer架构:虽由Google提出,但由OpenAI通过GPT系统引爆
- Token切分原理:基于BPE(字节对编码)算法,模型自主学习的文本切分规则
- Agent Skill高级特性:支持允许代码、引用资源,采用渐进式披露机制节省Token
- RAG技术:通过检索相关片段而非全文,有效解决Context Window限制问题
视频指路:https://www.bilibili.com/video/BV1E7wtzaEdq/?spm_id_from=333.337.search-card.all.click&vd_source=f50ab1a8c52791f592580e80a16e5536