AI核心概念大串联
2026/7/24 18:28:49 网站建设 项目流程

一、底层引擎:LLM

定义与架构

  • LLM 全称:Large Language Model(大语言模型),简称大模型
  • 底层架构:基于Transformer(2017年Google团队在论文《Attention Is All You Need》中提出)
  • 工作原理:本质是文字接龙游戏,通过预测下一个概率最高的词生成连续文本

发展历程

时间事件意义
2017年Transformer架构提出奠定大模型的技术基础
2018年GPT-1发布开启新的范式转变
2022年11月GPT-3.5发布首个达到可用级别的大模型
2023年3月GPT-4发布大幅提升AI能力天花板
2023年后Claude、Gemini等应用出现AI赛道从OpenAI独角戏变为多强竞争

二、数据处理单元:Token

核心特性

  • 定义:大模型处理文本的最小单位(词元化),通过Tokenizer(分词器)将用户输入的文本切分为片段给到大模型
  • 编码过程:User->Tokenizer->LLM。两步走——1.切分文本为N个Token,2.映射Token(文字)为Token ID(数字)。
  • 解码过程:LLM->Tokenizer->User。一步走——将1个Token ID(数字)映射为Token(文字)。

Token 与自然语言单位的关系

语言与 Token 的关系示例
中文非一一对应,可能被拆分“工作坊” => “工作”+“坊”
简单英文单词常见词通常对应1个Token“hello” => 1 Token
复杂英文单词可能被拆分“helpful” => “help”+“ful”
特殊字符可能需要多个Token展示√ => 3 Token

Token 量化参考

  • 1 个 Token ≈ 0.75 个英文单词
  • 1 个 Token ≈ 1.5-2 个汉字
  • 40万 Token ≈ 60-80万汉字 或 30万英文单词

三、临时记忆体:Context(上下文)

核心概念

  • 定义:大模型每次处理任务时接收的信息总和,相当于模型的“临时记忆”
  • 容量限制:由上下文窗口(Context Window)定义,即Context能容纳的最大Token数量

主流模型 Context Window 对比

模型Context Window (Token)约对应汉字数量
GPT-5.4105万约157.5万
Gemini 3.1 Pro100万约150万
Claude Opus 4.6100万约150万

突破Context Window限制的方案

  • RAG 技术(检索增强生成):从知识库中抽取与问题最相关的片段,仅将关键信息送入模型,降低Token消耗

四、指令交互:Prompt(提示词)

定义与分类

  • Prompt:大模型接收的具体问题或指令,直接决定模型的输出质量
  • Prompt类型
    User Prompt:用户输入的具体任务(如:帮我写一首诗 or 请帮我写一首五言绝句,主题是秋天的落叶,风格要悲凉一点)
    System Prompt:开发者后台配置的人设与做事规则(如:你是一个耐心的数学老师,当学生问你数学问题时,不要直接给答案,而是要一步步引导学生思考,帮助他们理解解题的思路)

Prompt Engineering(提示词工程)

  • 核心原则:清晰、具体、明确(研究怎么把问题/指令说清楚,让大模型更精准地理解你的意图)
  • 现状:曾经重要,但重要性逐渐下降,主要是大模型能力提升快,越来越会推测模糊问题/指令的意图

五、外部能力扩展:Tool(工具/函数)

核心作用

  • 定义:大模型调用的外部函数,使其能够感知和影响外部环境
  • 解决痛点:弥补大模型无法获取实时信息(如天气)、计算能力有限等弱点

核心作用

  1. 用户提问->平台转发至大模型(转发内容还包含目前可用的工具列表,如天气查询工具、计算器工具)
  2. 大模型分析->生成工具调用指令
  3. 平台执行调用->平台获取结果->平台返回调用结果至大模型
  4. 大模型整理结果->自然语言输出

角色分工

角色职责
用户输入问题/指令
大模型1.选择工具、生成调用参数,2.归纳总结工具执行结果
工具执行具体功能(如查询天气)
平台(Agent)串联流程:转发信息、执行工具调用(传话筒角色,因为用户、大模型和工具无法直接对话)

六、工具调用:MCP

  • 全称:Model Context Protocol(模型上下文协议)
  • 本质:统一的工具接入规范,解决不同平台接入规范不一致的问题(比如:OpenAI、Anthropic、Google三个平台各自有接入规范,需要写多个接入规范,只想弄一个统一的技术规范标准)
  • 价值:工具开发者只需按MCP规范开发一次,即可在所有支持MCP的平台使用(类比手机都统一用Type-C充电口)

七、自主决策系统:Agent

  • 定义:能够自主规划、自主调用工具,持续工作直至完成用户任务的系统
  • 核心能力:多步骤推理、工具选择、流程控制
  • 代表产品:Claude Code、Codex、Gemini CLI等
  • 典型构建模式:React、Plan and Execute等

八、任务定制:Agent Skill

核心能力

  • 定义:给Agent的说明文档,包含任务规则、执行步骤、输出格式等
  • 结构
    –元数据层:name(名称)、description(描述)
    –指令层:目标、执行步骤、判断规则、输出格式、示例

技术实现

  • 存储形式:Markdown文档(文档必须为"SKILL.md")
  • 存放位置:特定目录(如Claude Code找到用户目录的".claude/skills"文件夹)
  • 加载机制:仅在用户问题与技能名称/描述相关时加载完整指令

九、概念体系回顾

核心引擎 => 数据单位 => 记忆空间 => 交互接口 => 外部能力 => 工具标准 => 决策系统 => 任务定制

  • LLM:大模型
  • Token:大模型处理数据的最基本单元
  • Context:大模型每次处理任务时接收到的信息总和
  • Context Window:大模型的Context最多能够存储的Token量
  • Prompt(User/System):用户或系统当前给大模型下达的具体指令或问题
  • Tool:大模型用来感知和影响外部环境的函数
  • MCP:统一了工具接入格式的标准协议
  • Agent:能自主规划和调用工具、直至解决用户问题的程序
  • Agent Skill:给Agent看的说明文档

十、补充细节

  • Transformer架构:虽由Google提出,但由OpenAI通过GPT系统引爆
  • Token切分原理:基于BPE(字节对编码)算法,模型自主学习的文本切分规则
  • Agent Skill高级特性:支持允许代码、引用资源,采用渐进式披露机制节省Token
  • RAG技术:通过检索相关片段而非全文,有效解决Context Window限制问题

视频指路:https://www.bilibili.com/video/BV1E7wtzaEdq/?spm_id_from=333.337.search-card.all.click&vd_source=f50ab1a8c52791f592580e80a16e5536

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询