文章目录
- LangSmith 完全指南:LangChain 官方 AI 应用开发平台
- 什么是 LangSmith?
- LangSmith 能做什么?
- 一、Tracing(调用链追踪)
- Trace 的层级结构
- 二、Debugging(调试)
- 三、Evaluation(评估)
- 自动评分
- 四、Dataset(数据集)
- 五、Experiment(实验)
- 六、Prompt Management
- 七、Playground
- 八、Monitoring(线上监控)
- 九、Analytics(统计分析)
- LangSmith 的工作流程
- 与 LangChain 的关系
- 与传统可观测性工具的区别
- 一个简单的接入示例
- 使用 LangSmith 需要 API Key 吗?
- LangSmith 的优点
- LangSmith 的局限性
- 总结
LangSmith 完全指南:LangChain 官方 AI 应用开发平台
随着大语言模型(LLM)和 AI Agent 的普及,开发流程已经发生了很大的变化。
过去开发 Web 应用时,我们会使用:
- 日志(Logging)
- APM(Application Performance Monitoring)
- Debugger
- 单元测试
- 性能分析工具
而开发 AI 应用时,仅靠这些传统工具已经远远不够。
例如:
- 为什么 Agent 做出了这个决策?
- Prompt 是如何一步步变化的?
- Tool 为什么调用失败?
- RAG 检索到了哪些文档?
- LLM 消耗了多少 Token?
- 哪一步响应最慢?
- 两个 Prompt 哪个效果更好?
为了解决这些问题,LangChain 官方推出了 LangSmith。
它并不是一个 LLM,也不是一个 Agent 框架,而是一套专门用于AI 应用开发、调试、测试、评估和监控的平台。
什么是 LangSmith?
LangSmith 是 LangChain 官方推出的LLMOps(Large Language Model Operations)平台。
官方网站:
https://smith.langchain.com
它类似于 AI 应用领域的:
- Web 开发中的 Chrome DevTools
- 后端开发中的 Jaeger
- 微服务中的 Zipkin
- Kubernetes 中的 Grafana + Tempo
- 数据科学中的 MLflow(部分能力类似)
简单来说:
LangSmith 可以记录 AI 应用运行过程中发生的一切。
例如:
用户问题 │ ▼ Prompt Template │ ▼ Retriever(从知识库(向量数据库)中“找资料”,为大模型(LLM)提供回答问题的“参考上下文”) │ ▼ Vector Database │ ▼ LLM │ ▼ Tool │ ▼ Agent │ ▼ 最终回答整个调用链都会被记录下来。
LangSmith 能做什么?
官方主要提供以下几类能力:
LangSmith │ ├── Tracing(调用链追踪) ├── Debugging(调试) ├── Evaluation(评估) ├── Prompt Management(Prompt 管理) ├── Playground(在线测试) ├── Dataset(数据集) ├── Experiment(实验) ├── Monitoring(线上监控) └── Analytics(统计分析)下面分别介绍。
一、Tracing(调用链追踪)
这是 LangSmith 最核心的功能。
每一次 AI 调用都会形成一条 Trace。
例如:
User │ ▼ Agent │ ├── Planner │ ├── Search Tool │ │ │ │ ▼ │ Tavily(一个专为 AI 代理(AI Agents)和大型语言模型(LLMs)设计的搜索引擎 API) │ ├── Retriever │ │ ▼ │ Qdrant │ ├── LLM │ ▼ Answer点击任意节点,可以查看:
- 输入 Prompt
- 输出内容
- Tool 参数
- Token 数
- 延迟
- 是否报错
这对于排查复杂 Agent 非常重要。
Trace 的层级结构
LangSmith 使用树状结构记录调用。
例如:
Run ├── Chain │ ├── Prompt │ ├── LLM │ └── Parser ├── Tool │ ├── HTTP │ └── JSON Parser └── Retriever每个节点都可以展开查看。
相比传统日志:
print("start") print(prompt) print(response) print(tool)Trace 更容易理解整个调用流程。
二、Debugging(调试)
AI 开发最难调试。
例如:
为什么回答错误?
是 Prompt?
还是 Retriever?
还是 Tool?
还是模型?
LangSmith 可以查看:
Prompt ↓ LLM ↓ Tool ↓ Response每一步的数据。
例如:
Prompt 你是一名招聘专家... ----------------- Tool Input { "keyword":"Python" } ----------------- Tool Output 20 Jobs ----------------- LLM Output 推荐岗位如下...定位问题非常方便。
三、Evaluation(评估)
传统软件:
是否通过测试AI 软件:
回答质量如何?这就需要 Evaluation。
例如:
Question ↓ Model A ↓ Score ↓ Model B ↓ Score可以比较:
- GPT-4.1
- Claude
- Gemini
- DeepSeek
哪一个回答更好。
自动评分
LangSmith 支持:
- Accuracy
- Relevance
- Correctness
- Groundedness
- Toxicity
- Hallucination
也可以自定义评分器。
例如:
Question ↓ Answer ↓ Judge LLM ↓ Score这种方式称为LLM-as-a-Judge。
四、Dataset(数据集)
很多人会维护测试数据。
例如:
Question Expected AnswerLangSmith 可以管理这些 Dataset。
例如:
| Question | Expected |
|---|---|
| 北京首都是? | 北京 |
| 2+2=? | 4 |
以后每次修改 Prompt:
Prompt V1 ↓ Dataset ↓ Score ↓ Prompt V2立即知道是否退化。
五、Experiment(实验)
开发 Prompt 时:
Prompt A ↓ Dataset ↓ Evaluation然后:
Prompt B ↓ Dataset ↓ EvaluationLangSmith 会自动比较:
- 正确率
- Token
- Cost
- Latency
方便选择最佳方案。
六、Prompt Management
Prompt 往往越来越复杂。
例如:
System Prompt + Few-shot(在提示中嵌入少量(通常3-10个)输入-输出示例,引导模型捕捉任务模式。) + Variables + ExamplesLangSmith 提供 Prompt 管理能力。
支持:
- 版本管理
- 历史记录
- 回滚
- 在线修改
类似 Git 管理 Prompt。
七、Playground
Playground 是在线测试环境。
例如:
Prompt ↓ 修改 ↓ 运行 ↓ 观察结果不用重新部署程序。
非常适合 Prompt Engineering。
八、Monitoring(线上监控)
上线之后:
最重要的是:
AI 是否正常?LangSmith 提供:
- 请求数量
- Token
- Cost
- Error
- Latency
例如:
Today 12000 Requests Average Latency 1.2s Token 2M Errors 0.5%帮助快速发现线上问题。
九、Analytics(统计分析)
LangSmith 可以统计:
模型调用次数 ↓ Token ↓ 花费 ↓ 成功率 ↓ 响应时间例如:
Claude 45% GPT-4 35% Gemini 20%帮助分析成本和性能。
LangSmith 的工作流程
一个典型流程如下:
用户请求 │ ▼ Prompt │ ▼ Retriever │ ▼ Vector DB │ ▼ Tool │ ▼ LLM │ ▼ Output │ ▼ Trace │ ▼ Evaluation │ ▼ Experiment │ ▼ Deploy │ ▼ Monitoring可以看出,它贯穿了 AI 应用从开发到上线的整个生命周期。
与 LangChain 的关系
很多初学者容易混淆。
实际上:
LangChain │ ▼ 开发 AI Workflow LangGraph │ ▼ 开发 Agent LangSmith │ ▼ 开发、测试、调试、监控三者定位不同。
| 项目 | 作用 |
|---|---|
| LangChain | 构建 LLM 应用和工作流 |
| LangGraph | 构建具有状态和流程控制的 AI Agent |
| LangSmith | 调试、评估、测试、监控 AI 应用 |
可以理解为:
LangChain + LangGraph 负责 "写程序" LangSmith 负责 "观察程序"与传统可观测性工具的区别
很多开发者会问:
既然已经有 Grafana、Jaeger、OpenTelemetry,为什么还需要 LangSmith?
原因在于关注点不同。
| 工具 | 关注对象 |
|---|---|
| Grafana | CPU、内存、磁盘、网络等基础设施指标 |
| Prometheus | 指标采集与告警 |
| Jaeger / Tempo | 微服务请求链路 |
| OpenTelemetry | 通用应用可观测性数据采集标准 |
| LangSmith | LLM、Prompt、Agent、Tool、Retriever 等 AI 应用行为 |
举个例子:
Jaeger 可以告诉你:
HTTP 请求耗时 300 ms而 LangSmith 可以告诉你:
Prompt: 你是一名招聘专家…… ↓ 调用 GPT-4 ↓ 消耗 2,341 Tokens ↓ Retriever 返回了 8 篇文档 ↓ 第 3 篇文档与问题无关 ↓ 模型最终产生了幻觉回答这类 AI 语义级的信息,是传统 APM 无法直接提供的。因此,在生产环境中,LangSmith 常与 OpenTelemetry、Prometheus、Grafana 等工具配合使用,而不是相互替代。
一个简单的接入示例
安装:
pipinstalllangsmith langchain配置环境变量:
exportLANGSMITH_API_KEY="lsv2_pt_xxxxxxxxxxxxxxxxx"exportLANGSMITH_TRACING="true"exportLANGSMITH_PROJECT="my-agent"之后运行 LangChain 或 LangGraph 应用,符合支持条件的调用便会自动上传 Trace 到 LangSmith 平台,无需在业务代码中添加大量日志。
使用 LangSmith 需要 API Key 吗?
需要。
首次使用时,需要:
- 登录 LangSmith 官网。
- 创建 API Key。
- 配置
LANGSMITH_API_KEY环境变量。 - 开启
LANGSMITH_TRACING=true。
之后,应用运行时即可将 Trace 上传到 LangSmith。
对于仅在本地运行且不需要 Trace、评估或监控的简单程序,则可以不接入 LangSmith。
LangSmith 的优点
- 提供完整的 AI 调用链可视化。
- 支持 Prompt、Retriever、Tool、Agent 等 AI 组件的深度调试。
- 内置数据集、评估、实验管理,方便持续优化模型和 Prompt。
- 与 LangChain、LangGraph 集成紧密,也支持接入其他 LLM 框架。
- 提供线上监控和成本分析,适合生产环境使用。
LangSmith 的局限性
- 云平台功能需要注册账号并配置 API Key。
- 高级功能和大规模使用可能涉及付费。
- 对 LangChain 生态支持最完善,虽然支持开放标准,但其他框架的集成体验可能略逊一筹。
- 它关注的是 AI 应用本身,仍需要结合日志、监控和 APM 等传统工具,才能构建完整的生产可观测性体系。
总结
LangSmith 是 LangChain 官方推出的 AI 应用开发平台,它不仅仅是一个日志系统,而是一套覆盖开发、调试、测试、评估、实验、部署和监控全生命周期的 LLMOps 工具。
随着 AI Agent、RAG 和复杂工作流的普及,应用内部的推理路径、Prompt 演化、工具调用和检索过程越来越难以通过传统日志定位问题。LangSmith 通过可视化 Trace、自动评估、数据集管理和线上监控,帮助开发者快速发现问题、验证优化效果,并持续提升 AI 应用的稳定性和质量。
如果你正在使用LangChain或LangGraph开发 AI 应用,LangSmith 几乎已经成为官方推荐的配套工具;即使使用其他框架,只要希望提升 AI 系统的可观测性和迭代效率,LangSmith 也值得纳入你的技术栈。