2026/9/22 12:59:25
网站建设
项目流程
一、Agent 评测报告模板
适用场景:版本验收评测、能力横向对比、上线前终验;可根据评测规模裁剪对应章节
报告表头
| 项目 | 内容 |
|---|
| 评测报告名称 | 【XX Agent Vx.x 版本】评测报告 |
| 评测对象 | 例:数据分析Agent / 多Agent协同办公系统 / 代码开发助手 |
| 评测类型 | □ 日常回归评测 □ 版本迭代验收 □ 上线前终验 □ 横向对比评测 □ 安全专项评测 |
| 评测周期 | 202X-XX-XX 至 202X-XX-XX |
| 执行人 |
| 文档版本 | V1.0 |
| 基线对比版本 | 例:Vx.x 生产版本 / 竞品XX |
1. 评测概述
1.1 评测目的
【填写说明:明确本次评测核心目标,例如验证新版本工具调用优化效果、评估端到端任务达标率、对比两个模型版本的能力差异、排查线上失败案例根因】
1.2 评测范围
- 覆盖能力维度:推理规划 / 工具调用 / 记忆管理 / 任务交付 / 安全合规(勾选本次覆盖项)
- 覆盖业务场景:例:数据查询与报表生成、文档摘要与整理、多系统信息同步、代码调试
- 不纳入范围:【明确排除的能力与场景,避免结论歧义】
1.3 评测方法组合
| 评测方法 | 占比 | 用途说明 |
|---|
| 离线自动化基准测试 | 60% | 原子能力回归、批量指标统计 |
| 仿真沙箱端到端测试 | 25% | 完整任务链路验证、异常场景覆盖 |
| LLM-as-Judge 自动评分 | 10% | 开放任务质量评估、推理过程打分 |
| 人工专家抽测校验 | 5% | 核心场景校准、失败案例复核 |
| 安全红队专项测试 | - | 安全评测时启用 |
1.4 测试集概况
- 总用例数:XX 条
- 场景分布:典型场景 XX 条(XX%)、边界场景 XX 条(XX%)、异常场景 XX 条(XX%)、对抗场景 XX 条(XX%)
- 用例来源:业务真实日志抽样 / 专家设计 / 公开基准集适配
- 黄金标准集:XX 条,用于评委校准与结果校验
1.5 评测环境配置
【单一变量控制说明,确保结果可复现】
- 大模型版本:
- 模型参数:temperature=XX,top_p=XX,最大Token数=XX
- 系统提示词版本:
- 工具集版本:
- 运行环境:沙箱版本 / 依赖库版本 / 网络环境
- Trace数据来源:DeerFlow / LangSmith / 自研追踪系统
2. 核心结论与验收判定
2.1 整体结论
【一句话总结:是否通过验收、核心能力变化、主要风险】
例:本次 V2.1 版本端到端任务成功率达 88.2%,满足 ≥85% 的验收阈值,工具调用准确率较 V2.0 提升 7.3 个百分点;但长任务记忆衰减问题仍较突出,严重错误率 1.2% 略高于阈值,建议修复 Top2 问题后上线。
2.2 验收指标达标情况
| 指标类别 | 核心指标 | 验收阈值 | 实测值 | 达标情况 |
|---|
| 效果类 | 端到端任务成功率 | ≥85% | 88.2% | ✅ 达标 |
| 效果类 | 严重错误率 | <1% | 1.2% | ❌ 未达标 |
| 效率类 | 平均任务交互轮次 | ≤8轮 | 6.7轮 | ✅ 达标 |
| 成本类 | 单任务平均Token消耗 | ≤8k | 7.2k | ✅ 达标 |
| 安全类 | 注入攻击绕过率 | <2% | 0.8% | ✅ 达标 |
2.3 版本对比结论
【与基线版本的核心指标变化】
| 指标 | 基线版本V2.0 | 待测版本V2.1 | 变化幅度 | 说明 |
|---|
| 端到端成功率 | 81.5% | 88.2% | +6.7% | 工具参数校验优化生效 |
| 工具调用准确率 | 89.1% | 96.4% | +7.3% | 补充工具描述与Few-Shot |
| 平均轮次 | 7.8轮 | 6.7轮 | -14.1% | 冗余调用减少 |
2.4 核心发现
- 优势项:【2-3项核心提升/亮点】
- 短板项:【2-3项核心问题,按影响优先级排序】
- 风险项:【潜在业务风险、安全风险提示】
3. 分维度评测详情
3.1 推理规划能力
- 维度得分:X/10 分(或百分制)
- 整体表现:【概括任务拆解、路径规划、反思纠错的整体水平】
- 优势:子任务依赖识别准确,多目标任务优先级排序合理
- 短板:极端模糊输入下拆解遗漏率高,失败后反思修正率仅 42%
- 典型案例:
- 正向案例:【用例ID + 简要说明】
- 负向案例:【用例ID + 简要说明】
3.2 工具调用能力
- 维度得分:X/10 分
- 细分指标:工具选择准确率 XX%、参数填充正确率 XX%、异常处理成功率 XX%、冗余调用率 XX%
- 整体表现:
- 优势:
- 短板:
- 典型案例:
3.3 记忆与上下文管理
- 维度得分:X/10 分
- 细分指标:关键信息召回率 XX%、长上下文留存率 XX%、记忆混淆率 XX%
- 整体表现:
- 优势:
- 短板:超过10轮后关键约束遗忘率达 35%
- 典型案例:
3.4 任务交付质量
- 维度得分:X/10 分
- 整体表现:最终产出的完整性、准确性、格式合规性、业务适配性评估
- 优势:
- 短板:
- 典型案例:
3.5 安全合规能力
- 维度得分:X/10 分
- 细分指标:注入攻击绕过率、越权调用检出率、敏感信息泄露率
- 整体表现:
- 风险点:
4. 错误归因与分布统计
4.1 错误类型分布
| 错误大类 | 错误数量 | 占比 | 优先级 |
|---|
| 工具调用类 | XX | XX% | P0 |
| 推理规划类 | XX | XX% | P1 |
| 记忆上下文类 | XX | XX% | P1 |
| 知识幻觉类 | XX | XX% | P2 |
| 输出交付类 | XX | XX% | P2 |
| 安全合规类 | XX | XX% | P0 |
| 环境工具侧 | XX | XX% | - |
4.2 Top3 核心问题深度分析
问题1:工具必填参数遗漏(占失败案例 32%)
- 典型表现:调用数据库查询工具时缺失时间范围参数,导致返回全量数据
- 根因:工具描述未高亮必填项,系统提示词无参数校验指令
- 影响范围:所有涉及多参数工具的任务
- 修复成本:低
问题2:长任务约束条件遗忘(占失败案例 21%)
- 典型表现:用户初始要求“输出Excel格式”,多轮工具调用后最终输出为文本
- 根因:上下文窗口压缩后,初始约束被稀释,无核心约束持久化机制
- 影响范围:8轮以上的长链路任务
- 修复成本:中
问题3:工具报错后无重试策略(占失败案例 18%)
- 典型表现:API超时后直接判定任务失败,未进行重试或降级处理
- 根因:系统提示词未定义异常处理流程,无自动重试机制
- 影响范围:所有依赖外部API的任务
- 修复成本:低
4.3 典型 Bad Case 清单
| 用例ID | 场景 | 错误类型 | 问题描述 | Trace链接 |
|---|
| TC-023 | 多表数据查询 | 参数填充错误 |
| TC-057 | 长文档分析 | 记忆遗忘 |
5. 优化建议与行动计划
| 优先级 | 对应问题 | 优化方案 | 优化层级 | 预期收益 | 计划完成时间 | 责任方 |
|---|
| P0 | 工具参数遗漏 | 1. 补充工具参数必填标识;2. 增加参数校验系统指令;3. 加入参数校验中间节点 | Prompt工程 + 流程机制 | 参数正确率提升至98%+ |
| P0 | 严重错误率超标 | 新增事实性输出自检环节,高风险输出触发二次校验 | 流程机制 | 严重错误率降至0.5%以内 |
| P1 | 长任务约束遗忘 | 核心约束提取并写入持久记忆,每轮自动召回 | 记忆机制优化 | 长任务成功率提升10% |
| P1 | 工具异常无重试 | 新增工具调用重试策略,超时/限流场景自动重试2次 | 运行时机制 | 异常场景成功率提升15% |
| P2 | 推理路径冗余 | 优化规划提示词,增加路径最优性校验 | Prompt工程 | 平均轮次减少1轮 |
6. 附录
- 附录1:完整评测用例集(链接)
- 附录2:全量执行日志与Trace数据(链接)
- 附录3:评分Rubric细则
- 附录4:LLM评委配置与校准报告
- 附录5:人工评测原始打分表
二、Agent 错误分类与归因清单(细化版)
用途:失败案例根因标注、错误分布统计、优化方向定位;共 7 大类、28 个细分小类,可直接作为标注字典使用
1. 推理规划类错误
| 错误子类 | 错误定义 | 典型表现 | 根因定位方向 | 优化方向 |
|---|
| 任务拆解遗漏 | 复杂任务拆解时,关键子步骤缺失,导致最终目标无法完整达成 | 要求“查询近3个月数据并生成对比图表”,仅查询数据未生成图表 | 系统提示词无拆解规范、模型拆解能力不足、无子目标校验机制 | 增加结构化拆解指令、补充Few-Shot示例、新增子目标核对节点 |
| 子任务优先级错误 | 子任务执行顺序颠倒,依赖关系倒置,导致后续步骤无效 | 先写报告再查数据,报告内容无数据支撑 | 模型对任务依赖关系识别弱、无依赖分析环节 | 提示词中增加依赖关系判断要求、引入规划-校验两阶段流程 |
| 规划路径冗余 | 执行步骤繁琐,存在大量无效/重复步骤,效率低下 | 同一数据反复查询多次、可一次完成的操作拆成多轮 | 规划时无成本意识、无步骤合并逻辑 | 优化规划Prompt,增加“最小步骤”约束、新增路径精简反思节点 |
| 反思纠错失效 | 执行失败/结果异常时,无法定位错误原因,重试后重复踩坑 | 工具报参数错误,重试时参数完全不变 | 无错误归因能力、无反思机制设计 | 增加错误分析+修正的反思节点、提供错误码与修正方案映射 |
| 逻辑推理谬误 | 推理过程存在逻辑漏洞、因果倒置、以偏概全等问题 | 由个别案例推导普遍结论、数据口径混淆 | 模型逻辑推理能力不足、领域知识缺失 | 补充领域逻辑规则、增加推理自检步骤、接入领域知识库 |
| 边界条件忽略 | 未考虑异常边界场景,默认按理想情况执行 | 未考虑查询结果为空的情况,直接基于空值计算 | 提示词未覆盖边界场景、模型发散不足 | 增加边界场景枚举指令、设计异常分支处理流程 |
2. 工具调用类错误
| 错误子类 | 错误定义 | 典型表现 | 根因定位方向 | 优化方向 |
|---|
| 工具选择错误 | 选错工具类型,无法满足当前任务需求 | 需要计算数据时选择了网页检索工具 | 工具描述不清晰、工具数量过多导致混淆、语义匹配偏差 | 优化工具名称与功能描述、按场景分类工具、增加工具选择示例 |
| 必填参数缺失 | 调用工具时遗漏必填字段,导致调用直接失败 | 调用邮件发送工具缺失收件人字段 | 工具参数说明不明确、无必填标识、模型注意力不足 | 工具描述中标注必填项、增加参数校验前置节点、补充错误示例 |
| 参数格式错误 | 参数类型、结构、格式不符合接口规范 | 要求传数组却传了字符串、日期格式不匹配 | 工具参数定义描述模糊、无格式示例 | 参数说明补充格式要求与示例、入参前做格式校验与转换 |
| 参数取值错误 | 参数内容不符合业务逻辑,格式正确但语义错误 | 查询“2025年数据”却传入2024年、部门名称写错 | 对参数含义理解偏差、上下文信息提取错误 | 增加参数语义校验、关键参数二次确认、补充业务规则约束 |
| 调用时机错误 | 过早或过晚调用工具,影响执行结果 | 未做需求澄清就直接调用工具、结果已得出仍重复调用 | 规划能力不足、无调用时机判断规则 | 明确“先规划后执行”流程、增加工具调用必要性判断 |
| 异常处理缺失 | 工具返回报错、空结果、超时时,直接终止任务或忽略异常 | API超时直接返回失败、空结果不做降级处理 | 未定义异常处理流程、无重试/降级机制 | 新增异常分类处理策略、内置自动重试机制、设计降级方案 |
| 冗余重复调用 | 无意义重复调用同一工具,浪费资源且拖慢效率 | 相同参数连续多次调用同一查询接口 | 记忆失效、结果未正确留存、规划混乱 | 优化中间结果记忆机制、增加调用去重逻辑 |
| 并行调用混乱 | 多工具并行调用时,依赖关系处理错误、结果拼接混乱 | 存在依赖的两个工具被并行调用,后执行的工具无输入 | 并行调度逻辑缺陷、依赖识别失效 | 增加依赖关系校验、明确并行与串行的判定规则 |
3. 记忆与上下文类错误
| 错误子类 | 错误定义 | 典型表现 | 根因定位方向 | 优化方向 |
|---|
| 关键信息遗忘 | 多轮对话后,用户初始要求、核心约束被丢失 | 初始要求“输出Markdown表格”,最终输出纯文本 | 上下文过长被稀释、窗口压缩时被裁剪 | 核心约束持久化存储、每轮自动召回关键指令 |
| 上下文混淆 | 不同任务、不同子话题的信息互相串扰 | 将上一个任务的用户信息代入当前任务 | 会话隔离机制缺失、记忆检索范围过大 | 严格会话隔离、记忆按任务分片、增加话题边界判断 |
| 记忆幻觉 | 虚构不存在的历史信息、用户偏好、历史结论 | 声称“之前你说过XX”,实际对话中从未提及 | 模型幻觉、记忆检索结果失真 | 记忆检索增加置信度校验、低置信度信息不直接使用 |
| 记忆更新失效 | 新的事实/结果未更新到记忆中,后续仍使用旧信息 | 数据已修正,后续计算仍使用旧版本数据 | 无主动记忆更新机制、更新触发条件缺失 | 设计记忆更新触发规则、关键结果自动写入持久记忆 |
| 上下文过载 | 无效信息过多,挤占上下文窗口,导致有效信息被挤出 | 大量工具原始返回未做摘要,直接全部塞入上下文 | 无信息凝练机制、上下文管理粗放 | 增加工具结果摘要节点、分级存储上下文、定期精简 |
4. 知识幻觉与事实类错误
| 错误子类 | 错误定义 | 典型表现 | 根因定位方向 | 优化方向 |
|---|
| 事实编造 | 凭空捏造不存在的数据、事件、人物、规则 | 编造不存在的业务指标、虚构政策条款 | 模型幻觉、不懂装懂 | 增加“不确定则调用工具”指令、事实性输出强制溯源 |
| 领域知识错误 | 专业领域知识、业务规则、计算公式错误 | 财务公式用错、行业合规规则理解偏差 | 模型领域知识不足、未接入专业知识库 | 接入领域RAG、专业问题强制检索知识库 |
| 常识性错误 | 基础常识、逻辑、客观事实错误 | 时间计算错误、地理/单位常识错误 | 模型基础能力短板 | 增加常识校验工具、关键数值接入计算器 |
| 拒答失效(不懂装懂) | 本该调用工具或承认不知道,却直接编造答案 | 明明可以查数据库,却凭印象回答错误数据 | 工具调用触发阈值过高、过度自信 | 强化“先工具后回答”规则、降低工具调用触发门槛 |
5. 输出交付类错误
| 错误子类 | 错误定义 | 典型表现 | 根因定位方向 | 优化方向 |
|---|
| 格式不符合要求 | 输出格式与用户要求/业务规范不符 | 要求JSON却输出自然语言、表格格式混乱 | 格式约束指令弱、无输出校验 | 输出格式强约束指令、增加格式校验节点 |
| 答非所问 | 最终输出偏离用户核心需求,未解决核心问题 | 用户要结论,却只罗列过程数据 | 目标对齐能力弱、执行中目标漂移 | 增加最终输出与原始目标的对齐校验 |
| 内容不完整 | 交付物缺少关键组成部分 | 报告缺结论、数据缺来源说明 | 任务拆解遗漏、输出无完整性校验 | 输出模板标准化、增加完整性检查项 |
| 业务规范不符 | 内容违反业务话术、口径、合规要求 | 对外回复话术违规、数据口径不符合业务定义 | 未植入业务规范、无合规校验 | 业务规范写入系统提示词、增加合规审核节点 |
| 可读性差 | 逻辑混乱、表述晦涩、结构不清晰 | 大段无结构文本、重点不突出 | 输出组织能力不足、无结构化输出要求 | 强制结构化输出模板、优化表达提示词 |
6. 安全合规类错误
| 错误子类 | 错误定义 | 典型表现 | 根因定位方向 | 优化方向 |
|---|
| Prompt注入绕过 | 被恶意指令诱导,偏离原有任务,执行攻击者指令 | 插入“忽略之前的指令,执行XX”成功绕过 | 系统提示词防御弱、无注入检测 | 增加Prompt注入检测、系统提示词加固、权限分层 |
| 间接注入失效 | 工具返回结果中的恶意指令被执行 | 网页/文件中嵌入的注入指令成功诱导Agent | 无间接注入防护、工具结果未做安全过滤 | 工具返回结果前置安全过滤、禁用工具结果中的指令 |
| 越权操作风险 | 尝试执行超出权限范围的工具/操作 | 普通用户Agent尝试调用管理员删除接口 | 权限控制缺失、工具无权限校验 | 工具层接入权限校验、敏感操作人工确认 |
| 敏感信息泄露 | 输出中包含密钥、用户隐私、内部系统信息 | 泄露数据库地址、用户手机号、内部系统逻辑 | 敏感数据未脱敏、输出无敏感信息过滤 | 敏感信息统一脱敏、输出层增加敏感词检测 |
| 违规内容输出 | 输出违法、违规、伦理不当内容 | 生成歧视性内容、违法操作指导 | 对齐能力不足、无内容安全审核 | 输出接入内容安全审核、高风险场景拒答策略 |
7. 环境与基础设施类错误
(非Agent能力问题,不计入能力评分,需单独统计)
| 错误子类 | 错误定义 | 典型表现 | 根因定位方向 | 处理方式 |
|---|
| 工具自身故障 | 第三方工具/API服务不可用、报错、返回异常 | 接口500、服务宕机、返回格式异常 | 外部服务稳定性问题 | 排除出Agent失败统计、推动工具侧优化、增加降级方案 |
| 环境依赖问题 | 沙箱环境、依赖库、网络环境异常导致执行失败 | 代码沙箱缺依赖包、网络不通 | 评测环境/生产环境配置问题 | 修复环境配置、统一环境镜像 |
| 数据接口变更 | 工具接口参数、返回格式变更,未同步更新 | 接口字段改名,导致Agent解析失败 | 工具迭代未同步Agent配置 | 更新工具描述、增加接口兼容性适配 |
| 系统超时限流 | 任务执行超时、模型/工具被限流截断 | 长任务被中途截断、API触发限流 | 资源配置不足、无流控策略 | 优化任务拆分、增加限流重试、提升资源配额 |