OpenBitFun DeepSWE 评测解读:64.6% 通过率背后的工程化秘密
【免费下载链接】OpenBitFunOpenBitFun combines a high-performance agent runtime written in Rust with a polished desktop application. It pairs the depth of a Code Agent with open, general-purpose capabilities for work beyond software development.项目地址: https://gitcode.com/gh_mirrors/bit/OpenBitFun
OpenBitFun 是一款用 Rust 打造高性能 Agent Runtime 的开源 AI Agent 工作台。在DeepSWE v1.1 评测中,它搭配 GLM-5.3-Flash 拿下64.6% 通过率,成为对比组中的最高分。这个分数是怎么来的?这篇文章带你用 5 分钟看懂这份评测数据,以及它背后真正的工程化秘密 🛠️
一、先看数据:DeepSWE v1.1 评测到底比什么?
DeepSWE 是一套面向真实软件工程任务的 Agent 基准评测:把完整的问题仓库交给 Agent,看它能否独立完成修复并通过测试。它比两个硬指标——
- 通过率(Pass Rate):任务最终完成的比例,越高越好
- 耗时 P50(Runtime):一半任务完成所需的中位时间,越短越好
- Token P50:中位 Token 消耗,反映资源效率
OpenBitFun 在 README 中公布的完整对比数据如下:
| 方案 | 模型 | 通过率 | 耗时 P50 | Token P50 |
|---|---|---|---|---|
| OpenBitFun | GLM-5.3-Flash | 64.6%🏆 | 42.9 min | 13.05M |
| OpenBitFun | DeepSeek-V4-Flash | 56.6% | 19.6 min | 18.54M |
| PI | GLM-5.3-Flash | 61.9% | 50.7 min | 9.15M |
| OpenCode | GLM-5.3-Flash | 57.5% | 48.3 min | 9.58M |
| DeepSeek Harness · Minimal | DeepSeek-V4-Flash | 53.1% | 25.4 min | 12.87M |
| DeepSeek Harness · Standard | DeepSeek-V4-Flash | 49.6% | 24.9 min | 21.32M |
三个关键结论:
- 同一模型下 OpenBitFun 领先:GLM-5.3-Flash 在 OpenBitFun 上 64.6%,比 PI(61.9%)和 OpenCode(57.5%)都高——差距来自 Harness 工程,而非模型。
- 模型可自由切换:换用 DeepSeek-V4-Flash,耗时直接降到 19.6 分钟,适合追求速度的场景。
- Token 消耗受控:13M 的 Token P50 在通过率和成本之间取得了不错的平衡。
二、秘密一:Rust 编写的 Agent Runtime 是地基
64.6% 的底气,首先来自底座。OpenBitFun 的Agent Runtime 用 Rust 编写,专门承载三件事:
- 会话状态管理:持久会话、中断恢复,长任务被网络波动打断后能接着跑,而不是从头再来
- 上下文管理:长程任务中持续压缩、整理上下文,避免"越跑越乱"
- 工具执行:终端、文件、代码编辑等工具在受控策略下稳定执行
对新手来说这意味着什么?跑一个需要几小时的复杂任务时,中途断线、崩溃的代价被 Runtime 兜住了。详细设计可参考 Agent Runtime 服务设计 和 Agent Runtime 部署模型。
三、秘密二:四种 Agent Harness 模式,按任务"换挡"
同样是解题,"直接冲"和"深思熟虑"的策略完全不同。OpenBitFun 提供了四种 Agent Harness 模式,由用户按任务复杂度选择:
| 模式 | 适合场景 | 执行策略 |
|---|---|---|
| 极简 Minimal | 目标明确、快速动手 | 直接执行,边做边反馈 |
| 标准 Standard | 多步骤日常任务 | 有序规划、逐步执行、检查结果 |
| 极致 Ultimate | 高难度复杂任务 | 拆解任务、多 Agent 分工协作、整合结果 |
| 创造 Creative | 定制应用与扩展 | 创建 Mini App,定制工作台 |
面对 DeepSWE 这类高难度任务,极致模式的多 Agent 分工与结果整合正是通过率的关键推手:一个 Agent 负责规划、其他 Agent 并行处理子问题,最后统一验证。
四种模式的规范标识定义在 Harness 身份契约 中,并通过生成脚本同步为 Rust 与 TypeScript 类型——同一套行为,桌面、CLI、远程全平台一致,这正是评测成绩可复现的前提。产品层面的完整说明见 产品架构文档。
四、秘密三:上下文压缩 + 缓存复用,把成本压下来
评测里被忽视的指标是Token P50。Agent 在长任务中反复请求模型,若每次都全量重发历史上下文,Token 消耗会指数级膨胀,又慢又贵。
OpenBitFun 针对这一点做了两项工程:
- 缓存友好的消息结构:让消息组织方式最大化命中模型的 Prompt Cache,重复前缀不再重复付费
- 模型请求缓存复用:跨请求复用已计算的请求,减少无效往返
对应设计文档:缓存友好的消息结构、模型请求缓存复用。
这两项优化直接体现在图表中:OpenBitFun 的 Token P50 控制在 13M~18.5M 区间,比 DeepSeek Harness · Standard 的 21.32M 更低,通过率反而更高 8 个百分点。
五、不止于评测:这些能力日常就能用上
评测成绩不是孤立的数字,它对应的能力你在日常工作中都能直接受益:
- 黑灯工厂模式:白天布置任务,让它在服务器上持续推进,第二天回来验收成果(设计见 分离任务派发)
- 多设备接续:电脑上深度工作,手机上继续对话,浏览器里处理授权,任务不中断
- 可观测性(DFX):诊断、Tracing、指标与审计全程可查,任务卡住时能快速定位原因
总结
回看这组 DeepSWE v1.1 评测数据,OpenBitFun 64.6% 的通过率并非某个单点的胜利,而是三层工程能力的叠加:
- Rust Agent Runtime保证长任务跑得稳、断了能恢复
- 四种 Harness 模式让执行策略匹配任务难度
- 上下文压缩与缓存复用让 Token 成本始终可控
对新手来说,这份评测的价值在于它给出了一个实用信号:选 Agent 工具时,Harness 的工程化程度,往往和选哪个模型一样重要📊
想深入源码?可以克隆仓库后从 README 的架构章节和 docs/architecture/ 目录开始,逐层拆解这套 Runtime 的实现。
【免费下载链接】OpenBitFunOpenBitFun combines a high-performance agent runtime written in Rust with a polished desktop application. It pairs the depth of a Code Agent with open, general-purpose capabilities for work beyond software development.项目地址: https://gitcode.com/gh_mirrors/bit/OpenBitFun
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考