☰
OpenBitFun DeepSWE 评测解读:64.6% 通过率背后的工程化秘密
2026/10/5 2:29:14 网站建设 项目流程

OpenBitFun DeepSWE 评测解读:64.6% 通过率背后的工程化秘密

【免费下载链接】OpenBitFunOpenBitFun combines a high-performance agent runtime written in Rust with a polished desktop application. It pairs the depth of a Code Agent with open, general-purpose capabilities for work beyond software development.项目地址: https://gitcode.com/gh_mirrors/bit/OpenBitFun

OpenBitFun 是一款用 Rust 打造高性能 Agent Runtime 的开源 AI Agent 工作台。在DeepSWE v1.1 评测中,它搭配 GLM-5.3-Flash 拿下64.6% 通过率,成为对比组中的最高分。这个分数是怎么来的?这篇文章带你用 5 分钟看懂这份评测数据,以及它背后真正的工程化秘密 🛠️

一、先看数据:DeepSWE v1.1 评测到底比什么?

DeepSWE 是一套面向真实软件工程任务的 Agent 基准评测:把完整的问题仓库交给 Agent,看它能否独立完成修复并通过测试。它比两个硬指标——

  • 通过率(Pass Rate):任务最终完成的比例,越高越好
  • 耗时 P50(Runtime):一半任务完成所需的中位时间,越短越好
  • Token P50:中位 Token 消耗,反映资源效率

OpenBitFun 在 README 中公布的完整对比数据如下:

方案模型通过率耗时 P50Token P50
OpenBitFunGLM-5.3-Flash64.6%🏆42.9 min13.05M
OpenBitFunDeepSeek-V4-Flash56.6%19.6 min18.54M
PIGLM-5.3-Flash61.9%50.7 min9.15M
OpenCodeGLM-5.3-Flash57.5%48.3 min9.58M
DeepSeek Harness · MinimalDeepSeek-V4-Flash53.1%25.4 min12.87M
DeepSeek Harness · StandardDeepSeek-V4-Flash49.6%24.9 min21.32M

三个关键结论:

  1. 同一模型下 OpenBitFun 领先:GLM-5.3-Flash 在 OpenBitFun 上 64.6%,比 PI(61.9%)和 OpenCode(57.5%)都高——差距来自 Harness 工程,而非模型。
  2. 模型可自由切换:换用 DeepSeek-V4-Flash,耗时直接降到 19.6 分钟,适合追求速度的场景。
  3. Token 消耗受控:13M 的 Token P50 在通过率和成本之间取得了不错的平衡。

二、秘密一:Rust 编写的 Agent Runtime 是地基

64.6% 的底气,首先来自底座。OpenBitFun 的Agent Runtime 用 Rust 编写,专门承载三件事:

  • 会话状态管理:持久会话、中断恢复,长任务被网络波动打断后能接着跑,而不是从头再来
  • 上下文管理:长程任务中持续压缩、整理上下文,避免"越跑越乱"
  • 工具执行:终端、文件、代码编辑等工具在受控策略下稳定执行

对新手来说这意味着什么?跑一个需要几小时的复杂任务时,中途断线、崩溃的代价被 Runtime 兜住了。详细设计可参考 Agent Runtime 服务设计 和 Agent Runtime 部署模型。

三、秘密二:四种 Agent Harness 模式,按任务"换挡"

同样是解题,"直接冲"和"深思熟虑"的策略完全不同。OpenBitFun 提供了四种 Agent Harness 模式,由用户按任务复杂度选择:

模式适合场景执行策略
极简 Minimal目标明确、快速动手直接执行,边做边反馈
标准 Standard多步骤日常任务有序规划、逐步执行、检查结果
极致 Ultimate高难度复杂任务拆解任务、多 Agent 分工协作、整合结果
创造 Creative定制应用与扩展创建 Mini App,定制工作台

面对 DeepSWE 这类高难度任务,极致模式的多 Agent 分工与结果整合正是通过率的关键推手:一个 Agent 负责规划、其他 Agent 并行处理子问题,最后统一验证。

四种模式的规范标识定义在 Harness 身份契约 中,并通过生成脚本同步为 Rust 与 TypeScript 类型——同一套行为,桌面、CLI、远程全平台一致,这正是评测成绩可复现的前提。产品层面的完整说明见 产品架构文档。

四、秘密三:上下文压缩 + 缓存复用,把成本压下来

评测里被忽视的指标是Token P50。Agent 在长任务中反复请求模型,若每次都全量重发历史上下文,Token 消耗会指数级膨胀,又慢又贵。

OpenBitFun 针对这一点做了两项工程:

  • 缓存友好的消息结构:让消息组织方式最大化命中模型的 Prompt Cache,重复前缀不再重复付费
  • 模型请求缓存复用:跨请求复用已计算的请求,减少无效往返

对应设计文档:缓存友好的消息结构、模型请求缓存复用。

这两项优化直接体现在图表中:OpenBitFun 的 Token P50 控制在 13M~18.5M 区间,比 DeepSeek Harness · Standard 的 21.32M 更低,通过率反而更高 8 个百分点。

五、不止于评测:这些能力日常就能用上

评测成绩不是孤立的数字,它对应的能力你在日常工作中都能直接受益:

  • 黑灯工厂模式:白天布置任务,让它在服务器上持续推进,第二天回来验收成果(设计见 分离任务派发)
  • 多设备接续:电脑上深度工作,手机上继续对话,浏览器里处理授权,任务不中断
  • 可观测性(DFX):诊断、Tracing、指标与审计全程可查,任务卡住时能快速定位原因

总结

回看这组 DeepSWE v1.1 评测数据,OpenBitFun 64.6% 的通过率并非某个单点的胜利,而是三层工程能力的叠加:

  1. Rust Agent Runtime保证长任务跑得稳、断了能恢复
  2. 四种 Harness 模式让执行策略匹配任务难度
  3. 上下文压缩与缓存复用让 Token 成本始终可控

对新手来说,这份评测的价值在于它给出了一个实用信号:选 Agent 工具时,Harness 的工程化程度,往往和选哪个模型一样重要📊

想深入源码?可以克隆仓库后从 README 的架构章节和 docs/architecture/ 目录开始,逐层拆解这套 Runtime 的实现。

【免费下载链接】OpenBitFunOpenBitFun combines a high-performance agent runtime written in Rust with a polished desktop application. It pairs the depth of a Code Agent with open, general-purpose capabilities for work beyond software development.项目地址: https://gitcode.com/gh_mirrors/bit/OpenBitFun

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询