一个高性能的 Agent 工作台,并完整记录它做过的每一件事。

Agent harness 的本职就是把任务做完。衡量它的标准只有一条:完成了多少,花了多少。我们公开每一次运行:同一个模型,同一个官方验证器,逐任务的完整记录。

Nightly 是开发者构建,不是 ASF release · 阅读架构文档

只认实测数据,只信落盘记录。

这个站点今天能证明两件事:在同一个模型上,Maka 比其他 harness 究竟表现如何;以及 Runtime 工作时到底记下了什么。

9 个 harness,同一个模型,官方验证器

在 DeepSeek V4 Flash 上跑完 Terminal-Bench 2.1 全部任务,由官方验证器统一判分。排名只描述结果,逐任务 CSV 随报告一并公开。

查看评测报告
1Codex
82.0%
2Maka
77.5%
3Pi
74.2%
4DSH
73.0%
5ZCode
70.8%
6Reasonix
67.4%
7OpenCode
65.2%
8Kimi Code
59.6%
9Claude Code
55.1%
pass@1 · reasoning max · Maka 单次通过成本 $0.026

同一套任务,正面对比

与 OpenCode 在同一批任务上做配对单次运行。差距经得起精确 McNemar 检验,每个通过任务的成本持平。

查看对比报告
+13.5pp · 68.5% 对 55.1%

只有一个 Runtime Host

Desktop、TUI、CLI 和 Eval 都是瘦客户端,执行统一交给同一个 Runtime Host。

了解 Host 如何工作
DesktopTUI / CLIEval
Runtime Host掌控执行

日志即运行时

每条消息、每次工具调用、每个权限决定和每次终止,都是一条只追加的 RuntimeEvent。界面、下一轮 prompt 和崩溃恢复都从这份日志推导出来,日志之外没有第二份权威副本。

Log Is the Runtime
TextFunctionCallpermissionRequestpermissionDecisionFunctionResponseFunctionCallendInvocation

报告与文章

首页的每一条结论和数字,都能追溯到对应的完整报告或文档。