Agent harness 的本职就是把任务做完。衡量它的标准只有一条:完成了多少,花了多少。我们公开每一次运行:同一个模型,同一个官方验证器,逐任务的完整记录。
这个站点今天能证明两件事:在同一个模型上,Maka 比其他 harness 究竟表现如何;以及 Runtime 工作时到底记下了什么。
在 DeepSeek V4 Flash 上跑完 Terminal-Bench 2.1 全部任务,由官方验证器统一判分。排名只描述结果,逐任务 CSV 随报告一并公开。
查看评测报告Desktop、TUI、CLI 和 Eval 都是瘦客户端,执行统一交给同一个 Runtime Host。
了解 Host 如何工作每条消息、每次工具调用、每个权限决定和每次终止,都是一条只追加的 RuntimeEvent。界面、下一轮 prompt 和崩溃恢复都从这份日志推导出来,日志之外没有第二份权威副本。
Log Is the Runtime三条路径,边界分明。
首页的每一条结论和数字,都能追溯到对应的完整报告或文档。