Floatboat Harness 评测:DeepSeek V4 Flash 五项超越 Claude Opus 4.8
同一模型换个 Harness 就从全输变全胜,说明 Agent 的能力上限由模型之外的系统决定。
Harness(模型外部的智能体运行系统,负责工具、状态与循环收敛)能带来多大提升?Floatboat 用同一款最便宜模型做单变量实验:接入官方 Harness 时对 Claude Opus 4.8 一项未赢,接入自家 Harness 后五项全胜,成本仅为对手的 1/57。任务越长程,增益越大,最高达 23.6%。
正文摘录
.jpg) 在很多人的印象里,AOE Tech Labs 是一家以产品创新见长的公司。 2026 年 1 月,Floatboat 客户端把文件管理器、编辑器和浏览器直接做成 Agent 的运行环境,开创了 Agent 桌面工作台这一形态;4 月,FloatIM 把人与 Agent、Agent 与 Agent 接成一张办公网络,任务可以跨人、跨 Agent 交接而上下文不断;5 月,FloatSchedule 让 Agent 不必等人下指令,按日程自己开工。三次发布,三个此前市面上没有的东西,全部围绕真实办公场景。 但这三件事没有一件是界面创新。 外界看到的是产品形态,每一次底下动的都是 Harness。 8 月 7 日,他们把这层底座直接摆上了榜单 —— Floatboat Harness 在五项第三方基准上的完整评测数据。底座用的是市面上可能最便宜的模型 DeepSeek V4 Flash,成绩超过了一众海外顶尖模型。 前面三次,这层技术是以产品形态交付的;这一次,它自己上场接受计量。 - 完整报告链接:https://floatboat.ai/news/harness-benchmark 这件事之所以值得单独看,是因为它填的是行业里一块公认重要、却长期没人报数的空白。 大家早就承认那个等式: Model + Harness = Agent 。 加号左半边被反复计量,每次模型发布都附一张榜单。加号右半边 —— 模型之外的那半个系统,包括模型能碰到什么、每一轮循环怎么收敛、工具返回什么、状态存在哪里 —— 从来没有一把尺子。 这份数据要回答的,就是右半边到底值多少分。