2026 年 8 月, Floatboat 公布了一份评测数据 :使用 DeepSeek-V4-Flash(混合价 $0.175/M)跑完五项基准,成绩全面超越贵 57.1 倍的 Claude Opus 4.8。
同一个模型,在 DeepSeek 官方 Harness 上一项未赢;接入 Floatboat Harness 后五项全胜。
增益随任务程长递增,短程任务仅 1.9%,长程 DeepSWE 达 23.6%。
这组数据第一次为“模型之外那半个系统”给出了定量答案。
但比分数更值得追问的是:一个 Harness 凭什么能做到又便宜又好?
Floatboat 团队的回答是:因为从一开始,他们的目标函数就不同。
这支团队的底色 ,来自十年安卓 OS 生态的产品交互与商业化经验,服务过数亿用户。
当大多数 AI 产品把 Agent 装进网页对话框时,而做了一个桌面客户端——把文件管理器、编辑器和浏览器直接做成 Agent 的运行环境。
背后的逻辑是:Web 端的 Agent 只能感知上传的文件和输入的 prompt,感知不到文件结构、操作历史、跨应用流转——那些沉淀在行为里的隐性知识。
而真实的工作流,是跨文件、跨应用、跨权限、持续数小时甚至数天的长程任务。
要承接这种复杂性,Agent 需要的不是一个对话框,而是一个完整的操作系统级入口。
这个起点直接决定了 Floatboat Harness 的设计哲学。
他们自研了完整的 Runtime、Agent Loop、Tools 和 Infra,以及一套名为 FloatSail 的自适应进化系统。
与主流 Harness 最大的不同在于:它不要求所有任务都经过 Agent。
“如果一件事用 Workflow 或普通桌面操作就能完成,根本不需要 Agent。
只有真正出现不确定性时,Agent 才介入。
”团队产品技术负责人 Remy 说。
这既是产品判断,也是经济判断——不让模型做它不需要做的事,是成本可控的前提。
“省”不是优化出来的,是被设计出来的。
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜