← 返回新闻列表
InfoQ AI 🗓️ 2026-08-31

突发:自研Runtime、Agent Loop、Infra:一家通用Agent公司的全栈赌注

⚡ 一句话看懂:突发:自研Runtime、Agent Loop、Infra:一家通用Agent公司的全栈赌注。来源:InfoQ AI。

2026 年 8 月, Floatboat 公布了一份评测数据 :使用 DeepSeek-V4-Flash(混合价 $0.175/M)跑完五项基准,成绩全面超越贵 57.1 倍的 Claude Opus 4.8。

同一个模型,在 DeepSeek 官方 Harness 上一项未赢;接入 Floatboat Harness 后五项全胜。

增益随任务程长递增,短程任务仅 1.9%,长程 DeepSWE 达 23.6%。

这组数据第一次为“模型之外那半个系统”给出了定量答案。

但比分数更值得追问的是:一个 Harness 凭什么能做到又便宜又好?

Floatboat 团队的回答是:因为从一开始,他们的目标函数就不同。

这支团队的底色 ,来自十年安卓 OS 生态的产品交互与商业化经验,服务过数亿用户。

当大多数 AI 产品把 Agent 装进网页对话框时,而做了一个桌面客户端——把文件管理器、编辑器和浏览器直接做成 Agent 的运行环境。

背后的逻辑是:Web 端的 Agent 只能感知上传的文件和输入的 prompt,感知不到文件结构、操作历史、跨应用流转——那些沉淀在行为里的隐性知识。

而真实的工作流,是跨文件、跨应用、跨权限、持续数小时甚至数天的长程任务。

要承接这种复杂性,Agent 需要的不是一个对话框,而是一个完整的操作系统级入口。

这个起点直接决定了 Floatboat Harness 的设计哲学。

他们自研了完整的 Runtime、Agent Loop、Tools 和 Infra,以及一套名为 FloatSail 的自适应进化系统。

与主流 Harness 最大的不同在于:它不要求所有任务都经过 Agent。

“如果一件事用 Workflow 或普通桌面操作就能完成,根本不需要 Agent。

只有真正出现不确定性时,Agent 才介入。

”团队产品技术负责人 Remy 说。

这既是产品判断,也是经济判断——不让模型做它不需要做的事,是成本可控的前提。

“省”不是优化出来的,是被设计出来的。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接