← 返回新闻列表
InfoQ AI 🗓️ 2026-08-14

DeepSeek + Pi 王炸组合跑赢 Claude Code?Pi创始人:这套组合我早押中了,这一消息引发行业关注

⚡ 一句话看懂:DeepSeek + Pi 王炸组合跑赢 Claude Code?Pi创始人:这套组合我早押中了,这一消息引发行业关注。来源:InfoQ AI。

8 月 11 日,Pi Harness 创始人 Mario Zechner 转发了一组数据:开发者 0xEvan 用 Pi 调用 DeepSeek V4 Flash,处理了近 10 亿输入 Token,缓存命中率达到 99.93%,最终只花了 2.65 美元。

如果没有缓存,同等用量预计需要 132 美元。

同一天,另一名开发者 Shantanu Goel 表示,DeepSeek V4 Flash 在其他 Harness 中的缓存命中率通常为 94%至 97%,到了 Pi 中却能持续达到 99%以上。

Mario 对此评论道:“使用本地模型时,这一点尤其好用。

” 社区里这种案例还有不少。

这也让人想起 Mario 今年 5 月对 Pi 与 DeepSeek V4 这一组合的评价:“pi + ds4 == sovereign AI enterprise ready clearly.”换成更符合中文语境的话,大概就是:“Pi + DeepSeek 4,企业级 AI 这不就成了吗。

” 当时,这只是他看到开发者用 Pi 搭配 DeepSeek V4 跑通一个终端俄罗斯方块后的一句调侃。

三个月后,一项公开横向测试,却意外给这句话补上了数据。

Pi 搭配 DeepSeek,跑赢了 Claude Code?

Composio 是一家为 AI 智能体开发工具的公司,最近进行了一项公开对比测试。

他们选用同一个模型 DeepSeek V4 Flash,让它分别运行在 8 种不同的智能体 Harness 中,完成 30 项高难度的智能体任务。

这些任务要求智能体采取行动、调用工具,并独立完成整个工作。

拿下第一名的是 Pi Agent:30 项任务通过 20 项,成功率达到 66.7%;Oh My Pi 通过 17 项,排名第二;Claude Code、Codex 和 Deep Agents 均通过 16 项;Prime Agent 通过 15 项,另有 6 次运行未被计分,其中 2 次因评分器处理超时而无法评分,另外 4 次没有留下记录;Hermes Agent 同样通过 15 项;OpenCode 通过 14 项,排名最后。

同一个模型,仅仅更换外面的 Harness,成功率便从 46.7%升至 66.7%,相差整整 20 个百分点。

成本差距更加明显。

Pi 平均完成一项成功任务只花费 0.028 美元,Claude Code 需要 0.195 美元,接近前者的 7 倍。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接