← 返回新闻列表
InfoQ AI 🗓️ 2026-08-21

深度解读:撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压 Fable 5”但无人能复现,Token开销反而翻倍

⚡ 一句话看懂:深度解读:撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压 Fable 5”但无人能复现,Token开销反而翻倍。来源:InfoQ AI。

最近,一个名为 J-Space Cognition Suite 的社区项目近日在 X 上快速传播。

项目方声称,在完全不修改 DeepSeek V4-Pro-0813 模型权重的情况下,仅通过一套推理时 Harness,就能显著提升模型在多项 Agent Benchmark 上的表现,甚至超过 Fable 5。

不过,这一看起来颇为惊人的结论目前仍缺少最关键的一环:第三方复现。

据 ExplainX 梳理,截至 8 月 18 日,J-Space Cognition Suite 公布的所有性能提升数据均来自项目方自己的测试,尚未有独立团队在相同条件下复现相关结果。

因此,“DeepSeek V4 Pro 已经借助 J-Space 击败 Fable 5”目前仍然只能被视为项目方及社区传播中的主张,而不是已经得到验证的事实。

更容易引发误解的是,J-Space Cognition Suite 与 Anthropic 此前公布的 J-space 研究并不是同一个东西。

前者是一套面向 DeepSeek V4 Pro 的第三方 Agent Harness,后者则是 Anthropic 对 Claude 模型内部神经表征展开的可解释性研究。

两者虽然名称相似,但技术对象和用途完全不同。

不改模型权重,靠 Harness 把 V4 Pro“榨干”?

J-Space Cognition Suite 是一个面向 DeepSeek V4-Pro-0813 的社区开源项目。

本质上,它并不是一个经过微调的新模型,也没有生成新的模型 checkpoint,而是在模型运行时外面增加一层 Harness,通过调整 Agent 的任务执行流程改善最终表现。

项目方认为,DeepSeek V4 Pro 在长时间 Agent 任务中存在两个主要问题:一是“表征漂移”,二是“过早停止”。

所谓表征漂移,可以理解为模型执行长链路任务时,随着步骤不断增加,当前工作状态逐渐偏离最初目标,具体表现可能包括忘记此前的重要上下文、重复已经完成的工作,以及在任务持续推进过程中逐渐“跑偏”等。

“过早停止”的定义则更加直接,即 Agent 实际上还没有完成任务,却提前认为工作已经结束。

例如在代码尚未完全修改、测试尚未完成或者仍存在错误的情况下,模型已经宣布任务完成并停止执行。

J-Space Cognition Suite 的核心思路并不是重新训练模型,而是在 Harness 层改善重试、验证、记忆、状态维护和停止条件等外围机制。

项目背后的假设是:DeepSeek V4 Pro 模型权重本身已经蕴含更强的能力,只是现有 Agent 运行框架没有充分释放这些能力。

从这一角度看,J-Space 提出的是当下越来越受 AI 开发者关注的问题:同一个模型,在不同 Harness 下,究竟能够表现出多大的能力差距?

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接