最近,一个名为 J-Space Cognition Suite 的社区项目近日在 X 上快速传播。
项目方声称,在完全不修改 DeepSeek V4-Pro-0813 模型权重的情况下,仅通过一套推理时 Harness,就能显著提升模型在多项 Agent Benchmark 上的表现,甚至超过 Fable 5。
不过,这一看起来颇为惊人的结论目前仍缺少最关键的一环:第三方复现。
据 ExplainX 梳理,截至 8 月 18 日,J-Space Cognition Suite 公布的所有性能提升数据均来自项目方自己的测试,尚未有独立团队在相同条件下复现相关结果。
因此,“DeepSeek V4 Pro 已经借助 J-Space 击败 Fable 5”目前仍然只能被视为项目方及社区传播中的主张,而不是已经得到验证的事实。
更容易引发误解的是,J-Space Cognition Suite 与 Anthropic 此前公布的 J-space 研究并不是同一个东西。
前者是一套面向 DeepSeek V4 Pro 的第三方 Agent Harness,后者则是 Anthropic 对 Claude 模型内部神经表征展开的可解释性研究。
两者虽然名称相似,但技术对象和用途完全不同。
不改模型权重,靠 Harness 把 V4 Pro“榨干”?
J-Space Cognition Suite 是一个面向 DeepSeek V4-Pro-0813 的社区开源项目。
本质上,它并不是一个经过微调的新模型,也没有生成新的模型 checkpoint,而是在模型运行时外面增加一层 Harness,通过调整 Agent 的任务执行流程改善最终表现。
项目方认为,DeepSeek V4 Pro 在长时间 Agent 任务中存在两个主要问题:一是“表征漂移”,二是“过早停止”。
所谓表征漂移,可以理解为模型执行长链路任务时,随着步骤不断增加,当前工作状态逐渐偏离最初目标,具体表现可能包括忘记此前的重要上下文、重复已经完成的工作,以及在任务持续推进过程中逐渐“跑偏”等。
“过早停止”的定义则更加直接,即 Agent 实际上还没有完成任务,却提前认为工作已经结束。
例如在代码尚未完全修改、测试尚未完成或者仍存在错误的情况下,模型已经宣布任务完成并停止执行。
J-Space Cognition Suite 的核心思路并不是重新训练模型,而是在 Harness 层改善重试、验证、记忆、状态维护和停止条件等外围机制。
项目背后的假设是:DeepSeek V4 Pro 模型权重本身已经蕴含更强的能力,只是现有 Agent 运行框架没有充分释放这些能力。
从这一角度看,J-Space 提出的是当下越来越受 AI 开发者关注的问题:同一个模型,在不同 Harness 下,究竟能够表现出多大的能力差距?
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜