智谱正在尝试把大模型推向一个更激进的阶段:让 AI 参与创造下一代 AI。
刚刚,智谱创始人、首席科学家唐杰以及 GLM 团队发布长文披露,GLM 已不再只是辅助工程师写代码,而是开始直接参与自身推理基础设施的建设与优化。
在 GLM-5.3-Flash 上线过程中,由 GLM-5.3 驱动的 Infra Agent 在超过 10 万张国产芯片组成的集群上完成模型适配、系统诊断和性能优化,不到两周将端到端吞吐提升至初始基线的 3 倍。
更重要的是,Agent 已能够根据测试、Trace、Benchmark 等“稠密反馈”自主提出假设、修改代码并验证结果,使模型开始优化承载自身运行的系统。
唐杰及 GLM 团队认为,这还不是完整意义上的递归自我改进(RSI),但已经出现了早期形态:AI 正从“帮助人类研发模型”,走向“参与构建自己的继任者”。
下面是分享全文,以飨读者。
在 GLM 的研发过程中,模型时常会涌现出一些令我们惊喜、甚至让我们感到不安的能力。
2025 年 10 月,我们开始启动安全能力增强研究。
当时的判断很朴素:安全能力是代码能力的自然延伸,能够读懂复杂代码的模型,理应也能够理解代码中的漏洞。
我们没有预料它此后的走向,不到一年,安全伙伴使用 GLM 在真实代码库中发现了数千个漏洞。
模型开始改变网络安全的格局,也带来了过去不曾存在的危险。
为了让这种能力能够被负责任地使用,我们不得不为它设计受信访问计划。
最近一次感到震动的时刻,来自一个更加根本的变化:GLM 开始越来越多地参与构建人工智能本身。
我们看到模型完成了一项过去需要一支资深 infra 团队数周才能完成的基础设施工作,并意识到这项工作将直接改变下一代模型的训练方式,我们更加确信:我们的继任者,正是我们亲手创造出来的 AI。
坦白说,在 GLM-4.7 之前,我们内部用 GLM 写代码多少带着被迫的成分,毕竟是自己的“亲儿子”。
那时,Coding 的 PMF 还未到来;今天,GLM-5.3 已经成为每个人每天离不开的 Coding 伙伴,正一步步走向取代我们。
如果这一趋势延续下去,给足算力、给足时间,它的终点是一个能够完全自主设计并训练出自己继任者的系统。
这被称为递归自我改进(Recursive Self-Improvement, RSI)。
尽管我们还没有走到那里,但它的早期形态已经出现。
这篇文章记录的,正是其中一个早期案例。
用稠密反馈驱动 Infra Agent 优化推理系统
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜