← 返回新闻列表
InfoQ AI 🗓️ 2026-08-26

535B 大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺,这一消息引发行业关注

⚡ 一句话看懂:535B 大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺,这一消息引发行业关注。来源:InfoQ AI。

当大多数模型公司还在围绕“是否开放权重”争论时,一个总参数达到 5350 亿的大模型,选择在训练尚未完成、甚至仍可能中途失败的时候,把训练曲线、数据配方、模型配置和技术讨论直接放到了网上。

近日,斯坦福大学计算机科学副教授、基础模型研究中心(CRFM)主任 Percy Liang 在 x 上发帖宣布,开放基础模型项目 Marin 已于上周启动 Marin 535B-A23B 的训练。

按照目前公布的计划,Marin 535B-A23B 将处理 18.75 万亿 Token,其中约 80%用于预训练,20% 用于中期训练;训练运行在 11 套 NVIDIA GB200 NVL72 系统上,预计持续约 3 个月,总计算量约为 2.7×1024 FLOPs,之后还将进入后训练阶段。

据 Marin 项目发起公告,项目最早诞生于斯坦福大学基础模型研究中心 CRFM,于 2025 年 5 月正式对外公布。

发起公告的作者包括 David Hall、Percy Liang,以及来自斯坦福、Open Athena 和开放社区的多位研究人员。

David Hall Percy Liang Percy Liang 曾就职于对话式 AI 公司 Semantic Machines,担任首席科学家。

该公司于 2018 年被微软收购,相关团队后来参与微软对话系统及语音助手技术建设。

此外,他也是大模型推理云和开源 AI 公司 Together AI 的联合创始人之一。

Together AI 的业务包括模型训练、推理基础设施和开放模型服务。

之所以要做 Marin 这个项目,是因为他们想探索 AI 领域的一个核心问题:在算力高度集中、训练配方越来越封闭的情况下,基础模型还能不能像开源软件一样被公开研究和共同建设?

此前,市面上的一些主要开放权重,比如 Llama、Gemma 等模型虽然也是开源的,但用于生成这些模型的代码和数据,也就是俗称的“配方”并未公开。

BLOOM、Pythia、OLMo、LLM 360 等项目则进一步开放了数据、代码、日志或中间检查点。

Marin 承认这些项目的先行贡献,但认为,开放模型仍然缺少一套类似软件开源的协作机制。

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接