昨天凌晨, Kimi K3 正式和大伙儿见面。
2.8T 参数,百万上下文信息……而且这玩意还开源,是全球第一个开源的 3T 级别大模型。
(几个月前,国内第一个把模型推到 1T 级别的 Kimi K2,也是月之暗面家的) 此前,有不少人在谈 Scaling Law 要失效了、大模型规模要见顶了。
但 K3 再次证明: 至少在当下,规模依然是能力,参数依然能转化为智能。
除了参数强得可怕,K3 在编程、长任务执行、自动化、网页检索和表格操作等 Agent 核心场景中,也表现出了非常稳定的第一梯队能力。
在下图中的 14 项测试里,K3 获得 5 项单独第一、1 项并列第二,并且在 12 项测试中进入前二。
只有 DeepSWE 和 GDPval-AA v2 两项排在第三,整体表现非常均衡。
所以,也难怪它一空降,即引起 AI 圈狂欢:目前已登顶 Arena 的前端代码能力竞技榜,大幅领先 Fable 5。
上架模型广场,1000 万+tokens 免费送!
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜