← 返回新闻列表
InfoQ AI 🗓️ 2026-07-30

最新动态:从GPT-2到Kimi K3:七年规模扩大2.26万倍,大模型架构主线是在建立一套“记忆操作系统”

⚡ 一句话看懂:最新动态:从GPT-2到Kimi K3:七年规模扩大2.26万倍,大模型架构主线是在建立一套“记忆操作系统”。来源:InfoQ AI。

摘要:从 GPT-2 到 Kimi K3,大模型技术演进路线展示了 AI 架构如何从“记住一切”,走向“选择性记忆”。

KV Cache 解决生成效率问题,Linear Attention 探索更高效的长期记忆,DeltaNet 和 Kimi Linear 则进一步让模型学会更新、遗忘和管理信息。

这篇文章将沿着七年的架构演进,解析大模型规模增长背后的技术变化,以及 Kimi K3 如何通过新的记忆机制突破传统 Transformer 的限制。

22580 个,这是 Kimi K3(2026)模型相当于多少个 GPT-2(2019)模型。

七年间,我们将模型规模扩大了 22,580 倍。

但这仅仅是……规模扩大吗?

在这篇工作日志中,我将回顾我们是如何走到今天这一步的,以及自那时以来,究竟发生了多少变化(或者说,变化有多小)。

我们将追溯促成 Kimi K3 诞生的主要架构发展历程。

GPT-2GPT-2 采用仅解码器(decoder-only)架构: tok_emb = self.transformer.wte(idx) pos_emb = self.transformer.wpe(pos) x = self .transformer. drop

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接