DeepSeek 今天发布了 DeepSeek-V4.1-Flash。
DeepSeek-V4.1-Flash 是一款原生多模态 MoE 模型,支持最高 100 万 Token 上下文。
模型拥有 552B 主干参数,另有 196B Engram 条件记忆参数;但在 Prefill 阶段每 Token 只激活 8B 参数,Decode 阶段激活 16B 参数。
而上一代的 DeepSeek-V4-Flash,拥有 284B 主干参数,每 Token 激活 13B 参数。
这意味着,新模型虽然主干规模接近翻倍,但读取 Prompt 时实际参与计算的参数反而减少。
这一代模型的技术重点明显转向长程 Agent 的真实部署成本:当 Agent 不断读取代码、网页、文档和工具返回结果时,模型工作负载正在越来越“输入重型”,长上下文带来的 Prefill 计算、KV Cache 占用、SSD 存储和数据搬运,开始成为比模型参数本身更突出的成本瓶颈。
根据技术报告,这次 DeepSeek 对 Transformer 结构进行了一次明显调整。
V4.1-Flash 共有 40 层语言主干,但不再简单按照传统 Decoder-only 模型的方式逐层处理全部 Prompt,而是划分成 20 层因果编码器(Causal Encoder)和 20 层 Decoder。
前两层只使用滑动窗口注意力(Sliding-Window Attention,SWA),其余层则采用新的压缩稀疏注意力 2(Compressed Sparse Attention 2,CSA2)。
此外,模型还集成了 Single-Pass mHC、Engram、DSpark 以及分层稀疏索引器等模块。
这套架构首先要解决的是 Agent 最现实的一个成本问题:它们通常读得远远多于写。
在 Agent 工作流中,每一次工具调用都会产生新的网页、Terminal 输出、代码或者文档,然后重新送入模型进行 Prefill。
如果上下文不断增长到几十万甚至 100 万 Token,让所有历史 Token 每次都完整经过整个模型,会产生极高的计算成本。
为此,DeepSeek 在 V4.1-Flash 中加入了因果编码器-解码器(Causal Encoder-Decoder,CED)架构。
Prefill 时,Prompt 首先经过前 20 层因果编码器;进入后 20 层 Decoder 后,Decoder 所需的全局 KV 不再由 Prompt 逐层重新计算,而是直接从第 20 层 Encoder 最终隐藏状态投影得到。
这样,大部分 Prompt Token 不需要再完整经过后半部分网络。
报告显示,Prefill 计算量接近减半。
KV Cache 成为这一代架构改造的核心 DeepSeek 在技术报告中花费很多篇幅讨论了 KV Cache。
🔗 原始来源
如果你要核对细节,可以再看原文: InfoQ AI原文链接
AI热榜