← 返回新闻列表
36氪 🗓️ 2026-08-04

突发:Kimi K3与DeepSeek V4之间,隔着原生多模态的时间差

⚡ 一句话看懂:有分析指出,文 | 李炤锋 编辑 | 张雨忻 “长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。

文 | 李炤锋 编辑 | 张雨忻 “长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。

”谈及原生多模态的意义,一位多模态研究员表示,“视觉是一种更准确的反馈,也更贴近用户意图。

” 过去一年,Coding与Agent能力不断改写大模型的排名,也成为AI最快兑现商业价值的场景之一。

与此同时,随着Agent开始接管更多长链任务,越来越多的通用大模型开始匹配原生多模态能力。

今年1月,OpenAI发布的一份企业使用报告显示,在研发岗位最常使用的三类ChatGPT工具中,图片上传排在搜索和数据分析之后,位列第三。

随着Agent开始生成网页、操作软件并检查运行结果,视觉的作用正在逐步进化:它不再只是用户交给模型的一张图片,也开始成为模型检查工作、发现错误和调整行动的反馈。

刚刚过去的7月,月之暗面发布Kimi K3。

这款总参数2.8万亿、支持100万token上下文的MoE(混合专家模型),在Coding和长程Agent能力之外,出色的原生多模态能力是K3的另一个标签。

所谓原生多模态,是让图像、文字等数据从预训练或持续预训练阶段就共同塑造主模型,并在后训练中继续优化,最终参与Agent(智能体)的感知与决策。

K3发布后曾以1679分登顶Arena Frontend Code榜单。

该榜单由用户盲选模型生成的可交互网页进行排名,评判的不只是代码能否运行,也包括页面的最终效果。

浏览器开发平台Puter曾在测试网页中制造5处视觉偏差,K3对照目标页与运行页截图,全部找出且没有误报。

得益于出色的原生多模态能力,K3能够看懂代码运行后的视觉问题,为下一轮修改提供依据。

Kimi方面将这种在代码与截图之间反复迭代的方式称为“vision in the loop”:模型写完代码后查看页面,再根据视觉结果继续调整。

🔗 原始来源

如果你要核对细节,可以再看原文: 36氪原文链接