@ honjow 哎,算了,我再苦口婆心地给你解释一遍吧。
上面蒙娜丽莎其实已经讲得很清楚了,看来你还是理解不了 如果面对的是一个 GUI 客户端,大模型通常无法直接调用它的内部接口,只能通过“识别屏幕画面+模拟鼠标键盘操作”的方式进行交互,效率上就天差地别 然后这其中的图像识别就是多模态能力了啊,比如 GUI 里面有一张日志链路图表,ZCode 现在的处理方式是先调用一个 GLM-5V-Turbo 这样的支持多模态的小模型,把这张图片识别完毕之后翻译成文字,翻译成文字必然是丢失数据失真,比如: 他总结出来的内容是“这是一张日志链路追踪图,第一个节点是 xx ,第二个节点是 xxx ,每个节点分别日志是 xxx ,xxxx ,耗时 xxms”。
但是有可能图片中的连线粗细表达了权重关系、线条颜色深重表达了 SLA 质量,Z 轴高度表达了调用次数等等,有可能这些信息他在翻译成文字的过程中就都丢掉了,没识别出的内容,要不就是后面的文字模型永远看不到,要不就是后续会反复一遍遍再调用 OCR 图片识别。
如果他是一个原生多模态模型,图片被存储成了图像 token 就不会有这个问题,明白了没?
🔗 原始来源
如果你要核对细节,可以再看原文: V2EX原文链接
AI热榜