$V2EX
Solana
Give SOL to Copy Address
使用 SOL 向 feeeei 打赏,数额会 100% 进入 feeeei 的钱包。
 feeeei's recent timeline updates
feeeei

feeeei

🏢  Golang
V2EX member #87408, joined on 2014-12-19 14:31:24 +08:00
Today's activity rank 5440
feeeei's recent replies
@honjow 哎,算了,我再苦口婆心地给你解释一遍吧。上面蒙娜丽莎其实已经讲得很清楚了,看来你还是理解不了

如果面对的是一个 GUI 客户端,大模型通常无法直接调用它的内部接口,只能通过“识别屏幕画面+模拟鼠标键盘操作”的方式进行交互,效率上就天差地别

然后这其中的图像识别就是多模态能力了啊,比如 GUI 里面有一张日志链路图表,ZCode 现在的处理方式是先调用一个 GLM-5V-Turbo 这样的支持多模态的小模型,把这张图片识别完毕之后翻译成文字,翻译成文字必然是丢失数据失真,比如:
他总结出来的内容是“这是一张日志链路追踪图,第一个节点是 xx ,第二个节点是 xxx ,每个节点分别日志是 xxx ,xxxx ,耗时 xxms”。但是有可能图片中的连线粗细表达了权重关系、线条颜色深重表达了 SLA 质量,Z 轴高度表达了调用次数等等,有可能这些信息他在翻译成文字的过程中就都丢掉了,没识别出的内容,要不就是后面的文字模型永远看不到,要不就是后续会反复一遍遍再调用 OCR 图片识别。

如果他是一个原生多模态模型,图片被存储成了图像 token 就不会有这个问题,明白了没?
@honjow 好的好的,你都说了“那智谱没有多模态”了,你几斤几两、什么水平已经显而易见了

无需多言,再讲什么都是在招笑话了
@honjow “那智谱没有多模态”这句话是谁说的,上来就说"那智谱没有多模态",还嘴这么硬... 我想问问你,你这种情况,持续多久了?
@honjow 你到底用没用过啊.... 啥都不懂就开始人身攻击,你不怕打脸给你打肿?!?!?

1. “那智谱没有多模态”,谁说智谱没有多模态,GLM-5V-Turbo 不知道?
2. “Zcode 是怎么用”,你到底用没用过,你没发现你上传图片他会单独调用 analyze_image tools ?你但凡用过一次看到输出就不会有这么蠢的问题,你没发现他是把图片先分析成文本再开始处理?明显就是先调用了一次 GLM-5V-Turbo 做图片识别,把输出的文字内容丢到主会话中继续处理

所以 Zcode 是通过嫁接的方式实现的图片识别,问题是很多图片通过文字表述就严重失真了,比如不管你怎么文字描述蒙娜丽莎的图片,AI 都没办法给你画出蒙娜丽莎,只有原生多模态直接图片输入的才能保持图片信息不失真,懂?

不懂就多查查,别肚子没几滴墨水就开始攻击,被打脸不尴尬吗
GUI 是图形化界面,考验大模型多模态识图能力
CLI 是命令行,纯文字,属于是 raw 级别交互,在所有大模型都在卷 agent 能力的今天,命令行交互属于是 AI 最基础的能力之一了
人家有没有可能赚的就是你封号的钱,账户被封了 Anthropic 是全退,然后你是按剩余天数退款
不知道 HK 节点解锁 Claude 么?
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1151 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 23ms · UTC 17:59 · PVG 01:59 · LAX 10:59 · JFK 13:59
♥ Do have faith in what you're doing.