唐杰征集 GLM-5.3 意见,开发者呼吁加入视觉能力
唐杰向全球征集 GLM-5.3 意见,开发者集体要求视觉,但科学家认为当前应优先提升推理能力。
智谱 CEO 唐杰公开询问 GLM-5.3 该做什么,评论区齐刷刷要求视觉能力。尽管智谱已有原生多模态模型 GLM-5V-Turbo,但唐杰认为提升推理智能比加视觉更能逼近 AGI,反映出社区需求与科学家优先级的拉扯。
正文摘录
昨天先是畅聊 AI 认知,“AI 的终局就是 AGI,一场猎龙游戏”。引起广泛热议后,一觉醒来今天又在当众征集意见: 彼时唐杰也问过这么一回,评论区纷纷热情支招,一条条需求后来陆陆续续都在 GLM 后续版本中有所实现。 所以这次他一张口,懂行的人立马团建去了~有 po 自己痛点的,也有智谱自家员工在下面留言。 比如这位网友直接列出了自己的愿望清单:更强的 Agent 能力、超长上下文保持质量、更灵活的 API …… 强到离谱!开源界 AI 编程第一、全球第二,仅屈居于大名鼎鼎的神话级模型 Fable-5。 纯文本模型 ,搞得动百万 Token 超长上下文和深度逻辑推理,但偏偏没搭载视觉编码器,看不了图也造不出图。 而且关键在于,不是智谱做不出视觉。恰恰相反,今年 4 月智谱发过一个叫 GLM-5V-Turbo 的模型。 原生多模态的 Coding 基座,从预训练阶段就把视觉和文本揉在一起,能看懂设计稿、截图、网页界面,然后直接吐出能跑的代码,主打视觉 + 代码 + Agent 一体化。 再往前看,智谱也做过不少多模态模型,CogVLM 视觉编码器就出自他们之手。唐杰本人发表过的视觉论文,更是一抓一大把。 这一点从唐杰过往的发言中也可见一斑,比如去年底的大模型年终总结,他先是肯定多模态是未来。 问题是,当下的多模态对提升 AGI 的智能上界,帮助有限。可能最有效的方式还是分开发展,文本、多模态、多模态生成。当然适度的探索这三者的结合肯定能发现一些很不一样的能力,但这需要勇气和雄厚的资本支持。 唐杰这种冲在 AI 一线的科学家,盯着的始终还是第一性原理——模型智能。视觉可以让模型更好用,但要让模型更聪明,靠的还是复杂推理那套硬功夫。 AGI 对于用户太遥远了,所以用户更在乎的是,眼下贴张图模型能不能接住、截个屏模型能不能看懂。 于是就出现了这条推文里最微妙的拉扯。