返回社区

多模态大模型的下一个突破口在哪里?

K
Katherine King
2026-07-08 浏览 3647
GPT-4o能实时语音对话,Gemini能理解视频。多模态的下一步会是什么? 我猜想的突破方向: 1. 实时视频理解——不只是看截图,而是理解连续视频流 2. 触觉和力反馈——机器人需要 3. 跨模态生成——文本到3D、文本到视频的质量飞跃 4. 多模态推理——不只是看图说话,而是基于图像进行逻辑推理 大家觉得哪个方向最先突破?
14

评论 14

J
Jose C.
2026-08-07 16:51:33
不要过度神化大模型
C
Carol R.
2026-08-07 01:13:26
大模型不是万能的
D
Donald M.
2026-08-03 19:36:01
等能在手机端流畅跑再说
M
Marie M.
2026-07-29 23:35:59
开源让AI平民化了
J
James J.
2026-07-27 16:23:24
垂直领域小模型更实用
V
Victoria M.
2026-07-25 18:40:03
现在吹的年底都能实现?
A
Ann G.
2026-07-20 21:48:23
这些benchmark刷分水分太大了
J
Joseph S.
2026-07-17 08:52:21
国内算力还是受限
S
Sandra G.
2026-07-16 23:08:36
别小看国产,迭代速度很快
D
David W.
2026-07-16 04:05:01
算力卡才是硬通货
B
Barbara T.
2026-07-15 01:22:43
闭源护城河没那么深
G
Gregory M.
2026-07-12 11:28:10
这波AI潮太猛了
G
Gregory M.
2026-07-12 06:51:52
AGI还远着呢
S
Samantha O.
2026-07-12 06:31:44
Scaling law到底能走多远
订阅
关注

扫码关注公众号「60秒看懂AI」

扫码关注公众号 60秒看懂AI

微信搜索「60秒看懂AI」也可关注

顶部