多模态大模型的下一个突破口在哪里?
GPT-4o能实时语音对话,Gemini能理解视频。多模态的下一步会是什么?
我猜想的突破方向:
1. 实时视频理解——不只是看截图,而是理解连续视频流
2. 触觉和力反馈——机器人需要
3. 跨模态生成——文本到3D、文本到视频的质量飞跃
4. 多模态推理——不只是看图说话,而是基于图像进行逻辑推理
大家觉得哪个方向最先突破?
14
评论 14