整体范式:从拼接式多模态(LLM 外接视觉编码器)走向原生全模态 Omni 模型,文本、图像、音频、视频、3D、点云进入同一套表征空间,支持任意模态输入输出,不再做简单桥接拼接。下面分为架构创新、能力方向、智能体与世界模型、端侧与工程、垂直落地、现存开放难题六大部分。
一、底层架构新方向
1. 原生统一全模态架构(Omni‑Modal)
不再是 LLM + 外接视觉编码器,全部模态共享 Transformer 主干,输入输出可自由组合:图生音频、视频输出 3D、音频生成图像等跨模态流转CSDN博...。
技术路线:MoE 混合专家多模态、Mamba 结构化时序建模、统一 tokenizer,把图像块、音频帧、视频切片全部转为统一 token 序列。
代表:GPT‑4o、Gemini 2.5、Qwen‑Omni、GLM‑V 系列。
2. 长时序多模态建模
长视频理解:小时级视频流、会议录像、监控流,解决时序漂移、角色一致性,采用分层注意力、事件记忆压缩、关键帧蒸馏,不再只处理几秒短视频片段。
超长多模态上下文:百万级 token,同时灌入文档 + 截图 + 音频 + 多段视频,做联合推理。
3. 跨模态推理(Multimodal CoT)
不只看懂图片,在视觉空间做推理:几何画图辅助解题、空间推演、看图做规划;把思维链扩展到图像、视频、3D 空间,而不是全部翻译成文本再思考。

二、内容生成新方向
1. 视频理解‑生成‑编辑一体化
从 “文生短视频” 升级:长视频生成、角色 / 物体一致性、镜头调度、可编辑视频;理解和生成双向互相增强,用理解能力约束生成的逻辑与时序一致性。
实时交互视频:不再离线生成,支持输入指令实时修改画面,向世界模型演进。
2. 3D 与空间多模态
输入输出:图片、深度图、点云、NeRF、CAD 模型、体数据;
2D 图像重建 3D 场景;3D 理解做工业质检、机器人感知、AR/VR 内容生成;
新一代:带物理属性的 3D 生成,不光生成几何,附带质量、应力、材质,对接仿真、工业设计流程。
3. 多模态可控生成
参考图、人物参考、运动参考、剧本驱动;解决 AI 生成文字错乱、人物变脸、物体崩坏的老痛点;
LLM 深度介入生成流程:大模型做剧本、分镜、参数规划,再调用扩散生成器,提升整体逻辑可控性。
三、多模态 Agent & 世界模型(当前最热)
1. 多模态 Agent(视觉语言智能体 VLA)
Agent 具备视觉感知能力:
UI Agent:看截图,识别网页 / 软件界面,自主点击、输入、滚动,改造传统 RPA;
现实世界 Agent:摄像头画面作为输入,完成观察‑思考‑调用工具‑行动闭环;
多模态记忆:图像、视频片段存入记忆,支持跨轮次视觉上下文复用。
2. 世界模型 World Model
多模态大模型向上延伸,预测物理世界状态变迁,不只生成图片,而是模拟 “接下来会发生什么”。
数字世界:交互式虚拟场景、游戏仿真;
物理世界:预测物体运动、因果推演;
工业方向:工业世界模型,融合工艺文档、传感器视频、CAD、仿真数据,用于产线仿真、故障预判。
3. 具身智能 Embodied AI
多模态模型作为机器人大脑:接收相机、雷达、音频传感器,输出机器人动作指令;视觉‑语言‑动作统一训练;从仿真迁移到真实机器人部署。

四、部署与工程方向
1. 端侧原生多模态
3B‑7B 参数轻量化全模态模型,手机、边缘盒子、IoT 摄像头本地跑看图、听语音、短视频理解;端云协同:端侧感知,云端深度推理 / 大生成,平衡延迟与算力成本。
2. 开源多模态底座爆发
开源模型能力快速追平闭源:MiniMax‑H3、MiniCPM‑o、Qwen‑Omni 等,支持二次微调、私有化部署,企业可以做垂直领域定制多模态模型。
3. 多模态对齐与 RL
从文本 RLHF 升级到多模态 RL:对图像、视频输出做人类偏好对齐;GRPO 等强化学习范式大量用于提升跨模态推理、生成一致性。
五、垂直领域多模态
医疗多模态:CT、核磁、病理图像 + 病历文本联合分析;多模态问诊;
工业多模态:图纸、工艺文档、产线视频、传感器信号融合,质检、故障诊断;
自动驾驶多模态:多相机、激光雷达点云、文本路标信息统一感知;
多模态检索:混合文本、图片、视频、音频的知识库 RAG(Multimodal‑RAG),现在主流建设方向。
六、尚未解决的关键挑战(研究热点)
物理与因果缺陷:图像视频看得懂,但缺少真实物理直觉,经常出现违背物理常识生成结果;
多模态幻觉:视觉幻觉、视频时序幻觉,比文本幻觉更难评估;
评测体系缺失:缺少统一可靠长视频、3D、Agent 任务评测基准;
模态失衡:训练容易偏向文本,视觉、3D 能力被抑制;
高算力开销:视频、3D 训练推理成本极高。
简要演进脉络
阶段 1:CLIP 类,图文对齐,只能做检索、简单 VQA 阶段 2:缝合多模态:LLM 外接 ViT 视觉编码器(BLIP‑2 等) 阶段 3:原生全模态 Omni:统一表征,任意模态输入输出(GPT‑4o、Gemini) 阶段 4:多模态 Agent + 世界模型:感知‑推理‑预测‑行动闭环,通向具身智能
本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。
原文链接
欢迎访问 小易撩挨踢