📖
多模态
模型架构
一句话概括
模型能同时处理和理解文本、图像、音频、视频等多种数据形式的能力。
详细解析
多模态(Multimodal)指模型能够接收、理解和生成多种模态数据(文本、图像、音频、视频等)的能力。与纯文本模型不同,多模态模型通过统一的嵌入空间将不同模态信息对齐,实现跨模态推理。
典型架构是将视觉编码器(如ViT)、音频编码器与语言模型通过投影层连接,让语言模型"看懂"图像、"听懂"语音。代表模型包括GPT-4o、Gemini、Claude 3.5 Sonnet、Qwen-VL等,支持图文理解、视频分析、语音对话、跨模态生成等任务。
多模态是通向通用人工智能(AGI)的关键路径,应用场景涵盖内容创作、医疗影像、自动驾驶、机器人等。其挑战在于模态对齐、训练数据稀缺、计算成本高昂,以及评测体系尚不成熟。