模型架构/术语条目
多模态
模型能同时处理和理解文本、图像、音频、视频等多种数据形式的能力。
大白话:模型能同时处理和理解文本、图像、音频、视频等多种数据形式的能力
换成大白话
多模态(Multimodal)指模型能够接收、理解和生成多种模态数据(文本、图像、音频、视频等)的能力。与纯文本模型不同,多模态模型通过统一的嵌入空间将不同模态信息对齐,实现跨模态推理。 典型架构是将视觉编码器(如ViT)、音频编码器与语言模型通过投影层连接,让语言模型"看懂"图像、"听懂"语音。代表模型包括GPT-4o、Gemini、Claude 3.5 Sonnet、Qwen-VL等,支持图文理解、视频分析、语音对话、跨模态生成等任务。 多模态是通向通用人工智能(AGI)的关键路径,应用场景涵盖内容创作、医疗影像、自动驾驶、机器人等。其挑战在于模态对齐、训练数据稀缺、计算成本高昂,以及评测体系尚不成熟。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“多模态”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“多模态”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。