模型架构/术语条目
视觉语言模型
专注于理解图像和视频并结合文本推理的模型类别,是多模态的重要分支。
大白话:专注于理解图像和视频并结合文本推理的模型类别,是多模态的重要分支
换成大白话
视觉语言模型(Vision-Language Model, VLM)是一类专门处理视觉(图像、视频)与文本联合任务的多模态模型。它通常由视觉编码器(如CLIP、ViT)提取图像特征,经投影后输入大语言模型进行推理和生成。 VLM支持图像问答、图像描述、OCR、图表理解、视频摘要、视觉推理等任务。代表模型包括GPT-4V、Gemini、Qwen-VL、LLaVA、InternVL等。早期VLM仅支持单图输入,新一代已扩展到多图、长视频、高分辨率。 VLM的核心挑战是视觉特征与语言空间的对齐、细粒度视觉理解(如计数、空间关系)、以及长视频的时序建模。它在文档智能、内容审核、辅助驾驶、教育等场景有广泛应用,是多模态AI落地最成熟的领域之一。
它通常在什么场景出现
这个术语常见于模型选择、训练与微调、推理与部署、评测或产品功能说明等场景;当你遇到“视觉语言模型”时,多半是在讨论模型行为、处理方式或指标口径。
具体出现在哪类场景,可以用下方“跨库查找”搜索包含该概念的模型、训练、评测或产品资料。
容易混淆的地方
不要把“视觉语言模型”理解成模型本身的能力或在某个榜单上的具体名次;它更多是描述一种机制、一种处理方式或一个指标口径,而不是模型实力的绝对结论。
来源与更新时间
术语释义来自公开资料和持续维护的目录字段;具体每条定义的最后维护时间与待核实信息,以本页为准。