📖
词向量/嵌入
模型架构
一句话概括
将离散的文本、图像等数据映射为连续稠密向量,使语义可被数学计算。
详细解析
嵌入(Embedding)是将离散的符号(词、子词、句子、图像等)映射为低维连续向量的技术。在语言模型中,每个token通过查表得到一个固定维度(如768、4096)的向量,作为Transformer层的输入。
嵌入向量的关键性质是"语义相近则向量相近":通过训练,语义相关的词在向量空间中距离更近,从而支持相似度计算、聚类、检索等下游任务。句子级、文档级嵌入(如sentence-BERT、OpenAI text-embedding)广泛用于RAG、语义搜索、推荐系统。
嵌入质量直接影响模型表现,其维度、训练目标(对比学习、掩码语言模型)、覆盖语种都是关键设计因素。嵌入数据库(如Pinecone、Milvus、Chroma)是构建RAG应用的基础设施。