返回知识库

AI 与提示 · 知识与检索

向量嵌入Embedding

向量嵌入(embedding)把文本映射成固定维度的数字向量,让语义相近的内容在高维空间中距离更近。它比较的是意思而不只是共字;上下文不足时仍会歧义,相似分数也必须用真实查询校准,不能当成事实置信度。

把一句查询放进语义地图

同样含“苹果”,手机、成熟和公司是三种意思。删掉上下文会让近邻失去判断依据,补回语境后查询针才会靠向正确句子。

这是一组客服知识句子的语义搜索。查询先变成固定维度向量,再在地图中寻找高维距离最近的句子;地图用二维投影帮助看关系,不代表模型真的只有两个维度。

SEMANTIC SEARCH / support-notes语义地图近邻已定位
本次查询苹果手机如何截图?
[-0.14, 0.82, … 1536 维]
手机语义簇水果语义簇公司 / 金融
QUERY VECTOR苹果手机如何截图?
手机用法iPhone 怎么截屏?近邻 · 余弦 0.91
手机用法Galaxy 截图快捷键近邻 · 余弦 0.79
水果生长苹果什么时候成熟?远邻 · 余弦 0.28
水果生长红富士几月采摘?远邻 · 余弦 0.19
公司金融苹果公司股价走势远邻 · 余弦 0.23

二维位置仅是教学投影;真正向量有 1536 维,检索按高维余弦距离排序。

取回判断已取回 · iPhone 怎么截屏?

字面没有“苹果手机”,但语义相同,余弦 0.91;水果句虽然共享“苹果”,只得 0.28。

字面没有“苹果手机”,但语义相同,余弦 0.91;水果句虽然共享“苹果”,只得 0.28。 删掉“手机 / 截图”看看上下文不足时会发生什么。

从地图里,记住四件事

面板已经展示了文本变向量、距离排序、上下文消歧和拒绝低置信取回;这里给它们命名。

嵌入把内容映射成固定维度向量
一段文本经过同一个 embedding 模型后得到一串数字;维度固定,才可以在同一向量空间比较距离。
近的是意思,不一定是字面
「苹果手机截图」和「iPhone 截屏」没有共同词却能靠近;「苹果手机」和「苹果成熟」共享词却属于不同语义簇。
上下文决定歧义能否被拉开
只写「苹果怎么选」时,手机与水果候选几乎同分。嵌入不是读心术,应补上下文、追问或混合检索。
相似分数不是事实置信度
余弦分数受模型、语言、分块和语料影响;阈值要用真实查询集校准,命中后仍需重排序与依据校验。

什么时候用,什么时候别单用

嵌入擅长“换一种说法仍能找到”,但精确标识符和强歧义通常需要别的信号。

  • 适合:RAG 文档召回、相似问答、推荐、去重与语义缓存,目标是找“意思最像”的内容。
  • 尤其适合:同义不同字、口语改写或跨语言表达,关键词容易漏掉这些候选。
  • 别单用:订单号、代码符号、专有名词需要精确命中时,叠加关键词形成混合检索。
  • 先补语境:查询过短、歧义很强或领域词模型不熟时,追问、带上下文分块或增加重排序。

怎么用:从文本到可靠近邻

模型、维度和距离度量必须在写入与查询两端保持一致。

  1. 1准备语义完整的片段把标题和必要上下文一起送进 embedding,不要只嵌入孤立关键词。
  2. 2统一模型与归一化文档和查询使用同一模型、同一维度与同一距离度量。
  3. 3按距离召回取 top-k,同时保留 score、片段 id 和来源,不把高分直接当正确答案。
  4. 4用真实查询校准覆盖同义、歧义和无关样本,决定阈值、混合检索和拒答边界。

同一目标,只改匹配依据

都想从客服库找到“手机截图”说明;差别只在数共字还是比较语义距离。

正例嵌入召回 + 校准阈值

查询「苹果手机截图」把「iPhone 怎么截屏」排第一,并把水果句留在远邻;低分或歧义时追问。

反例只按“苹果”共字排序

水果成熟句因为共享“苹果”排到前面,真正同义的 iPhone 句被漏掉;用户得到完全错误的知识片段。

快速自测

查询只有「苹果怎么选」,手机和水果候选的余弦几乎相同。最稳妥的下一步是什么?

继续查证

术语的技术定义和行为以这些一手或权威资料为准。

下一步学

和本知识点经常一起出现的概念。