首页 > 教程攻略 > ai资讯 >一文简单了解RAG的心脏 —— 向量数据库

一文简单了解RAG的心脏 —— 向量数据库

来源:互联网 时间:2026-08-24 14:25:28

聊到2023年,大模型无疑是整个科技圈最惊艳的存在。到了2024年,RAG技术又成了新的风口。RAG这个思路很巧妙——它不需要对大模型进行额外的预训练或微调,就能给模型“喂”进必要的上下文,从而显著降低幻觉。可以说,RAG的出现不仅掐住了大模型幻觉的命门,也标志着搜索范式正在经历一场深刻的变化。

一文简单了解RAG的心脏 —— 向量数据库

而在这场变革中,向量数据库扮演了RAG“心脏”的角色。围绕这条赛道,竞争肉眼可见地激烈起来。今天这篇文章,我们就来简单梳理一下向量数据库的硬核知识。

什么是向量数据库?

直白地说,向量数据库就是一个组织有序的向量嵌入集合,它整合了可以随时创建、读取、更新和删除的向量嵌入。而向量嵌入,则负责把一段文本或一张图片转成一串数值。向量库最擅长的领域包括图像搜索、音频检索、文本检索等,核心优势就在于能高效存储和检索海量的向量数据。

为了实现这一点,向量数据库用了专门的数据结构和算法来处理向量之间的相似性计算和查询。通过构建索引结构,它能在极短时间内找到最相似的向量,满足各种场景下的搜索需求。

什么是结构化数据?

非结构化数据指的是那些数据结构不规则、没有统一预定义模型、不方便用数据库二维逻辑去表示的数据。典型的比如图片、视频、音频和自然语言文本。这类数据,可以通过人工智能或机器学习的方法,转化成能放进向量空间的向量数据。

什么是向量?

向量在数学中指的是具有大小和方向的量。而对文本、图片、音视频这些非结构化数据来说,通过机器学习或深度学习模型进行Embedding(嵌入)提取出来的“特征”,最终就用数学上的向量来表示。所以,一个向量本质上就是一组有序的数值。

什么是特征向量?

特征向量就是包含了事物重要特征的向量。举个大家熟悉的例子:RGB色彩。每个颜色都可以通过对红(R)、绿(G)、蓝(B)三原色的比例得到。这样一个特征向量可以写作:颜色 = [红,绿,蓝]。对于一个像素点,用数组 [255, 255, 255] 表示白色,用 [0, 0, 0] 表示黑色。这里每个数组就是对应像素点的特征向量。

什么是Embedding(嵌入模型)?

通过深度学习神经网络,把非结构化数据里的内容和语义提取出来,让图片、视频等变成特征向量,这个过程叫做Embedding。嵌入模型的作用就是把各种格式的数据(图片、文本、视频等)转成特征向量,从而在多维向量空间中捕捉它们的含义和细微差别。

举个经典的例子:man、king、woman 和 queen 这几个词映射到向量空间后,通过分析向量的语义相似性,可以显著提高搜索和数据分类的准确性。

什么是向量检索?

向量检索是一种基于向量空间模型的检索方法,核心是计算和比较两个向量之间的相似度,并返回最相似的向量数据。如果两条向量足够相似,就意味着它们所代表的源数据(例如两张图片)也十分相似。

在一个给定的向量数据集中,向量检索基于某种度量方式(比如内积、欧式距离),构建出一种在时间和空间上都相对高效的数据结构,从而能快速找到与目标向量最相似的 K 个向量。

向量相似度检索算法

简单说说几种主流的检索算法:

  • 欧几里得距离(L2)

    :计算两个向量的欧几里得空间距离,距离越小相似度越高。这种方法对于总体差异至关重要的密集特征集,比如聚类或分类任务,非常有用。

  • 余弦相似度(cosine)

    :也称余弦距离,它通过计算两个高维向量的夹角余弦值来衡量相似度。夹角余弦值越小,夹角越大,向量差异越大。这种方法特别适合文本处理和信息检索,因为它能根据方向(而非传统距离)来捕获语义相似性。

  • 内积(ip)

    :全称Inner Product。该算法基于向量的内积——即两个向量对应元素相乘再求和——来计算相似度。内积值越大,相似度越高。

关于索引在向量数据库中的作用

在向量数据库中,索引(Index)是有效组织数据的过程。创建索引的目的是加速向量的相似度搜索,这对提升高维度空间内搜索的效率和速度至关重要。根据指定的索引算法和数据结构,索引将向量库中的原始数据进行分组排序,从而提高相似度搜索的效率和准确性——这才是驱动向量数据库在短时间内筛选出候选结果的核心所在。

向量数据库中索引的核心功能和优势主要有:

  • 减少延迟

    :通过加速搜索,索引能显著缩短从查询到获得结果的等待时间。

  • 高效的搜索操作

    :索引结构以特定方式组织数据,避免了对整个数据集进行穷尽扫描,从而极大提升了搜索效率。

  • 支持复杂查询

    :高级索引技术能在高维空间中灵活导航,支持包括最近邻搜索、范围查询和相似性查询在内的复杂操作。

  • 可扩展性

    :随着数据量增长,索引能确保搜索操作随着数据库规模扩展而保持高性能,不拖后腿。