大模型开发 - 一文搞懂Embedding工作原理
来源:互联网
时间:2026-07-28 15:19:14
不懂Embedding,何以懂AI?
本文将从三个维度——
Text Embedding工作原理
Image Embedding工作原理
Video Embedding工作原理

Embedding可视化
Text Embedding工作原理
文本向量化(Text Embedding)
词向量化是将每个词映射为二进制或高维实数向量;句子和文档向量化则通过平均、神经网络或主题模型等手段,把整段文本浓缩成一个数值向量。
词向量化
将单个词转换为数值向量,典型方法有两种:
- :给每个词分配一个唯一的二进制向量,其中只有一个位置是1,其余全是0。
独热编码(One-Hot Encoding)
- :像Word2Vec、GloVe、FastText等,把每个词映射到一个高维实数向量,语义相近的词在向量空间中彼此靠近。
词嵌入(Word Embeddings)
词向量化
句子向量化
将整个句子转为一个数值向量,常见做法包括:
- :对句子中的词向量求平均,或者根据词频加权平均。
简单平均/加权平均
- :递归处理每个词,生成句子表示。
递归神经网络(RNN)
- :用卷积层捕捉局部特征,然后生成句子向量。
卷积神经网络(CNN)
- :比如BERT模型,通过对句子中每个词进行自注意力计算来获得句子表示。
自注意力机制(如Transformer)
BERT句子向量化
文档向量化
将整个文档——一篇文章或一组句子——变成数值向量:
- :对文档中的句子向量平均或加权平均。
简单平均/加权平均
- :通过捕捉文档的主题分布来生成表示。
文档主题模型(如LDA)
- :扩展了Word2Vec,可以生成整个文档的向量。
层次化模型(如Doc2Vec)
文档向量化
统计方法方面,TF-IDF和N-gram通过统计生成文本向量;而神经网络方法,如Word2Vec、GloVe等,则通过深度学习来学习文本向量。
基于统计的方法
- :统计词频和逆文档频率来生成词向量或文档向量。
TF-IDF
- :基于n个连续词的频率来生成向量。
N-gram
TF-IDF
基于神经网络的方法
- :
词嵌入
- Word2Vec:通过预测词的上下文学习词向量。
- GloVe:利用全局词共现统计学习词向量。
- FastText:考虑词的n-gram特征来学习词向量。
- :
句子嵌入
- RNN(包括LSTM和GRU):处理变长句子,生成句子向量。
- Transformer:使用自注意力机制和位置编码,生成句子向量。
- :
文档嵌入
- Doc2Vec:扩展Word2Vec,生成整个文档的向量。
- BERT:基于Transformer的预训练模型,可生成句子或短文档的向量。
Word2Vec
工作原理
- 将离散信息(单词、符号)转换为分布式连续值数据(向量)。
- 相似的项目(比如语义相近的单词)在向量空间中被映射到相近的位置。
- 提供了更多的维度(例如1536个维度)来表示人类语言的复杂度。
举例来说,这里有三个句子:
- “The cat chases the mouse” 猫追逐老鼠。
- “The kitten hunts rodents” 小猫捕猎老鼠。
- “I like ham sandwiches” 我喜欢火腿三明治。
人类一眼就能看出句子1和句子2含义差不多,而句子3完全不同。但计算机看到的却是:句子1和句子2只有“The”这个单词相同,其他词汇都不一样。计算机怎么理解前两个句子的相关性?答案就是Embedding。Embedding把每个单词转换成向量,使得语义相近的句子在向量空间中距离很近。所以,即使句子1和句子2没有太多共同词汇,计算机也能判断它们是一回事。
如果是人类来理解,句子1和句子2几乎是同样的含义,而句子3却完全不同。但我们看到句子1和句子2只有“The”是相同的,没有其他相同词汇。计算机该如何理解前两个句子的相关性?
Embedding将单词转换为向量,使得语义相似的句子在向量空间中位置相近。这样,即使句子1和句子2没有很多共同词汇,计算机也能理解它们的相关性。
向量空间可视化
Image Embedding工作原理
图像向量化(Image Embedding)
- :通过训练CNN模型,从原始图像提取特征并表示为向量。比如使用预训练模型(VGG16、ResNet)的特定层作为特征提取器。
卷积神经网络(CNN)
- :一种无监督神经网络,学习输入数据的有效编码。在图像向量化中,它学习从图像到低维向量的映射。
自编码器(Autoencoders)
CNN
工作原理
- :使用SIFT、SURF、HOG等算法从图像中提取关键特征点和描述符。
特征提取
- :图像向量通常在高维空间中表示,每个维度对应一个特征或特征描述符。
高维空间
- :在向量空间中,可以用欧氏距离、余弦相似度等距离度量来比较不同图像向量的相似度。
相似度度量
图像向量化
Video Embedding工作原理
视频向量化(Video Embedding)
- :为了将视觉数据转换成适合生成模型处理的格式,研究者提出了视觉块嵌入编码(visual patches)的概念。这些视觉块是图像或视频的小部分,类似于文本中的词元。
视觉块的引入
- :在高维视觉数据(如视频)面前,先把它压缩到一个低维潜在空间,减少数据复杂性的同时保留足够的信息供模型学习。
处理高维数据
将视觉数据转换为图像块
工作原理
OpenAI大模型的核心架构:大力出奇迹。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名