大模型进阶必看:玩转“知识蒸馏”与“文档切割”两把手术刀
前言
2025年,AI圈出了件大事。

DeepSeek 只花了
600万美元
好家伙,这指控听起来挺唬人。但“蒸馏”到底是啥?
与此同时,在搞 AI 应用(尤其是 RAG 知识库)的时候,天天跟各种 Word、PDF、网页打交道。
怎么把这些乱七八糟的源文件喂给 AI?
文档切割(Document Chunking)
今天这篇文章主打一个“买一送一”。不拽术语,把
模型训练圈的蒸馏
应用开发圈的文档切割
Part 1:大模型的“吸星大法”——知识蒸馏
1. 蒸馏何谓?从化学到AI
“蒸馏”这个词,学过初中化学的都知道。
比如酿白酒,就是利用沸点不同,加热让酒精先变成蒸汽,再冷却收集。精髓就是四个字:
取其精华
大模型里的蒸馏,核心思路一模一样。只不过对象从“酒精”换成了“知识”。要把一个大模型(
老师模型
学生模型
简单来说,就是
让小模型去偷师大模型的本事
2. 死记硬背的笨办法(硬标签)
先想想,如果让你教一个小学徒,怎么让他学得快?
最直接的办法:
喂答案
比如拿一张猫的图片给大模型(老师)看,大模型说:“这是猫。” 然后我们把“猫”这个标准答案告诉小模型(学生),让它记住。在AI里,这个标准答案就叫
硬标签(Hard Label)
这像什么呢?就像给厨师新人一本菜谱,上面写着:“盐3克,糖5克。”
新人照着做,确实能做出来,但他不知道为什么放3克盐而不是5克。
他学到的只是步骤,而不是精髓。
3. 模仿思维的窍门(软标签与暗知识)
真正的知识蒸馏,可没这么简单粗暴。它不关心大模型给了“什么答案”,而是关心大模型是“
怎么得出这个答案的
大模型在回答问题时,其实不是只给出一个孤零零的结果,它会给所有可能的答案
分配一个概率
比如,给大模型看一张图,它可能输出:
- 猫:概率 80%
- 狗:概率 10%
- 老虎:概率 5%
- 鸡:概率 1%
这组概率分布,就是
软标签(Soft Label)
你看,这比单纯的硬标签(猫)信息量大太多了!软标签告诉小模型:猫和狗虽然不一样,但也有相似特征;猫和老虎更像。这种大模型在亿万数据里悟出来的“
类比感
暗知识
4. 蒸馏的三大优势与边界
三大优势:
- :小模型不用看几亿张图,直接拿着提炼好的“软标签”学,事半功倍。
数据效率更高
- :模型学到的知识更立体,泛化能力更强。
能学到暗知识
- :训练小模型的成本可能只是大模型的零头,这也是DeepSeek把成本压到600万美金的秘诀之一。
成本低很多
三大边界(也得清醒地看到):
- :小模型结构就摆在那,天花板就是老师傅的水平,很难青出于蓝。
学生有上限
- :只学了“鱼”,没学“渔”。
只学结果,学不到推理过程
- :大家都去薅OpenAI的羊毛,抄同一个学霸的作业,最后模型思路变得高度相似,失去了多样性。
过度蒸馏会“同质化”
Part 2:AI应用开发的“第一步”——文档切割(Document Chunking)
聊完怎么训练模型,把视线拉回到日常开发。
现在最火的应用是什么?
RAG(检索增强生成)
文档切割
1. 知识库的源头:Loader(加载器)
知识的来源五花八门:可能是本地的Word文档、PDF文件,也可能是B站的视频字幕、某个网页URL,甚至是一条靠谱的Twitter。
这些格式各异的文件,怎么统一变成向量数据库能存的东西?
在 Langchain 的世界里,第一步就是通过
Loader(加载器)
Document 对象
pageContent 内容和 metadata 元数据)。
Langchain 社区提供了 180 多种加载器,基本覆盖了你能遇到的所有格式。
光说不练假把式,直接上一段真实代码。比如,你想把
掘金上的一篇文章
ja vascript
复制代码import "dotenv/config";
import { CheerioWebBaseLoader } from "@langchain/community/document_loaders/web/cheerio";// 访问网址并提取文档内容
// cheerio 可以传递 css 选择器来精准定位,把网页里无关的侧边栏、广告统统过滤掉
const cheerioLoader = new CheerioWebBaseLoader(
"https://juejin.cn/post/7660707431753678854",
{
selector: '.main-area p' // 只抓取文章的主体段落
}
);// 加载!输出是一组 Documents
const documents = await cheerioLoader.load();
console.log(documents);
2. 第二步:分块(Splitter)
文件加载完了,是不是直接就能向量化存库了?
千万别!
一个PDF动不动几十页,一篇文章几千字。如果整篇文章作为一个向量去检索,那就像是
大海捞针
所以,得
切
Splitter(分块器)
需要把长文档,切割成一个个具有一定语义的、大小适中的
Chunk(块)
切割的核心原则:
- :太大了,检索精准度下降。
不能太大
- :太小了,丢失上下文语义(比如一句话被切成两半)。
不能太小
- :块与块之间最好有重叠部分,防止切断了关键信息。
要有重叠
总结一下
今天咱们一文聊透了两件事:
- :是
知识蒸馏
的传承。小模型通过模仿大模型的“概率分布”(软标签)来吸收“暗知识”,是降本增效的神器。模型与模型之间
- :是
文档切割
的桥梁。通过 Loader 读取五花八门的源文件,再通过 Splitter 切分成精准的 Chunk,是 RAG 应用成功的基石。数据与应用之间
一个管“
模型怎么学聪明
数据怎么喂进去
希望这篇“双拼”干货对你有用!