苹果超级加持RAG技术,93倍加速推理
苹果这次又放了个大招。
他们推出的这项名为“超位提示”的新技术,相当于给RAG装上了一台光速引擎。还记得前阵子OpenAI发布的GPT-4o mini吗?性能据说接近GPT-4,价格却大幅下降,一时间风头无两。苹果显然坐不住了,直接拿出了硬通货——超位提示(Superposition prompting),一种专门为基于transformer的预训练大语言模型设计的全新RAG方法。
这玩意儿到底有多猛?直接用数据说话:当应用于MPT-7B模型时,在NaturalQuestions-Open数据集上,计算时间直接缩短了93倍。没错,93倍,这个数字确实令人吃惊,但经过核实,结果确实如此。照这个速度发展下去,以后向AI提问,可能连眨眼的时间都不需要了。

那么,超位提示到底是什么?简单讲,它和传统的“链表式”DAG(有向无环图)不同,采用了一种叫做“ForkJoin拓扑”的结构。这种结构能并行处理输入文档,而不是像传统方法那样一个一个地串行处理。这就好比把单车道的高速公路改成了八车道,效率的提升自然不言而喻。
具体来说,这项技术有四大核心优势:
- 多个文档可以同时被读取和处理,速度自然大幅提升。
并行处理:
- 通过贝叶斯显著性评分,自动剔除那些不相关的路径。这就好比在迷宫里面,直接帮你把死胡同都堵上,你只管往前冲就行。这不仅提高了准确性,也大大节省了算力。
路径剪枝:
- 优化了token(文本单元)的位置编码,让模型的理解和表达能力更上一个台阶。
平衡位置分配:
- 进一步加速了推理过程,整个系统运转得更快更流畅。
路径缓存与并行化:
有细心的网友已经发现了:“等等,这不就是把GPU的并行计算思路搬到了NLP领域吗?苹果这波操作可以啊!”这个观察很精准。而且更厉害的是,超位提示还支持“迭代超位”功能,这使得模型在多跳推理任务(需要连续搜索多个事实才能回答的问题)上的表现也有了显著提升。
效果如何?研究团队透露,在相同的数据集上,准确率提高了43%。更重要的是,它全面超越了Naive LLM-RAG、BM-25、TF-IDF和Contriever等一众主流基线方法。更令人惊讶的是,这个方法在各种规模和架构的模型上都表现出色,无论是苹果自家的OpenELM,还是开源的BLOOMZ、MPT,都兼容得很好。在MuSiQue数据集上的测试还显示,超位提示在多跳推理任务上不仅没有因为速度提升而牺牲质量,反而表现更优了。
苹果这次推出的超位提示技术,既大幅提升了处理速度,又在很大程度上提高了准确性,可以说是双丰收。在这个AI算力竞争日益激烈的时代,效率的提升往往比单纯堆算力更具价值。而苹果,显然走在了正确的方向上。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名