大模型+搜索(下):信息检索/搜索引擎的变革时代已经到来
咱们接着聊大模型在搜索领域的那些事儿。在深入讨论之前,有必要先把传统搜索的基本概念和原理梳理清楚。毕竟,大模型是给搜索“加buff”,而不是取而代之。
传统搜索
爬虫(Crawler)
搜索引擎靠爬虫程序来遍历互联网,这玩意儿就像个自动化的浏览器,会访问网站、读取页面内容。比如,爬虫跑到一个新闻网站上,就会把文章的正文、图片和多媒体信息都下载下来,存起来。
索引(Indexing)
索引就是搜索引擎把爬取到的网页内容进行分类和存储,目的是为了以后能快速找到它们。假设爬虫抓了一篇关于“全球变暖”的文章,搜索引擎会把标题、正文、关键词这些关键信息提取出来,加到索引数据库里。当你在搜索框里敲下关键词,引擎并不是去互联网上现场搜,而是在它自己存好的索引里翻找。所以,要是一个网页没被索引、没被收录,用户就根本搜不到它。下面是一个简化版的倒排索引表,能帮你理解这个逻辑。
排名算法(Ranking Algorithm)
排名算法决定了哪些网页最相关。比如,用户搜“全球变暖影响”,谷歌之类的引擎会评估所有相关页面的质量和相关性。它可能会根据PageRank算法(也就是看网页链接的数量和质量)给高权威的网站更高的排名,把它推到前面。
自然语言处理(NLP)
搜索引擎会用NLP技术来更深入地理解用户的查询和网页内容。
- :把“全球变暖的影响”拆成“全球”、“变暖”、“的”、“影响”这几个单独的词。
分词(Tokenization)
- :识别每个词的词性,比如“全球”和“变暖”是名词,“影响”可能既是名词又是动词。
词性标注
- :理解整句话的意思,识别出“全球变暖”是一个专有名词,不是一个一个的词。
语义分析
- :把“全球变暖”识别成一个具体的环境问题实体。
实体识别(NER)
- :搞明白查询里词和词之间的依存关系,比如“影响”是查询的核心动作,和“全球变暖”直接相关。
依存关系解析
- :在处理像电影评价这类查询时,能识别用户的正面或负面情感倾向。
情感分析
搜索结果页(SERP)
排名算法算完之后,搜索引擎会展示一系列关于“全球变暖影响”的网页链接,可能还会放上特定的知识图谱、新闻摘要什么的,帮用户更快地获取信息。
个性化和上下文搜索
搜索引擎还会考虑用户的地理位置、搜索历史,提供个性化的结果。比如,搜“最近的气候变化新闻”,不同地区的用户看到的会是他们当地相关的新闻链接。
通过这些步骤,传统搜索引擎就能高效、准确地帮用户找到想要的信息。理解这些概念和技术,对于开发和优化搜索产品来说很重要。
大模型+搜索会有何不同
传统搜索是从已有的信息库里找答案,然后给你一大堆网页链接,你得一个一个点开看。但大模型和AIGC就不一样了,它能更精准地理解你的意图,把信息整合起来,直接生成摘要、答案、建议。这种方式能提供更高质量、更多样化的信息,收集信息的效率也更高。
微软:New Bing
随着大型语言模型(LLM)技术的发展,市面上出现了一批创新的LLM集成搜索产品,微软的New Bing(现在叫Copilot了)就是个典型。
从New Bing到Copilot
作为OpenAI的重要股东和合作伙伴,微软很早就把GPT模型用到了Bing搜索里,推出了搜索+AI的产品。2023年2月初,新版必应上线,最大的亮点就是基于GPT-4(做过一些调整和优化)的聊天机器人。这个聊天机器人一开始叫Bing Chat,那时候想体验还得装dev版的Edge浏览器。到了2023年11月的Ignite活动上,微软决定把它改名为Copilot。现在,功能更强的Copilot预览版(不只是搜索,已经是个智能助手了)在Windows系统上已经能用了。新必应可以说是开创了搜索引擎从“传统检索”到“对话式搜索和生成”的转变,用户能得到更成体系、更有逻辑、更个性化的答案。
Copilot的对话体验和现有的Bing搜索结合了起来,为用户提供了基于大语言模型的新型自然语言搜索界面。它生成答案的来源,和普通搜索结果页的第三方结果排名一样——因为聊天机器人连着网,所以能给你最新信息,这是ChatGPT免费版没有的功能。这些引用来源会清楚地展示给你,你可以通过访问第三方网站做更深入的研究。根据用户的请求,模型还能生成诗歌、故事、代码、文章、歌曲之类的内容,激发创造力。除了搜索本身,它和ChatGPT这样的聊天机器人有很多相似之处。
2024年3月,微软又把免费版Copilot升级到了基于GPT-4 Turbo(可以看成是更先进的模型),这是OpenAI目前最先进的LLM。如果想不花钱又体验到最新的GPT-4能力,这绝对是个超棒的选择。有时候,Bing会在搜索页面顶部显示Copilot生成的汇总结果,你往下翻还能看到传统的搜索结果。
技术创新的背后:Prometheus
2021年,微软Search团队就开始琢磨搜索技术的未来了。他们觉得,通过应用深度学习模型,可以让搜索变得更现代化、更直观,显著改善用户体验。和OpenAI合作后,2022年夏天他们接触到了下一代GPT模型,这个模型的能力远超GPT-3.5,在合成、总结、对话和创造方面都更强。
看到这个新模型,微软开始探索怎么把GPT功能集成到Bing里,这样就能为任何查询提供更准确、更完整的搜索结果,尤其是那些又长、又复杂、又自然的查询。不过,这个新GPT模型虽然是个突破,但它和所有LLM一样,是用截止到某个时间点的数据训练的。所以微软认为,把它和Bing后端的功能结合起来,才能让用户体验更丰富、更相关、更准确。
为此,微软开发了一种叫Prometheus的专有技术。这是第一个同类AI模型,它把新鲜全面的Bing索引、排名和答案结果,和OpenAI最先进的GPT模型的创造性推理能力结合起来了。Prometheus通过一个叫“Bing Orchestrator”的组件,在几毫秒内迭代生成一组内部查询,目的是为特定对话中的用户查询提供准确而丰富的答案。选择相关的内部查询、调用对应的Bing搜索结果,这是Prometheus的关键,因为它给模型提供了相关又新鲜的信息,让模型能回答最近的问题,减少不准确之处——这种方法就叫“基础”。换句话说,模型基于Bing提供的数据进行推理。
最后一步,Prometheus还会把天气、股票、体育、新闻等相关的Bing搜索结果,附加到聊天答案里,让用户体验更丰富、更有吸引力。另外,Prometheus还能在聊天答案的句子中集成引文,用户点击就能访问来源、验证信息。给这些来源导流,对健康的网络生态很重要,也是微软Bing的首要目标之一。
虽然Prometheus很厉害,但从用户体验的角度看,当时团队还不确定怎么把它集成到Bing里。主要有两种观点:一种认为搜索是根深蒂固的习惯,得保持用户已有的体验,在主界面上加上Prometheus生成的聊天答案就行,和其他答案一样,根据相关性竞争位置。另一种则认为,这是一个改变搜索范式的机会,应该从经典的结果列表转向新的、基于聊天的交互式搜索。
提倡传统搜索的团队通常拿导航查询来辩护,而推动对话方法的团队则会举出类似研究性的搜索场景,比如购物或旅行。很明显,有些查询在传统模式下表现更好,有些在对话模式下更佳。而且,根据查询的不同,有的用户也可能更喜欢其中一种模式。所以,理想的Bing需要能根据用户意图和偏好,在搜索和聊天模式之间平滑切换。经过多次迭代,微软开发了一种新的用户体验,把搜索和聊天统一到一个界面里,用户点一下或滚动一下就能轻松切换。这个产品创新和技术创新同等重要,目的是确保人们能以直观的方式充分发挥产品的潜力。
百度搜索:AI Native重构
大约三个月后,百度也坐不住了,基于“文心一言”开始公测生成式AI搜索产品“AI对话”(也叫“搜索AI伙伴”),同时开始对百度搜索功能进行“重构”。在2023百度世界大会上,百度搜索进一步升级,李彦宏宣布新搜索有“极致满足”的生成能力——你输入问题,它直接生成一个最好的答案,而不是给一堆链接。此外,还增加了“多轮交互”和“推荐激发”功能。
百度搜索的场景很复杂,答案获取方式也很多样,比如从百科或网页里提取信息、构建知识图谱、从表格里解析结构化数据,甚至解析视频内容。在一些复杂搜索场景中,传统的抽取式答案往往太长,用户抓不住重点。所以需要用生成技术,把答案压缩总结,让用户快速抓住关键点。
另外,从单一文章里提取的答案可能不够全面,需要从多个网页整合答案,并标明来源。直接拿大模型来做问答会面临几个挑战:模型没办法覆盖所有领域的知识,冷门信息它可能不了解;知识更新滞后,新东西它反应不过来;生成的答案难以验证,用户对模型直接给出的答案信任度不高。
检索增强生成
针对这些问题,百度设计了一套检索增强生成(RAG)方案并已落地。它通过结合搜索引擎检索到的信息,来缓解大模型可能出现的问题,提高答案的准确性、及时性和可信度。流程分四步:先文档检索,获得多样的参考来源;再从文章里提取关键信息,减轻生成模型的负担;然后根据检索到的信息构建问答,并标明来源;最后把提示词输入大模型,生成最终结果。
检索生成大模型训练
百度还对模型做了针对问答场景的精调。第一阶段是通用预训练,用海量网络文本和特定领域的资料来构建通用知识基础。第二阶段进行指令微调,让模型更懂指令。第三阶段是标注业务指令微调,引入搜索问答场景里处理复杂问题的具体指令。第四阶段则根据用户互动反馈进行微调,用强化学习等方法提升答案的准确性和相关性。
思维链(CoT)技术
面对复杂的指令挑战,百度还引入了思维链(Chain of Thought)的概念,把复杂指令拆成几个简单的步骤来逐步处理:先从搜索结果里筛出能回答问题的内容;再据此组织生成答案;最后给答案编号,标出引用来源。这个方法减少了对大量复杂指令样本的依赖,提升了模型处理实际复杂场景的效果和准确性。
360AI搜索
360AI搜索是2024年3月正式上线的,自称为“新一代智能答案引擎”。它会分析用户问题,如果问题有歧义或缺失关键信息,会主动追问补充。它会将复杂问题分解成多组关键词进行检索,然后深度阅读网页内容,最终生成逻辑清晰的答案。
产品形态
通过so.360.com就能体验。除了有类似微软和百度的总结+出处功能外,360AI搜索还提供答案改写、自动生成脑图、更详细的相关内容和参考链接。
周鸿祎提到,搜索还是用户的刚需,但传统搜索有几个问题:关键词得准确,不然结果差很多;得一个一个点开链接看;还得自己归纳总结。他认为大模型最先碘伏的应该是搜索,因为搜索从90年代到现在都没变过。有了AI,搜索就能变成个人智能助理。
工作原理
360AI搜索的处理流程大致是:先分析问题,如果发现有歧义就问用户;然后把复杂问题分解成多个关键词,到数百万个网页中检索;接着从匹配的几十个网页中提取内容;最后生成逻辑清晰的答案。不过,如果只是想找一个特定的官网链接,360AI搜索的效果反而不太好。这正好对应了微软内部讨论过的“两个流派”的问题——意图明确时,传统搜索可能更直接有效。从这个角度看,微软的处理方式更漂亮。
根据周鸿祎的说法,360AI搜索背后用了5个不同的小模型分工合作,包括搜索、翻译、阅读理解、脑图生成等(这其实就是多Agents协作的思路),每个模型都是百亿级参数,在成本和速度上都比千亿级大模型有优势,是用场景来驱动设计。
新的杀手:Perplexity
Perplexity自称是“世界上首个对话式搜索引擎”,目标就是想挑战谷歌。它成立于2022年8月,没自己研发大语言模型,而是用了GPT等模型的接口做微调,想做一个没有广告的“谷歌搜索”。Perplexity就像一个特别聪明的朋友,能快速从网上给你找信息和总结。你问它一个问题,它不会给一堆链接,而是用AI理解你的问题,搜索大量网页,然后把相关整合成一个清晰、简洁的答案,就像在和你对话一样。
它的核心思想是:搜索信息应该是一种简单、高效的体验,不应该被广告驱动。虽然这已经不是第一次有人试图用类似策略取代谷歌了(比如Neeva最终就失败了),但Perplexity有自己的特点:每一句话都附有引用链接,保证可靠性,方便用户溯源和深入验证。本质上是在标“可信度”。除了回答,它还支持后续问题、搜索视频、生成图像。用户还可以自定义AI配置文件来调整语言、输出格式和语气。
最后
当然,市面上还有不少其他产品,比如昆仑万维的天工AI搜索、智谱清言的AI搜索、谷歌的搜索生成体验(SGE)等,有兴趣可以自行研究。类似Perplexity这样的产品,代表了信息和交互方式的范式转变。它让用户能轻松找到答案,探索新可能,增强对世界的理解。通过拥抱AI和优化用户体验,它们有望改变搜索格局,开启知识发现的新时代。
不过,前景虽然光明,但目前大模型+搜索领域还面临一些挑战:缺乏从0到1的产品形态突破,限制了在用户心中的影响力;普通用户对搜索体验的提升感知不明显,主要还只是专业工具;商业化路径还不清晰。未来的探索需要在如何整合广告、个性化推荐等商业模式与大模型技术之间找到新的平衡点。
参考资料:
- https://www.jiqizhixin.com/articles/2023-10-30-6
- https://mp.weixin.qq.com/s/cTfkanfqJLqxKvbIIKL2xg
- https://www.zdnet.com/article/what-is-copilot-formerly-bing-chat-heres-everything-you-need-to-know/
- https://www.microsoft.com/en-us/bing?ep=0&form=MA13LV&es=31
- https://support.microsoft.com/en-au/topic/how-bing-delivers-search-results-d18fc815-ac37-4723-bc67-9229ce3eb6a3
- https://blogs.microsoft.com/blog/2023/02/07/reinventing-search-with-a-new-ai-powered-microsoft-bing-and-edge-your-copilot-for-the-web/
- https://mp.weixin.qq.com/s/ZWKMT4z0lgQrOHtSBjJ5ZA
- https://mp.weixin.qq.com/s/9gRQwWFn5Ly9QW6MySUGfQ
- https://ahrefs.com/blog/zh/google-pagerank/
- https://time.geekbang.org/column/article/222807
- https://dmthought.com/search-engine-working-principle/
- https://cloud.tencent.com/developer/article/2255169
- https://zhuanlan.zhihu.com/p/608308322
- https://blogs.bing.com/search-quality-insights/february-2023/Building-the-New-Bing
- https://searchengineland.com/microsoft-bing-explains-how-bing-ai-chat-leverages-chatgpt-and-bing-search-with-prometheus-393437
- https://jiandan.baidu.com/
- https://mp.weixin.qq.com/s/rwCJ7HjTAiJA4iIoDw9Ztw
- https://mp.weixin.qq.com/s/dwrwjuuJVl8J67KGF84zKw
- https://browser.360.cn/ai/
- https://ai.360.com/
- https://mp.weixin.qq.com/s/rANopuBw38bATILDZhaKow
- https://www.perplexity.ai/hub/faq/how-does-perplexity-work
- https://blog.hubspot.com/ai/perplexity-the-ai-search-engine
- https://www.quora.com/How-does-Perplexitys-search-tool-work
- https://www.elegantthemes.com/blog/business/perplexity-ai
- https://m.jiemian.com/article/10474939.html
- https://blog.google/products/search/search-labs-ai-announcement-/
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名