【LLM】使用大模型撰写类似维基百科的文章
这几年,大模型(LLM)的应用可以说是百花齐放,但要说真正考验功力的,还得是长篇、有深度的解说性写作——就像维基百科那样,既要知识全面,又要结构清晰。这事儿听起来容易,做起来相当棘手。因为它不光考验模型的“文笔”,更考验它“做功课”的能力:得先研究、再规划,最后才能动笔。而大部分现有的研究,恰恰跳过了这个最费脑子的“写作前准备”阶段。
这项研究提出的STORM系统,正是为了解决这一挑战。简单来说,STORM的目标是让大模型像一位资深编辑一样,从零开始,自动完成一篇维基百科风格文章的所有前期准备工作。
一、核心结论:方向对了,但路还很长
论文的核心贡献在于,它不只提出了STORM这个自动化写作前准备系统,还为此专门构建了一个名为FreshWiki的数据集,并建立了一套评价标准来检验生成的文章是否有据可查。
实验结果是令人振奋的。研究表明,STORM独创的“问题提出机制”,能显著提升文章大纲和最终成文的质量,尤其是在内容的广度和深度上,表现优于传统的基线方法。接受评审的经验丰富的维基百科编辑们也普遍认为,STORM在“写作前准备”这个环节,确实能派上用场。
当然,冷静下来看,差距也是明显的。尽管STORM在自动评估和人工评估中都超越了基线,但机器生成的文字,距离经过人类精心打磨的文章,尚有差距。特别是在中立性和可验证性方面,机器写的文章时不时会露出马脚。举例来说,STORM虽然能挖掘出不同的视角,但它所收集的信息,还是会受到互联网上“主流声音”的影响,甚至可能夹带一些“软广”性质的内容。这恰恰是未来需要重点攻克的方向。
二、拆解STORM:它到底是怎么工作的?
想把一个复杂问题说清楚,拆解开来研究是最有效的。研究者们把“从零开始写一篇维基百科文章”这个大问题,分成了两个小任务:首先是“研究”,即生成一个多层次的文章大纲并搜集参考文献;其次是“写作”,基于大纲和参考文献来撰写全文。这个思路,本身就是对人类写作过程的一种高度模拟。
2.1 方法的核心:两个假设驱动下的多阶段流程
STORM的设计基于两个很有趣的假设:第一,看问题的角度不同,问出来的问题自然也不同;第二,要想问出有深度的问题,就得像滚雪球一样,不断地迭代研究。基于此,STORM设计了一套多阶段的“组合拳”。
它先是通过检索和分析相似主题的维基百科文章,来发现不同的“视角”。然后,它让大模型带着这些特定视角去提问。为了进一步深挖,STORM会模拟一场多轮对话,对话中的“专家”会根据互联网上的信息来回答模型提出的问题。最后,模型整合它自己的“内存知识”和搜集来的外部信息,创造出一个大纲,再根据这个大纲逐章扩展,最终生成一篇完整的文章。
2.2 数据集与评估:设置一个公平的“擂台”
为了验证STORM的真实水平,论文团队做了几件很扎实的事。
首先,他们策划了FreshWiki数据集。这个数据集的巧妙之处在于,它收录的都是近期创建或有过大量编辑的维基百科文章。这样一来,就能最大程度地避免“数据泄露”问题——即测试用的文章模型在训练时早就“背下来”了,这对评估没有意义。
其次,他们设计了一套相当严谨的自动评估指标。评估内容不只包括大纲的“覆盖率”(通过标题软召回和实体召回率来衡量),还包括全文的ROUGE分数、实体召回率,甚至请来了一个13B的评估器LLM(Prometheus),从有趣程度、连贯性、相关性、覆盖面、可验证性五个维度给文章打分。
最后,他们还找来了10位经验丰富的维基百科编辑做专家评审,这是评价内容质量的“金标准”。
2.3 实验与结果:有惊喜,也有新发现
在实验中,STORM和三个基线模型进行了对比:直接让LLM生成的Direct Gen、标准检索增强生成(RAG)以及大纲驱动的检索增强生成(oRAG)。结果很能说明问题。
大纲质量是胜负手。
消融实验验证了设计的有效性。
三、来自一线编辑的评价:优点与不足同样鲜明
为了更客观地评估,研究者们请来10位在维基百科上至少有500次编辑的资深用户,对STORM和最佳基线oRAG生成的文章进行盲评。评价尺度也从自动评估的5分制,升级到了更细致的7分制。
优势:内容和组织。
劣势:中立性与准确性。
定位:它是优秀的起点,而非完美的终点。
总的来说,STORM是一个精彩的起点。它第一次系统性地解决了大模型在长文写作中“研究”环节的缺失问题。虽然它在探究深度和避免偏见方面还有很长的路要走,但它无疑为“有根据的写作系统”开辟了一个充满希望的前沿方向。未来的工作,也许就在于如何让模型在“做研究”时,既能海纳百川,又能去伪存真,保持一份冷静与中立。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名