首页 > 教程攻略 > ai资讯 >【LLM】使用大模型撰写类似维基百科的文章

【LLM】使用大模型撰写类似维基百科的文章

来源:互联网 时间:2026-08-01 14:31:28

这几年,大模型(LLM)的应用可以说是百花齐放,但要说真正考验功力的,还得是长篇、有深度的解说性写作——就像维基百科那样,既要知识全面,又要结构清晰。这事儿听起来容易,做起来相当棘手。因为它不光考验模型的“文笔”,更考验它“做功课”的能力:得先研究、再规划,最后才能动笔。而大部分现有的研究,恰恰跳过了这个最费脑子的“写作前准备”阶段。

这项研究提出的STORM系统,正是为了解决这一挑战。简单来说,STORM的目标是让大模型像一位资深编辑一样,从零开始,自动完成一篇维基百科风格文章的所有前期准备工作。

一、核心结论:方向对了,但路还很长

论文的核心贡献在于,它不只提出了STORM这个自动化写作前准备系统,还为此专门构建了一个名为FreshWiki的数据集,并建立了一套评价标准来检验生成的文章是否有据可查。

实验结果是令人振奋的。研究表明,STORM独创的“问题提出机制”,能显著提升文章大纲和最终成文的质量,尤其是在内容的广度和深度上,表现优于传统的基线方法。接受评审的经验丰富的维基百科编辑们也普遍认为,STORM在“写作前准备”这个环节,确实能派上用场。

当然,冷静下来看,差距也是明显的。尽管STORM在自动评估和人工评估中都超越了基线,但机器生成的文字,距离经过人类精心打磨的文章,尚有差距。特别是在中立性和可验证性方面,机器写的文章时不时会露出马脚。举例来说,STORM虽然能挖掘出不同的视角,但它所收集的信息,还是会受到互联网上“主流声音”的影响,甚至可能夹带一些“软广”性质的内容。这恰恰是未来需要重点攻克的方向。

二、拆解STORM:它到底是怎么工作的?

想把一个复杂问题说清楚,拆解开来研究是最有效的。研究者们把“从零开始写一篇维基百科文章”这个大问题,分成了两个小任务:首先是“研究”,即生成一个多层次的文章大纲并搜集参考文献;其次是“写作”,基于大纲和参考文献来撰写全文。这个思路,本身就是对人类写作过程的一种高度模拟。

2.1 方法的核心:两个假设驱动下的多阶段流程

STORM的设计基于两个很有趣的假设:第一,看问题的角度不同,问出来的问题自然也不同;第二,要想问出有深度的问题,就得像滚雪球一样,不断地迭代研究。基于此,STORM设计了一套多阶段的“组合拳”。

它先是通过检索和分析相似主题的维基百科文章,来发现不同的“视角”。然后,它让大模型带着这些特定视角去提问。为了进一步深挖,STORM会模拟一场多轮对话,对话中的“专家”会根据互联网上的信息来回答模型提出的问题。最后,模型整合它自己的“内存知识”和搜集来的外部信息,创造出一个大纲,再根据这个大纲逐章扩展,最终生成一篇完整的文章。

2.2 数据集与评估:设置一个公平的“擂台”

为了验证STORM的真实水平,论文团队做了几件很扎实的事。

首先,他们策划了FreshWiki数据集。这个数据集的巧妙之处在于,它收录的都是近期创建或有过大量编辑的维基百科文章。这样一来,就能最大程度地避免“数据泄露”问题——即测试用的文章模型在训练时早就“背下来”了,这对评估没有意义。

其次,他们设计了一套相当严谨的自动评估指标。评估内容不只包括大纲的“覆盖率”(通过标题软召回和实体召回率来衡量),还包括全文的ROUGE分数、实体召回率,甚至请来了一个13B的评估器LLM(Prometheus),从有趣程度、连贯性、相关性、覆盖面、可验证性五个维度给文章打分。

最后,他们还找来了10位经验丰富的维基百科编辑做专家评审,这是评价内容质量的“金标准”。

2.3 实验与结果:有惊喜,也有新发现

在实验中,STORM和三个基线模型进行了对比:直接让LLM生成的Direct Gen、标准检索增强生成(RAG)以及大纲驱动的检索增强生成(oRAG)。结果很能说明问题。

大纲质量是胜负手。

实验数据显示,STORM生成的大纲在召回率上显著高于其他方法。有意思的是,在没组织的上下文窗口里塞进大量信息(比如RAG),反而会让较弱的模型(GPT-3.5)在生成大纲时表现下降。这说明,如何组织信息,比单纯堆砌信息更重要。STORM通过“提问”来有效研究主题,显然更胜一筹。

消融实验验证了设计的有效性。

研究人员还做了消融实验,分别去掉了“视角发现”和“多轮对话”这两个模块。结果一目了然:完整版STORM的大纲质量最好。去掉对话模块的效果尤其差,这再次证明,“阅读相关信息”是生成有效问题的前提。

三、来自一线编辑的评价:优点与不足同样鲜明

为了更客观地评估,研究者们请来10位在维基百科上至少有500次编辑的资深用户,对STORM和最佳基线oRAG生成的文章进行盲评。评价尺度也从自动评估的5分制,升级到了更细致的7分制。

优势:内容和组织。

编辑们普遍认为,STORM生成的文章比oRAG的输出更具趣味性、组织性更好,覆盖面也更广。甚至有编辑称赞STORM的文章“提供了更多背景信息”,感觉它比一些维基百科原文还“更有深度”。

劣势:中立性与准确性。

然而,差距也是显著的。编辑们一致指出,机器写的文章信息量不如真正的维基百科页面。更关键的问题是,7位编辑都提到,STORM的文章听起来“情绪化”或“不中立”,这显然是受到了互联网来源偏差的影响。此外,模型偶尔还会“虚构”一些无关事实之间的关联。

定位:它是优秀的起点,而非完美的终点。

令人欣慰的是,所有参与评估的编辑都一致认为,STORM是一个非常有用的“写作前准备工具”。80%的编辑认为它能帮自己为一个新主题编写维基百科文章。这个反馈很关键:它证明这项研究的价值不在于替代人类,而在于赋能人类,把最耗费心力的“研究”和“规划”工作自动化,让人类可以把精力集中在“创作”和“修订”上。

总的来说,STORM是一个精彩的起点。它第一次系统性地解决了大模型在长文写作中“研究”环节的缺失问题。虽然它在探究深度和避免偏见方面还有很长的路要走,但它无疑为“有根据的写作系统”开辟了一个充满希望的前沿方向。未来的工作,也许就在于如何让模型在“做研究”时,既能海纳百川,又能去伪存真,保持一份冷静与中立。