MATEval:一个用于推进开放式文本评估的Multi-Agent讨论框架
来源:互联网
时间:2026-07-31 13:24:24
生成式大语言模型这两年火得不行,但怎么评估它们生成的文本质量,尤其是那种开放式的输出,一直是个老大难问题。传统的手动评估费时又烧钱,而BLEU、Rouge、METEOR这些自动化指标在开放式场景下更是捉襟见肘。最近大家开始尝试让LLM自己当裁判,可这玩意儿不确定性太大,翻车也是常有的事。

为了解决这些痛点,MATEval框架被提了出来——一个多智能体文本评估框架,核心思路是模拟人类协作讨论的方式,让几个智能体你一言我一语地给文本打分。
多智能体文本评估框架
MATEval框架里主要有三个角色:评估智能体、反馈智能体和总结智能体。它们各司其职,一起把评估任务搞定。整个流程融合了自我反思、思维链(CoT)、反馈机制,最后再出一份总结报告。下面拆开看每个部分:
- :这是主审官,负责多轮评估。它通过精心设计的提示词引导工作,同时会记录和处理其他智能体的意见,不断更新对话历史。
评估智能体(Evaluator Agent)
- :每轮讨论结束后,它会跳出来审视讨论的质量,专门揪出那些低效对话和分歧点,并提出改进建议,好让后续讨论少走弯路、更快达成共识。
反馈智能体(Feedback Agent)
- :所有讨论完成后,它负责把整个过程和结果整理成详细的评估报告,包括错误类型、具体位置、解释和得分,一目了然。
总结智能体(Summarizer Agent)
- :每轮讨论中,智能体都会想想同伴说了啥,吸收进来丰富自己的理解,再调整自己的表述。
自我反思(Self-reflection)
- :通过提示引导智能体把问题拆开,每轮只盯住一个子问题深入分析,避免胡子眉毛一把抓。
思维链(Chain-of-Thought, CoT)策略
- :每轮讨论结束,反馈智能体根据提示总结讨论情况,指导下一轮减少重复,提高效率,还能引导大家往共识上靠。
反馈机制
- :MATEval提供两种报告样式:一种是问答(Q&A)格式,方便算相似度和相关性分数;另一种是纯文本报告格式,业务人员拿过来就能快速理解并迭代模型。
输出格式
为了验证效果,MATEval在两个英文故事数据集(ROCStories和WritingPrompts)和两个中文故事数据集(LOT和Ant)上做了实验。结果很亮眼:
MATEval在评估LLM生成文本方面全面优于现有开放式文本评估方法,并且与人类评估的相关性最高
下面两张图分别展示了在不同模型和MATEval策略下,评估结果与人类判断的相关性数据(SA代表单智能体,SR表示自我反思,CoT代表思维链,ρ/τ分别表示斯皮尔曼/肯德尔相关性,粗体是最高值)。
不同模型和MATEval不同策略在ROC/WP数据集上的评估结果与人类判断的相关性

不同模型和MATEval不同策略在LOT/Ant数据集上的评估结果与人类判断的相关性

论文原文:MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名