首页 > 教程攻略 > ai资讯 >腾讯AI团队创建十亿个Persona用作多元化合成数据

腾讯AI团队创建十亿个Persona用作多元化合成数据

来源:互联网 时间:2026-08-16 14:16:48

训练大模型,海量数据是关键。如今,合成数据已成为弥补真实数据不足、甚至未来可能占据主导地位的核心燃料。如何高效、多样地创造这些数据,是整个行业持续探索的方向。

最近,腾讯AI实验室发布的一篇论文《Scaling Synthetic Data Creation with 1,000,000,000 Personas》,为此提供了一种颇具想象力的新思路:用十亿个虚拟人物角色,来规模化生成合成数据。

合成数据的背景与挑战

合成数据对于大语言模型的训练和优化至关重要。目前的主流方法是设计提示词,让模型自我生成数据。但这种方法存在明显瓶颈:生成的数据往往多样性不足,质量也难以在规模化生产中保持稳定。当需要覆盖成千上万种场景和视角时,简单的提示工程就显得捉襟见肘了。

正是为了解决这个规模化与多样性难题,研究团队提出了“人物角色”这一核心概念。他们构建了一个名为“Persona Hub”的巨型角色仓库,里面自动收集了多达10亿个虚拟人物,涵盖了从“搬家公司司机”到“科学研究员”再到“独立音乐家”等形形色色的身份。这些角色不再只是标签,而是承载了不同背景、知识和视角的载体,由此可以驱动大模型生成前所未有般丰富的合成数据。

Persona Hub的创新与构建方法

Persona Hub本质上是一个超大规模的虚拟角色集合。它的构建并非靠人工编写,而是通过两种自动化方法从网络数据中“挖掘”和“衍生”而来。

方法一:从文本到角色

这种方法直接从海量网络文本中“提取”角色。具体分为三步:首先,收集各类文本,如新闻报道、学术论文、博客文章等;接着,利用大模型分析这些文本,根据其内容、语言风格和主题,推断背后可能存在的作者或相关人物特征;最后,基于这些特征,生成包含职业、兴趣、价值观等维度的详细角色描述。这就好比从互联网的“记忆”中,复活了无数个鲜活的个体。

方法二:从角色到角色

仅仅从文本提取还不够,现实中许多角色(如儿童、特定职业的幕后人员)在公开文本中曝光度很低。为此,研究团队采用了“角色衍生”法。以上述方法生成的“源角色”为基础,通过推断其可能拥有的社会关系(如家人、朋友、同事),来创造出与之关联的新角色。例如,从一位“电影导演”角色,可以衍生出他的“摄影师”同事或“场记”助手。这种方法极大地扩展了角色库的覆盖面和真实性。

如何利用Persona Hub创建合成数据?

当十亿级别人物角色的仓库准备就绪,下一步就是将它们转化为生产力。研究者的做法很直接:将这些精细定义的角色描述,作为关键变量插入到数据生成的提示词模板中。这样一来,大模型在生成每一条数据时,都会从一个特定角色的视角和知识背景出发。

论文展示了这种方法的强大适用性,它能在多个场景下批量生成高度多样化的数据:

  • 数学与逻辑推理题:

    生成具有挑战性的题目,并能关联角色背景(如为“语言学家”生成计算语言学相关的数学问题)。
  • 用户指令:

    模拟不同身份用户可能提出的千变万化的请求。
  • 知识型文本:

    创造涵盖各领域的教育性或信息性内容。
  • 游戏NPC:

    为游戏设计提供拥有丰富背景故事的非玩家角色。
  • 工具与功能开发:

    针对特定角色需求,预制相应的工具或功能描述。

一个具体示例:生成数学题目

这个过程非常直观。例如,当你指定使用一个“对计算语言学感兴趣的语言学家”角色时,大模型生成的数学问题就会自然地向该领域靠拢。更重要的是,角色约束并不妨碍你进一步指定题目的具体类型或难度。你完全可以要求:“基于这个语言学家人设,生成一道奥林匹克级别的几何难题。” 模型会巧妙地将角色背景与题目要求融合起来。

潜在影响与未来展望

Persona Hub的出现,标志着合成数据生成迈向了一个新阶段。它的价值远不止于提升大模型训练数据的规模和多样性。可以预见,这项技术将在多个领域产生涟漪效应:

对于聊天机器人和虚拟助手,能够基于连续、丰满的角色记忆进行对话,使其回应更具一致性和合理性;在游戏和虚拟现实领域,能瞬间生成大量有深度的背景角色;在社会科学研究或产品测试中,可以模拟复杂多元的人类群体行为。

更重要的是,它为AI提供了一个理解和服务于“人”的丰富图谱。未来的大模型,或许不仅能回答问题,还能理解这个问题背后站着怎样一个具体的人。这无疑让合成数据的世界,变得更像真实世界了。