首页 > 教程攻略 > ai资讯 >好玩!腾讯开源个人肖像生成器PhotoMaker迎来更新

好玩!腾讯开源个人肖像生成器PhotoMaker迎来更新

来源:互联网 时间:2026-08-22 14:31:44

腾讯开源的PhotoMaker最近迎来了一次值得关注的更新。这个工具用上了所谓的“堆叠ID”技术,核心任务就是生成那种既逼真又能随意定制的个人肖像。简单来说,你给它一段文字描述,它就能造出对应的人物形象;你给它几张不同人的照片,它还能把这些特征揉在一起,创造出一个全新的人物。更有意思的是,它甚至可以改变照片里人物的性别或者年龄,还能生成各种风格的照片,而且效果相当自然、速度也快。一句话概括:以前要搞定“高效、保真、灵活控制”这三个目标,几乎是不可能三角,但PhotoMaker确实把这把火点着了。

现有的个性化生成方法,要么效率低,要么身份信息丢了,要么文本控制不灵活。PhotoMaker的解法是把多个输入ID图像编码成一个“堆栈式ID嵌入”,这样既保住了身份信息,又把同一个ID的各种特征全打包进去了。更妙的是,它还能整合不同ID的特征,灵活性一下就上来了。除此之外,团队还设计了一套面向ID的数据构建管道,专门用来组装训练数据。相比那些需要在测试时做微调的方法,它在ID保真度上明显占优,而且生成质量高、泛化能力强,适用范围相当广。

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3572478090212950018"></iframe>

实现原理

先从文本编码器和图像编码器那里分别拿到文本嵌入和图像嵌入。比方说,拿训练集中一位男士的头像去生成图像嵌入,描述为“一个男士的图像”;再从训练语料生成文本嵌入,描述为“男士带着蓝色帽子”,像“穿着西装,打着领带,翻领上有徽章”这类细节。接下来,把所有融合过的嵌入沿长度维度拼接起来,就形成了堆叠ID嵌入——其实就相当于用Concat合并特征。最后,把这个堆叠ID嵌入喂给交叉注意力层,扩散模型就会自适应地把ID内容融进去。有意思的点是:训练时用的是掩蔽背景的同一ID图像,但推理时可以直接输入不同ID的图像,不会出现背景失真,还能创建新ID——这意味着PhotoMaker具备脱离背景、独立创造新图像的能力。升级到V2版本后,V1的生成质量、可编辑性和插件兼容性一点没丢,还增加了与ControlNet、T2I-Adapter和IP-Adapter集成的脚本,控制能力直接拉满。

具体样例

通过文字描述,就能精准捕捉单个ID的细微特征,然后完成角色重塑。

将艺术品或老照片中的人物带入现实,通过输入艺术画作、雕塑或人物老照片。

PhotoMaker不仅能生成逼真的人体照片,还允许在保留ID属性的前提下做风格化处理。只要简单替换类别词(比如把“男人”换成“女人”),它就能在保持原始身份的同时,改变性别或年龄。如果用户提供不同ID的图像作为输入,它还能很好地融合这些特征,形成一个全新ID。至于身份混合的比例,可以通过控制输入图像池中身份图像的百分比,或者用提示加权的方法来调整。跟其他方法一比,PhotoMaker在生成质量、多样化能力、可编辑性、推理效率和ID保真度这几个维度上,全都站住了脚。