首页 > 教程攻略 > ai资讯 >腾讯混元 DiT 推出6G小显存版本,接入Kohya

腾讯混元 DiT 推出6G小显存版本,接入Kohya

来源:互联网 时间:2026-08-16 13:50:14

对于手头只有6G显存、想在本地跑文生图模型的开发者来说,腾讯混元DiT最近的动作确实值得关注——他们专门推出了一个小显存版本,让显卡门槛直接降到了6G。这意味着,普通个人电脑也能跑起来,再也不用盯着云端服务器的高昂账单发愁了。更关键的是,这个版本已经和LoRA、ControlNet等常用插件一起适配到了Diffusers库中,从训练到应用开发,整个流程都顺手了不少。

与此同时,混元DiT模型本身也升级到了1.2版本,在图片的质感和构图层面有了肉眼可见的提升。而真正让人眼前一亮的,是腾讯同时开源了一个叫作“混元Captioner”的打标模型。这个模型支持中英文双语,且专门针对文生图场景做了优化。说白了,它能帮开发者快速做出高质量的文生图数据集——这对整个社区的帮助是根本性的,因为数据集的质量直接决定了最终生成效果的好坏。

混元Captioner的一个显著特点是:它对中文语义的理解和表达比同类模型更到位,输出的图片描述也更加结构化、完整和准确。训练这个模型时,团队注入了人工标注、模型输出、公开数据等多种来源,还融入了大量背景知识,比如知名文学作品形象、地标、食物、动物、中国元素等。这些细节上的积累,让打标模型在描述图片时不会“失语”或“乱跳”,尤其对中文场景下的文化细节把握得很准。

在降低使用门槛这件事上,混元团队也下了不少功夫。除了推出小显存版本,他们还和Hugging Face合作,把LoRA、ControlNet这些插件都接入了Diffusers库。现在开发者调用模型及其插件,只要三行代码就能搞定——这比早期折腾各种环境配置要省心太多了。

另外,混元DiT还接入了Kohya。这个开源工具以图形化界面闻名,被广泛用于轻量化的微调训练。对于不熟悉代码的开发者来说,现在可以直接通过Kohya的界面完成全参精调或LoRA训练,完全不用碰命令行。门槛降到了“点几个按钮”的程度。

数据质量方面,腾讯混元团队开放了更多关键技术,包括之前训练用的代码,以及最新的打标模型混元Captioner。开发者拿到原始图片集后,用这个打标模型就能快速生成高质量的标注,自动过滤无关信息,还能优化图片描述。这相当于给每个开发者配了一个专业的“数据助手”。

作为国内首个中文原生的DiT开源模型,混元DiT从全面开源以来,一直在持续建设生态。今年6月,他们发布了专属加速库,把推理效率提升了不止一个档次——生图时间缩短了75%。同时进一步开源了推理代码,更新了LoRA和ControlNet插件。现在用户可以通过Hugging Face Diffusers直接调用模型,也能基于Kohya或ComfyUI这类图形化界面来训练和使用。整个生态的易用性,已经和早期不可同日而语了。