通义千问开源 Qwen-Image-2.1:7B 参数实现文生图与图像编辑一体化 AIbase基地 发布于 AI新闻资讯 · 1

分钟阅读 · Sep 21, 2026 25 9月21日,通义千问团队正式开源新一代图像模型 Qwen-Image-2.1。该模型以仅7B 参数的轻量视觉生成模块,将文生图、透明图像生成与多种图像编辑能力整合于同一框架,在生成效果、推理效率与使用成本之间取得了新的平衡。 据官方介绍,Qwen-Image-2.1的视觉生成部分采用32层 Single-Stream DiT 结构,参数量仅为7B。

通过混合粒度注意力结构与 KV Cache 复用机制,模型在多图输入场景下的推理效率显著提升,显存开销也得到有效控制。 透明图像生成是本次更新的核心亮点之一。模型能够根据提示词自动判断输出普通图像或带透明通道的 RGBA 图像,并支持在保留透明背景的前提下进行主体表情修改、文字编辑等操作。

用户还可输入真实照片,由模型自动提取主体并输出透明图层,方便后续设计与合成。 可以在保留透明背景的同时修改主体表情 透明图层中的文字同样可以进行编辑,如下面的示例将文字“BLOOM”修改为“Qwen-Image”: 在图像编辑方面,Qwen-Image-2.1支持最多10张参考图输入,可综合多个主体与素材生成协调画面。局部编辑支持圈选、涂抹和独立掩码三种方式,编辑区域指定更加灵活。

模型还重点提升了人像与商品的一致性——修图后人物面部特征、商品文字与形态均能保持高度还原。 此外,模型在文字渲染、人物光影与细节刻画上也有明显提升,覆盖全景图、信息图、分镜图等多种任务场景。目前,Qwen-Image-2.1已同步在 GitHub、ModelScope 和 Hugging Face 等平台开源,供开发者与创作者免费使用。 Qwen-Image-2.1 通义千问 图像模型 AI新词 本文来自AIbase日报 扫码查看 欢迎来到【AI日报】栏目!

这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。 —— 由AIbase 日报组创作 © 版权所有 AIbase基地 2024, 点击查看来源出处