概览
Qwen-Image 围绕图像生成和图像编辑提供不同模型。仓库给出了 Qwen-Image-2512 的文字生成图片示例,以及 Qwen-Image-Edit-2511 的多参考图编辑示例。使用时应先区分从零生成和在已有图片上修改:前者输入场景与构图描述,后者同时输入参考图与编辑指令。主页的产品新闻与已提供下载示例的模型是两个层面,部署时以具体检查点及其模型卡为准。
主要功能
- 支持中文及其他文字的图像生成场景。
- 提供文本生成图片的独立管线。
- Edit-2511 示例支持多个参考图片。
- 支持提示词、种子与推理步数配置。
- 提供多个宽高比的生成示例。
- 支持 Diffusers 集成与本地演示扩展。
要求、安装和快速入门
1. 准备独立 Python、PyTorch 环境及模型存储空间。
2. 按 README 安装兼容 Transformers,并执行 pip install git+https://github.com/huggingface/diffusers。
3. 文生图使用 QwenImagePipeline 加载 Qwen/Qwen-Image-2512。
4. 编辑使用 QwenImageEditPlusPipeline 加载 Qwen/Qwen-Image-Edit-2511。
5. 为所选管线配置设备、精度、图片大小和随机种子。
6. 从官方最小示例生成一张图片,再替换自己的提示词或参考图片。
2. 按 README 安装兼容 Transformers,并执行 pip install git+https://github.com/huggingface/diffusers。
3. 文生图使用 QwenImagePipeline 加载 Qwen/Qwen-Image-2512。
4. 编辑使用 QwenImageEditPlusPipeline 加载 Qwen/Qwen-Image-Edit-2511。
5. 为所选管线配置设备、精度、图片大小和随机种子。
6. 从官方最小示例生成一张图片,再替换自己的提示词或参考图片。
用法
制作商品宣传图时,把商品名称、画面布局、文字内容及文字位置分别写清楚,先生成一张基础图。已有产品摄影则走编辑管线,说明需要更换的背景和必须保留的主体。输出后检查商标、文字拼写、产品结构和参考图一致性;同一系列素材保留种子与参数,便于迭代。
实施要点
图中文字仍可能出错,多图编辑也需要核对主体和位置是否准确。复杂任务宜一次只改变少量要求,保存中间结果;接入生产服务前应记录显存峰值、平均耗时和失败重试方式。
实施要点
图中文字仍可能出错,多图编辑也需要核对主体和位置是否准确。复杂任务宜一次只改变少量要求,保存中间结果;接入生产服务前应记录显存峰值、平均耗时和失败重试方式。
模型兼容性与使用场景
生成示例提供 CPU 与 CUDA 路径,但大型权重的内存和运行时间仍需评估;官方编辑示例使用 CUDA 与 bfloat16。量化或卸载属于不同部署配置,不应把社区某一低显存方案当成全部模型的默认要求。
许可证与风险说明
官方 README 将 Qwen-Image 标为 Apache-2.0;具体权重、依赖和输入素材仍应按各自条款使用。