沐曦9月20日发布Qwen-Image-2.1的Day-0适配消息,介绍该模型的图像生成、透明图与多图编辑能力。官方材料称视觉生成部分为7B参数,并采用差异化注意力与缓存复用优化。对于希望在国产GPU上部署设计工具的企业,这增加了可测试的模型选择。

7B指的是视觉生成部分

图像服务可能包含文本编码、图像编码、生成网络、解码器与运行缓存。视觉生成部分参数较小,有利于降低其中一部分权重成本,但整套管线的显存不能只按7B估算。具体模型打包方式、精度与组件驻留策略,都要以实际加载结果核对。

生图任务还与分辨率、采样步骤和输入图数量强相关。较高分辨率意味着更多视觉Token与中间激活;多图编辑需要编码并保留更多参考信息。因此应分别测纯文本生图、单图编辑和多图编辑,而不是共用一个宣传速度。

透明图让交付格式更重要

透明图适合商品抠图、界面素材与图层合成,但“看起来有棋盘格”不代表文件拥有透明通道。上线验收应检查PNG或WebP的alpha通道、边缘半透明、背景残留和合成到不同底色后的效果。

应用还应保留生成原文件。若后处理强制转为JPEG,透明信息会丢失;若缩略图生成器使用白底压平,列表预览与下载结果可能不一致。格式检查必须贯穿存储、预览和下载。

多图编辑需要评价保真与指令执行

参考图可以提供商品、人物、布局与风格,模型必须理解它们各自的角色。评测可分别检查是否修改了指定区域、未修改区域是否稳定、商品文字和纹理是否被破坏,以及多参考图之间有没有错配。

测试集应包含同一商品不同角度、复杂背景和多个相似对象。不要只选成功样张;保留原图、提示词、种子、步骤与结果,才能比较模型版本。对于面向商品展示的用途,关键细节应人工复核。

国产GPU服务怎样安排资源

建议先锁定驱动、MXMACA、推理框架与模型版本,验证输出正确性,再优化精度和批量。图像任务通常耗时较长,服务需要队列、并发上限、超时、取消与失败重试机制,避免用户重复点击产生多个昂贵任务。

验收记录每种分辨率和图像输入数量下的峰值显存、单图耗时、队列等待与成功率。吞吐比较应保持采样步骤和质量要求一致。厂商适配说明模型已可进入国产平台测试,实际采购仍以目标工作流的结果和资源成本为依据。

一个可落地的试点方向

编辑建议可以从企业内部素材加工试点:上传已获授权的产品图,执行背景替换、局部修改与透明图导出,再由设计人员复核。该示例属于试点建议,并非本站或厂商的客户实测案例;它的价值应通过人工返工率、总用时和合格素材成本衡量。

来源、翻译与版权说明

来源:沐曦官方新闻。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。

原文语言
ZH-CN
原文更新时间
2026-09-20
许可证
未登记