Qwen-Image-3.0 发布:追求实用的图像生成

Qwen-Image-3.0 发布:追求实用的图像生成

QwenTeam 发布 Qwen-Image 系列第三代图像生成基础模型 Qwen-Image-3.0,核心定位用一个字概括:实。

这个"实"体现在三个维度:内容丰实细节真实知识厚实

内容丰实:4.5k token 输入,九宫格一次生成

Qwen-Image-3.0 将可接受的指令长度提升至 4.5k token,这意味着模型可以理解和渲染极其复杂、信息密集的视觉版面。

官方展示了一张九宫格信息图,包含隧道安全漫画、空间几何教学、出师表文体分析、物理抛体运动、生物寄生虫科普、右胸疼痛医学图解、群论 Sylow 定理、银行内控管理信息图、细胞 DNA 结构对比,共九个独立信息板块,一次性生成而非拼接。完整描述这张图需要 3.7k token,而模型最大支持 4.5k token,仍有余量。

九宫格信息图

除了"横展"能力(多种概念在画面中有序布局),模型还具备"纵深"能力(语义解构与逻辑嵌套)。一条指令可以生成画中画中画的效果:VSCode 编程界面 → 千问聊天界面 → 微信聊天界面 → 手冲咖啡海报,每一层保持各自 UI 的真实风格与细节。

多层嵌套界面

细节真实:10px 小字清晰可辨

在微观细节的渲染精度上,Qwen-Image-3.0 达到新的高度:10px 小字清晰可辨,毛孔与发丝纤毫毕现,肌肤质感逼近摄影级真实。

小字渲染方面,模型能够完整渲染一整页代数几何领域的学术论文,包含多行复杂公式推导。上标、下标、花括号、分数线、多行对齐等 LaTeX 排版元素均准确呈现。

学术论文渲染

模型还能生成真实报纸版面,密集文字配合报纸印刷质感;在编辑任务中可叠加逼真的手写批注——下划线、波浪线、圈画、箭头和简短评语,字迹自然流畅。

纹理刻画方面,人像摄影中的发丝、毛孔、肌肤纹理均能细腻还原。模型还能修复破损的传统绘画,保持原有艺术风格和笔触。

人像细节渲染

知识厚实:12 国语言 + 联网能力

Qwen-Image-3.0 拥有覆盖 12 国语言、多种字体、100+ 艺术风格和多种 UI 界面的渲染能力。模型能准确渲染日文、韩语、西班牙语等多语言内容,能仿真主流网页、游戏、直播等 UI 界面。

多语言与 UI 仿真

模型还支持联网获取最新知识。官方演示了生成杭州当天的天气预报图,以及找到特定 IP 形象进行创作(如齐白石和梵高在直播间介绍 Qwen-Image-3.0)。

总结

从 1.0 的"准",到 2.0 的"准多齐美真",再到 3.0 的"实",Qwen-Image 的迭代方向一直很明确:追求实用性和好用度。4.5k token 的长指令支持、10px 小字的精准渲染、12 国语言的原生理解和联网能力,让模型在报纸排版、短剧分镜、学术配图、UI 原型等高价值场景中具备了真正的落地能力。

目前 Qwen-Image-3.0 可通过 Qwen Chat 免费体验。

推荐阅读