通义发布 Qwen-Image-3.0:一条三千字指令,一次画出九张信息图和一整版报纸
- 报纸版式、九宫格教学图、短剧分镜这类字多的图,过去只能一格格生成再拼。通义发布 Qwen-Image-3.0,单条指令上限提到 4.5k token(中文约三千字),九个不相干的题材一次画在同一张图上
- 最小可辨字号做到 10px,整版报纸、一整页 LaTeX 论文、八个分区的密集知识图鉴都排得住
- 覆盖面上是 12 国语言原生渲染、100 多种艺术风格,开发工具和外卖 App 这类界面能照真实的样子仿;还能联网取当天信息作图,比如直接生成一张当日的天气与游览指南
- 生图和编辑在同一个模型里:给现成书页加红笔批注、补破损古画、给实拍照片叠学术标注层;给一套人物设定和场景,能直接排出带景别、时长和运镜标注的 12 格分镜表
- 百炼已上 qwen-image-3.0-pro,限时免费,上一代 pro 是 0.5 元一张;开源权重仍停在 2025-12-30 的 Qwen-Image-2512,3.0 和今年 2 月的 2.0 都没放
三代模型各有一个关键词,这一代的关键词是「实」
阿里通义团队 7 月 21 日发布 Qwen-Image-3.0,Qwen-Image 系列的第三代图像生成基础模型。
这个系列每一代都用一句话概括自己。初代是「准」,去年 8 月发布,主打把字写对;第二代是「准 多 齐 美 真」,今年 2 月发布,把生图和编辑合进一个模型,支持 1k token 指令和 2K 分辨率。这一代收成一个字:实。
「实」拆成三条,构成这次更新的全部能力清单。
- 指令上限 4.5k token
- 横展:多主题并置
- 纵深:界面层层嵌套
- 报纸、分镜、试卷直出
- 10px 小字精准渲染
- 毛孔发丝级刻画
- 材质与纸张质感
- 编辑任务里也能写小字
- 12 国语言原生渲染
- 100+ 艺术风格
- 网页游戏直播界面仿真
- 联网取最新世界知识
官方给这次更新定的方向是从「好看」转向「好用」,瞄的是报纸排版、短剧分镜、复杂界面稿这类干活场景。下面按这三条逐个拆。
指令上限提到 4.5k token,一整版复杂内容能一次交代完
单条指令最多能塞 4.5k token,中文大约三千字。上一代是 1k。指令能写多长,直接决定一张图里能安排多少件事。
中间那根条是阿里云百炼接口文档写明的数字:qwen-image-2.0 系列提示词上限 1300 token,其他模型 800 token,超出部分直接截断。
指令短的时候,复杂版面只能拆开画再拼。九个题材各自的标题、正文、公式、人物动作,一千字连一半都交代不完。上限提到三千字这一档,这类活才从分次拼贴变成一次出图。
官方拿来证明这条的是一张九宫格,描述它用掉 3.7k token。
随便抽一格出来,都是一张能单独用的图。中间上方那格是完整的空间几何教学页,问题、前提、定理、结论齐全。
值得一提的是,格子里的推导不是摆样子。群论那格算「阶为 72 的群有几个 Sylow 3-子群」,从 72 拆成 8 乘 9、到个数要除以 3 余 1 且整除 8、再到答案是 1 或 4,整条链子成立。物理那格从脱离点初速度推到角速度公式,中间的落地时间和位移代换也对得起来。
空间控制分两个方向:横着并排摆,和竖着一层层套
横展考的是语义并置:多个互不相干的概念同时出现在一张画布上,各占各的地盘,内容不串。纵深考的是逻辑嵌套:一幅图里从外到内画好几层界面,每层保持自己那套样子。
上一节那张九宫格证的是横展。纵深这边的样例是一条指令画出四层嵌套:最外面 VSCode 编辑器,里面开着 Qwen 聊天,聊天里是一张微信截图,微信里发的是一张手冲咖啡流程海报。
这两个方向对应不同的活。横展做的是一版多栏的东西:报纸、试卷、教学挂图、产品对比页。纵深做的是产品演示稿和界面套图,讲一个功能怎么从这个软件跳到那个软件,过去要截三张图拼,现在一条指令下去。
最小可辨字号做到 10px,整版报纸和整页论文都排得下来
10px 是正文小字这一档的下限。到了这个尺度,字形容易糊成一团灰,笔画也容易粘连。撑住这一档,密排文字的版面才做得出来。
三类活最吃这条能力。
一、公式密集的学术排版
LaTeX 排版的难点在于上下标、花括号、分数线、希腊字母、多行对齐同时出现,任何一个位置错半格都会露馅。
二、报刊版式
报纸头版要同时成立的东西很多:刊名的书法笔触、日期栏的分隔线、几条新闻各自的标题层级、中间图表的卡片、右侧导读栏,加上每一栏正文的对齐基线。少一样都不像。
三、信息密度高的科普图
这类图的正文、引线标注、图例、比例尺全挤在一起,字号被压到最小,还要保证每一处标注都指对位置。
毛孔、发丝和材质纹理,都做到能凑近看的程度
微观级刻画:人像做到毛孔、绒毛、肌肤高光过渡的层次,非人像物体做到材质本身的结构和反光。这条决定生成的图能不能当成品用。
人像:光线越硬,越难藏
硬光会把皮肤的每一处起伏和毛孔都推到明处,阴影边缘也不允许糊。下面这张的脸上还压着一层花枝投影,明暗交界处的细节最考验功夫。
自然光那张考的是另一件事:发丝。风吹起的碎发在逆光下要根根分开,还得有透光感。
材质:四种完全不同的表面
非人像的例子更能看出覆盖面。刺绣要成立得同时做对三件事:羽毛的层次靠针脚方向表现,丝线要有丝的反光,底下的亚麻布纹要透出来。
动物毛发换的是另一套逻辑:黑毛要在暗部保住层次,白毛要在闪光灯下不过曝。
岩画考的是颜料和石头的关系:矿物色要渗进砂岩的孔隙,还得有风化剥落的斑驳。
最后这张是极端微距:油画颜料的厚涂堆叠、笔毛的每一根鬃、金属箍上的划痕和反光。
同一个模型既能从零画,也能改你手上已有的图
从上一代起,生成和编辑就合进了一个模型,不用换模型换接口。前面那些细节能力在编辑模式下同样生效:加小字、补缺损、叠标注层。下面三组都是同一张图的改前改后。
给现成的书页加手写批注
难点在笔迹的真实感。红笔字要有轻重变化,圈画得是手绘的不规则椭圆,箭头尾巴带回锋,还要压在印刷字上面而不是浮在旁边。
补破损画作的缺失部分
这里的要求是补完之后笔法和原作对得上,不能出现补丁感。
给实拍照片叠专业标注层
输入是一张普通微距照片,输出要能直接当学术配图用:主体不能变形,标注要指对位置。
给一套人物和场景,它能排出整张分镜表
短剧分镜是官方点名的生产力场景之一。要做成,模型得同时保住三件事:同一个人物在十几格里长得一样、场景连贯、每格的景别和运镜说得清。
官方给的这组样例是四张一套。前三张是素材:人物设定、场景、一个关键画面。
第四张把前三张串成了一整张分镜表。
这张图把前面几条能力全用上了:同一个人物贯穿 12 格、场景和天气按叙事推进(进村、下雨、推门)、每格的黑底标签栏是密排小字、整体又是一次横展排版。第 10 格就是上面那张雨中剪影。
过去做这件事的流程是:先出人物设定,再出场景,再一格一格生成,最后拉进设计软件排版加标注。现在这一整套是一次出的。
12 国语言、100 多种风格、主流软件界面,还能联网取当天的信息
覆盖面这一维包含四块:多语言原生渲染、艺术风格库、软件与网页界面仿真、世界知识(含联网取新信息、识别具体 IP 形象)。
多语言,而且每种语言配的是当地的版式
这一维覆盖 12 国语言原生渲染和 100 多种艺术风格。三个样例走的是三条完全不同的路子。日文这张是漫画扉页,黑白网点、竖排对白框、拟声字这套排版语言要一起对。
韩语这张是电商详情页:左边规格图标,中间模特,右边参数表,底部四张场景图,全套商品页版式。
西班牙语这张换成了手写:白板马克笔字体,三种颜色,加上神经网络示意图和数学公式。
界面仿真
网页、游戏、直播这类界面各有自己的一套控件规范。做产品原型稿和演示图会直接用到这条。
联网取当天的信息
模型自带的世界知识有截止日期,联网这条补的是新信息。指令要一张当天的杭州天气预报图,出来的是完整的天气与游览指南。
识别具体 IP 形象并再创作
这条不只是认得脸,还得把这个形象该有的画法一起带上。
现在能在哪用,多少钱,开不开源
发布页从头到尾没提这三件事。本站查了一遍。
阿里云百炼的千问文生图价格表里,qwen-image-3.0-pro 已经列在第一行,中国内地和国际区都标着「限时免费」。作为对照,上一代 qwen-image-2.0-pro 是 0.5 元一张。
| 模型 | 中国内地价格 |
|---|---|
| qwen-image-3.0-pro | 限时免费 |
| qwen-image-2.0-pro | 0.5 元/张(免费额度 100 张) |
| qwen-image-2.0 | 0.2 元/张(免费额度 100 张) |
| qwen-image-max | 0.5 元/张 |
| qwen-image / qwen-image-plus | 0.2 至 0.25 元/张 |
百炼的接口文档页当天还没更新,模型列表里最新的还是 qwen-image-2.0-pro 的 6 月 22 日版本。价格表已经开了,文档得再等等。网页端走 Qwen Chat 选「图像生成」就能用。
开源这条线是另一回事。Hugging Face 上 Qwen 组织下的生图模型仓库,最后一次放出权重是 2025 年 12 月 30 日的 Qwen-Image-2512。今年 2 月的 Qwen-Image-2.0 没有权重仓库,GitHub 仓库更新记录里那一条只给了博客和 Qwen Chat 的链接。3.0 目前同样没有。
- 2025-08-02 Qwen-Image(初代,20B MMDiT,Apache 2.0 许可)
- 2025-08-17 Qwen-Image-Edit,2025-09-22 Edit-2509,2025-12-17 Edit-2511
- 2025-12-17 Qwen-Image-Layered
- 2025-12-30 Qwen-Image-2512(生图权重最后一次更新到这里)
- 2026-02 的 2.0 与 2026-07 的 3.0:无权重发布
用它的时候,指令写长一点。这一代把上限给到 4.5k token,就是为了让你把每个要出现的字、每块要占的位置都写进去。
生图从「画一幅画」→「排一整版版面」:一条三千字的指令,一次出九张信息图
通义 7 月 21 日发布 Qwen-Image-3.0,一次能交代的话从七百来字加到三千字,一页带图讲完它换来了什么。
↓ 一页读完 · 有一张会动的图
文生图模型,就是你写一段话描述画面,它给你出一张图。Qwen-Image 是阿里通义这条线的模型,这是第三代。
过去两代都能画得好看,但一到「排版面」这种活就顶不住。
✘ 一整版报纸、九格连排的信息图、一整页公式论文,排不下来
卡在两处。一处是话说不长:上一代一次最多塞 1k token 的描述,中文七百来字,九件事连一半都交代不完,只能拆开画完再拼。另一处是字写不小:正文那种小字号一缩就糊成一团灰,报纸和论文这类东西全靠小字撑着。
这一代把单条指令的上限提到 4.5k token,中文大约三千字。同一件事,能交代的详细程度差出一大截。
标出线面垂直的定理与图示。
, 写到这儿就快到头了,
剩下八格得另开八次再拼
第3格《出师表》文体分析…
第4格 抛体运动受力推导…
第7格 群论 Sylow 定理…
, 九格一次写完,3.7k token
指令写得下,能接的活也就跟着变了:
- 10px 的小字这一档撑得住,整版报纸、一整页 LaTeX 公式论文、密排知识图鉴都排得出来
- 给一套人物设定加场景,直接排出 12 格分镜表,每格带景别、时长和运镜标注
- 改图和画图在同一个模型里:给书页叠红笔批注、补破损古画的缺口、给实拍照片加学术标注层
- 12 国语言按各自的版式排,主流软件界面能仿,还能联网取当天的天气信息
话能写长了,下一个问题是:三千字里那么多件事,它怎么在一张画布上安排开。
小互手上有两份活:一份是九格连排的教学图,一份是产品演示套图。这两份分别吃模型的两种空间控制能力,一个横着铺,一个竖着套。
横展决定一张图里能同时安排多少件事,纵深决定一张图里能套进去几层界面。报纸、试卷、教学挂图吃前者,产品演示稿和界面套图吃后者。图为本站所画的示意图。
这一代拿得出手的数字只有一个方向:一次能交代多少字。条越长,一张图里能安排的事越多。
能写的描述上限
中文七百来字
用掉的指令长度
- × 那版生成的报纸,把 4.5k 自己印成了 4k
- × 鲸鲨图鉴的濒危等级,抄的是 2016 年前的旧版
- × 权重没开源,只能走网页版或百炼接口