返回文章列表
文章详情AI 入门

阿里 Qwen-Image-3.0:主打复杂文字排版,但演示图好看不等于你能用出来

阿里发布第三代图像生成模型 Qwen-Image-3.0,官方主打「实」——一次生成报纸/试卷/九宫格信息图、10px 小字、12 国语言渲染。官方精选示例确实亮眼,但没公开提示词和种子、没有跑分、权重未开放、社区实测褒贬不一。本文分清「官方自评」与「待验证」,冷静看这次图像模型发布。

更新于 2026-07-215 分钟4

一分钟速览

  • 阿里发布图像生成模型 Qwen-Image-3.0,主打一个「实」字:官方称能一次生成报纸、试卷、九宫格信息图这类复杂版面,还能渲染 10px 小字和 12 国语言。
  • 官方博客给了一堆很唬人的示例——鲸鲨知识图鉴、整页带 LaTeX 公式的学术论文、水墨画修复——但这些全是官方精选图,没有公开对应的提示词和随机种子,复现不了。
  • 没有任何官方跑分或第三方评测;发布当天 Hacker News 上的早期讨论褒贬不一,有用户质疑成图质量和演示图的代表性——这些是网友反馈,不是本站实测。
  • 权重没开放:截至发稿其模型页需授权访问(返回 401),普通用户只能在 Qwen Studio 网页里试用,下不到权重自己部署。
  • 结论先行:能力演示确实亮眼,尤其是复杂文字排版,但「官方精选图好看」和「你自己用着好用」之间还隔着独立验证这一步,先当预告看。

⚑ 本文能力描述均来自 Qwen 官方博客,属厂商自评口径,配图为官方发布的示例图;社区反馈来自 Hacker News 公开讨论,属网友观点、未经本站实测;截至发稿无官方跑分表或第三方评测,权重开放情况以官方后续为准。

1

第三代 Qwen-Image,主打一个「实」

阿里发布了图像生成模型 Qwen-Image-3.0,是 Qwen-Image 系列的第三代。官方给它定的关键词很简单——一个「实」字。按官方说法,如果说前两代追求的是「准」和「准多齐美真」,那这一代想解决的是「好用」:让文生图从「画得好看」往「能当生产力工具用」上靠。

官方把这个「实」拆成三个维度:内容丰实(支持最大 4.5k token 输入,能生成报纸、分镜、试卷这类复杂版面)、细节真实(10px 小字精准渲染,毛孔发丝级纹理)、知识厚实(12 国语言原生渲染、100+ 艺术风格、仿真各种软件 UI 界面)。除了文生图,它也支持图像编辑,官方演示里包括给书页叠加手写批注、修复破损的传统水墨画等。

为什么值得看:为什么值得关注:文字渲染一直是文生图模型的老大难——生成的图里文字经常缺胳膊少腿、拼错、糊成一团。Qwen-Image-3.0 主打的恰恰是「把复杂文字和版面画对」,如果真如演示所示,对做海报、信息图、电商详情页这类「图里有大量文字」的场景是实打实的价值。这也是继 Qwen 3.8 语言模型预告之后,阿里 Qwen 家族这两周的又一次密集出牌。
4.5k token官方称可接受的最大指令长度,用于渲染复杂密集版面
10px官方称可精准渲染的最小字号
12 国官方称原生支持渲染的语言数量
0截至发稿官方公布的跑分表数量
Qwen-Image-3.0 官方发布头图,标语「落字成画,字字如印」。来源:Qwen 官方博客
2

官方演示到底展示了什么

先说清楚:下面这些是官方博客里的精选示例图,用来展示能力上限,不代表随手一生成就是这个效果。

官方展示图:一张「鲸鲨全解知识图鉴」,密集的中文标注、分区版面、插画和小字被完整渲染在一张图里,用来演示「内容丰实」和小字渲染能力。来源:Qwen 官方博客(厂商自评口径)
最能打的一项 · 复杂文字版面

官方最想秀的是「一次生成信息密集的复杂版面」。最夸张的一个例子是九宫格:一张图里九个格子各是一张独立的复杂信息图(隧道安全漫画、群论定理、DNA 结构对比等),官方称完整描述需要 3.7k token、一次性生成而非拼接。还有整页带 LaTeX 公式推导的学术论文、带真实纸张质感的报纸——如果这些是稳定可复现的,确实是文生图在「文字排版」上的一次明显进步。

别忽略的另一半 · 图像编辑

除了从零生成,它也做图像编辑:官方演示了在书页上叠加逼真的红色手写批注(下划线、圈画、箭头),以及修复破损的传统水墨画——补上缺失部分、去掉霉斑,同时保持原有笔触风格。这类「按指令改图」的能力,对实际生产流程往往比纯生成更有用。

3

亮眼演示 ≠ 你能用出同样效果

这类模型发布最该留个心眼的地方,是别把「官方精选图」直接当成「模型的日常水平」。有三点值得摆出来。

三个需要独立验证的点

第一,官方博客里绝大多数示例都没有附对应的提示词和随机种子,你没法照着复现,也无法判断是「一次生成」还是「挑了很多次的最佳结果」。第二,截至发稿没有任何官方跑分表,也没有第三方评测,「比上一代强」目前只有官方自己的图为证。第三,发布当天 Hacker News 上的早期讨论就褒贬不一,有网友质疑实际成图在人体结构、文字准确度上仍有问题、以及演示图的代表性——这些是公开讨论里的用户反馈,不是本站实测,但足以说明:官方演示和真实体验之间,还需要时间和更多独立测试来对齐。

对图像生成模型来说,「能力上限的演示」和「稳定可用的下限」是两回事。前者官方博客已经给足了,后者要等更多人真正用起来、晒出带提示词的复现结果,才能下判断。

4

现在能怎么试

想现在就试,可以直接上 Qwen Studio 网页版(chat.qwen.ai)里的图像生成功能,用自己的提示词跑一遍,比看官方精选图更能感受真实水平。

想拿权重自己部署的话要留意:Qwen-Image 系列此前开放过权重,但截至发稿 3.0 的模型页面需要授权访问(我们核验时返回 401),也就是说普通用户还下载不到 3.0 的权重,能否、何时开放以官方后续公布为准。

建议的用法:拿它试「图里要有大量准确文字」的活儿——海报、信息图、带文案的电商图、多语言排版——这是它主打、也最可能出彩的场景;对成品质量,尤其是人像和关键文字,生成后自己再核一遍,别直接拿去用。

来源:Qwen 官方博客《Qwen-Image-3.0》(能力描述与配图均为官方发布,厂商自评口径);社区反馈来自 Hacker News 公开讨论(网友观点,未经本站实测);权重开放状态为本站核验时的情况(模型页返回 401,需授权访问)。截至发稿无官方跑分表或第三方独立评测,相关结论待更多可复现测试出现后回补。阿里 Qwen 家族近期动态可参见本站《阿里预览 Qwen 3.8》一文。

官方精选图负责展示上限,你自己带提示词跑一遍,才知道下限在哪。

相关推荐

继续阅读同类文章

优先推荐同分类文章,方便顺着当前主题继续深入。

AI 入门

Cursor 智能体集群:一秒 1000 次提交,4 小时用 Rust 重写了个 SQLite

Cursor 公布新一代 AI 智能体集群:峰值每秒约 1000 次提交(旧系统每小时 1000 次),并让一群 AI 只靠 835 页手册、4 小时从零用 Rust 重写 SQLite,多个模型组合跑到 100%。但最有价值的是成本账——「强模型规划+便宜模型干活」比全用 GPT-5.5 便宜约 8 倍。附冷静提醒:这是官方自演示,且 SQLite 很可能在训练数据里。

阅读全文
AI 入门

阿里预览 Qwen 3.8:2.4 万亿参数紧追 Kimi K3,但目前只有一条推文

阿里 7 月 19 日通过官方社交账号预告 2.4 万亿参数、原生多模态的 Qwen 3.8,紧跟几天前的 Kimi K3。但截至发稿只有一条预告:没有官方博客、模型卡、跑分表,连开源日期都没给,「仅次于 Fable 5」的自评也无数据支撑。本文把「官方确认」和「尚未证实」分清楚,冷静看待这次卡位。

阅读全文
AI 入门

一句「hi」被计成 86 个 token:Kimi K3 API 里疑有约 85 token 的隐藏提示词

Simon Willison 用鹈鹕基准实测 Kimi K3 时发现 token 计数异常:最短输入也多出约 85 个 token,疑为 API 层隐藏系统提示词;测试同时留下一份真实成本账——画一只鹈鹕 0.25 美元、推理 token 占近八成。注入环节尚无官方说法,本文按推断口径如实梳理。

阅读全文

版权声明

本文由知享整理发布,主要用于信息整理、技术研究、工具体验与经验分享。

文中提到的工具、项目、软件、网站或服务,版权、商标及相关权益均归原作者、开发者或所属公司所有。本站不提供破解、盗版、绕过付费、未授权下载或侵权资源,相关功能、价格、授权方式、服务条款及隐私政策请以官方网站说明为准。

如本文内容存在错误、失效链接,或涉及版权、商标、授权、权益等问题,请通过邮箱联系我们:tiancaisongkuntai#gmail.com。发送邮件时请将 # 替换为 @,并提供相关证明材料,我们会在核实后及时处理。

转载或引用本站内容,请保留原文链接并注明来源。