Clipping 微信公众号

ChatGPT Images 2.0来了:会思考、会搜索的生图模型,242分碾压全场(附宝藏提示词库)

by AI兴观点 原文 ↗
Created: 2026-04-24

公众号名称:程叙架构与AI.

作者名称:AI兴观点

发布时间:2026-04-22 17:33

原文链接:https://openai.com/index/gpt-image-2

✅点击上方🔺公众号🔺关注我✅

昨天深夜,OpenAI扔出一条推文,没有发布会,没有预热,整件事就这样发生了。

然后整个AI生图圈发现:又落后了。

ChatGPT Images 2.0正式上线,底层模型叫gpt-image-2。它不只是比上一代好一点点——是在Image Arena三个榜单上同时刷新纪录,领先第二名242分,幅度大到榜单方自己发推说”从没见哪个模型这么碾压过”。


一发布就屠榜

Image Arena是专门给AI图像模型打分的第三方平台,OpenAI和Google都在上面暗暗较劲。GPT-Image-2上线之前,GPT-Image和Google的Nano Banana在榜首咬得很紧,差个几十分。

然后GPT-Image-2一出场:

榜单分数领先第二名
Text-to-Image(文生图)1512+242分
Single-Image Edit(单图编辑)1513+125分
Multi-Image Edit(多图编辑)1464+90分

第二名是Google Nano Banana 2。

Image Arena的评语原话是:“No model has dominated Image Arena with margins this wide.”

奥特曼在凌晨直播里说了一句话,大意是:这种感觉就像一下子从GPT-3跳到了GPT-5。


这次最不一样的是什么

如果只让我选一个关键词,我会说是”思考”。

Images 2.0有两种模式。一种是即时生成,你说什么它画什么,跟以前的版本差不多。另一种是思考模式(Thinking Mode)——你选一个带思考能力的模型,它不再只是渲染器,而是一个能跟你一起”想画面”的伙伴。

它会先理解你的意图,联网搜索实时信息,对画面结构做推理,然后才动笔。

思考模式下最惊人的能力之一:一次生成最多8张图,而且风格连贯、角色一致、内容递进。你上传一张大头照,它给你出八套夏装搭配,每套还自带不同角度的细节图。以前这得一张张生、手工拼,现在一句话搞定。

另一个思考模式的演示是:给它一份PPT文件,它能提取关键数据和图表,按原文件风格自动排版成一张横版海报。上传PDF,出来海报——整个过程不需要任何设计软件。


终于会写字了

文字渲染一直是AI生图的老大难。小字号、图标、UI元素、密集构图,随便一个就能让模型崩溃。

Images 2.0据说把这些全部拉到了可用水平。OpenAI官方给出了几个让人印象深刻的例子:

米粒上刻字。 直播里生成了一张大米粒的特写,其中一颗米粒上刻着”GPT image 2”的字样。

中文多格漫画。 OpenAI研究科学家陈博远生成了一整页全中文彩色漫画,讲述他在团队里做中文文本渲染优化的故事。五排分镜,背景有珍珠奶茶,墙上用胶带粘着一根香蕉(致敬艺术圈名场面)。里面有一句中文文案是”稳稳地接住你”——这个梗,中文用户懂的都懂,GPT在对话里动不动就来这句,被吐槽了大半年,现在连自嘲都用上了。

奥特曼自己也在X上发了一张和团队成员Gabriel Goh的漫画合影,配文”更多GPU”。

多语言支持不只是中文,日语、韩语、印地语、孟加拉语都在优化名单里。一张日语少年冒险漫画,格数、对白、拟声词全都排版到位,甚至”羽ペン”这种复合词都写对了。


风格已经不像AI了

以前AI生成的图,皮肤太光滑,光线太均匀,构图太完美,一眼假。

Images 2.0开始学会”不完美”。官方demo里有一组抓拍快照,35毫米胶片质感,可见颗粒,构图略微偏离中心,衣服和头发在风中飘动。有人说如果不告诉你是AI生成的,你会以为是某个摄影师在公路旁随手按的快门。

还有一组2000年代初美国高中电脑室的模拟照片,CRT显示器的橙色日期戳、轻微运动模糊、闪光灯过曝——全是胶片时代的不完美,全被精准复现。

支持的宽高比现在从3:1到1:3全覆盖,横的做Banner、幻灯片,竖的做海报、朋友圈九宫格,甚至可以生中国传统长卷山水画。


Codex也原生支持画图了

除了ChatGPT,这次还有一个值得注意的点:Codex也接入了图像生成能力。

OpenAI凌晨官宣之后,已经有开发者第一时间试了。给Codex丢一句”画一个SaaS架构图”,没配置任何图像密钥,没装任何插件,直接在终端里生图,一分钟不到,出来一张分层清晰的中文架构图——多租户、安全、监控、中英文混排全都对。

这是编程Agent第一次真正意义上”会画画”。前端开发、产品原型、技术文档配图、游戏素材——这些场景以后可以在同一个工作流里闭环。


一些真实的局限

ZDNet记者在预发布测试里做了一个有意思的实验:给AI一张ZDNET首页截图和一篇新闻稿,让它按官网风格生成一张信息图,还特别要求准确还原ZDNET的logo。

结果:AI反复无法正确渲染那个Z。以下是AI生成的三张不同版本的信息图,可以看到每次logo都不一样。

第一张,Z有一点歪:

第二张,Z完全变形:

第三张,Z向右偏移:

最后它找到了一张ZDNET在2022年改版前的旧logo,用现在的配色渲染出来,然后把整个图向左偏移,部分内容被切掉。记者加了各种prompt让它修正,都没用,换新session重新试,logo还是变形。

这说明模型有时候会”脑补”不存在的内容——包括logo这种东西。

另外,思考模式比即时模式慢,因为它要搜索、要推理、要多次检查。OpenAI自己也说,这是故意设计的trade-off:它不是更快,是更深。思考、检查、再思考,一圈下来当然比直接出图慢。


怎么用

所有ChatGPT和Codex用户:基础版Images 2.0已经开放。

ChatGPT Plus、Pro、Business用户:可以开启思考模式,一次生成多张图、联网搜索、一次出多种尺寸的社交媒体素材。

手机端:需要更新到最新版本。

API:gpt-image-2已经上线,官方定价参考GPT-Image-1.5,输入约$8/百万tokens,输出约$30/百万tokens。4K分辨率和可变宽高比在API里也支持。

这大概是目前最接近”能直接当生产力工具用”的图像生成AI。

不是因为它画得最艺术,而是它终于解决了一直在劝退真实用户的那几个问题:文字不准、多语言拉胯、构图一眼AI、单张出图没法连贯。以前这些短板每一个都让想正经用AI做设计的人回头去开Photoshop。

现在,设计师们可能得重新想想自己的护城河到底在哪了。


附录:宝藏提示词库

光有工具不够,得知道高手们怎么用。

GitHub 上有一个持续更新的开源提示词库——awesome-gpt-image-2-prompts,目前已收录 50+ 案例,按场景分成五大类:人像摄影、海报插画、角色设计、UI/社媒 Mockup、社区对比实验。每个案例都附带原始 Prompt 和输出效果,可以直接抄去试。

几个特别值得看的宝藏案例:

人像摄影——35mm 闪光灯时尚人像

Prompt 示范:描述特定相机型号、胶片质感、构图方式和光线参数,就能生成特定风格的人像照片,而不是”一张漂亮的脸”。这个案例展示了 GPT-Image-2 对摄影术语的理解深度——它知道”35mm f/1.4 闪光灯”意味着什么,该怎么呈现在画面里。

海报插画——城市水墨风

Prompt 示范:描述城市名称、季节、构图风格(水墨、极简、线稿),GPT-Image-2 就能生成一张有设计感的城市海报。这类 Prompt 的价值在于”风格词”的积累——知道用什么词能触发特定美学效果。

UI 设计——一句话生成完整界面

Prompt 示范:描述产品类型、目标平台、设计风格,直接生成一套完整的 UI 设计稿。这个场景直接解决了我之前提到的”设计图生产力”问题——不需要设计师出图,PM 自己就能把想法可视化。

角色设计——二次元设定卡

Prompt 示范:指定画风(动漫、游戏角色卡)、配件要求、背景布局,就能生成一张完整的角色参考卡。这类 Prompt 对于游戏立项初期快速出概念稿特别有价值。

更多案例直接去 awesome-gpt-image-2-prompts GitHub 仓库 看,可以抄 Prompt,可以提 PR 增加自己的案例。整个库还在持续更新。

如果觉得这篇文章有帮助,欢迎点赞、在看、转发!有问题也可以在评论区留言,我会尽量回复!


cover_image

AI兴观点 程叙架构与AI.

Read more

输入关键词开始搜索