Wiki 实体

GPT Image 2 与 AI 图像工作流

Created: 2026-04-26 Updated: 2026-06-21

这一波新资料把 GPT Image 2 从“会画图”继续推进到“能承担具体 UI 设计、能被 Skill 封装进 agent、还能接入品牌和创作软件链路”的阶段。 [[raw/2026-04-28/AIGC 新赛道/我用 GPT Image 2 花5分钟完成 6 张 UI 设计图:GPT Image 2 小程序 UI 设计实战.md|来源: 我用 GPT Image 2 花5分钟完成 6 张 UI 设计图:GPT Image 2 小程序 UI 设计实战.md]] [[raw/2026-04-26/爱海贼的无处不在/我做了2个GPT-image-2生图Skills,帮助Agent实现生图,安装简单.md|来源: 我做了2个GPT-image-2生图Skills,帮助Agent实现生图,安装简单.md]]

从灵感图走向结构化设计

  • 新的 UI 实战文给出统一设计规范、页面拆解和提示词公式,说明 GPT Image 2 已经可以用于有组件一致性要求的小程序界面草图。 [[raw/2026-04-28/AIGC 新赛道/我用 GPT Image 2 花5分钟完成 6 张 UI 设计图:GPT Image 2 小程序 UI 设计实战.md|来源: 我用 GPT Image 2 花5分钟完成 6 张 UI 设计图:GPT Image 2 小程序 UI 设计实战.md]]
  • 这和之前的故事板、角色卡、品牌系统案例连起来看,代表图像模型已经从“生成单张图”进化到“辅助一整套视觉流程”。 [[raw/2026-04-24/小北/GPT Image 2全量上线!爆肝两天,全网最全实用玩法都在这里了.md|来源: GPT Image 2全量上线!爆肝两天,全网最全实用玩法都在这里了.md]] [[raw/2026-04-26/花叔/你的一人公司品牌部,带着Image-2模型的lovart中文版来了.md|来源: 你的一人公司品牌部,带着Image-2模型的lovart中文版来了.md]]

Skill 化之后才真正进入 agent 体系

  • GPT-image-2 生图 Skills 的实践说明:只要把配置和调用模式包好,agent 就能稳定地触发图像 API,而不是每次重新解释“怎么画图”。 [[raw/2026-04-26/爱海贼的无处不在/我做了2个GPT-image-2生图Skills,帮助Agent实现生图,安装简单.md|来源: 我做了2个GPT-image-2生图Skills,帮助Agent实现生图,安装简单.md]]
  • Hermes、多 agent 和 image skills 放在一起后,图像工作流终于能被拆成构思、出图、筛选、回写和品牌化几个步骤。 [[raw/2026-04-25/袋鼠帝/GPT-Image-2 Skill + Hermes多Agent,才是画图的神~.md|来源: GPT-Image-2 Skill + Hermes多Agent,才是画图的神~.md]]

和专业创作工具开始打通

  • Anthropic 的 9 个创作连接器意味着,图像和创意生成不再只是独立网页产品,而是在向 Blender、Adobe、Autodesk 等专业软件链路内嵌。 [[raw/2026-04-29/AI兴观点/Anthropic 一次发布 9 个创作连接器:Blender、Adobe、Autodesk 全面接入 Claude.md|来源: Anthropic 一次发布 9 个创作连接器:Blender、Adobe、Autodesk 全面接入 Claude.md]]

Skill 架构:上游编排与下游渲染分离

Humanize PPT 的架构设计揭示了一个跨内容类型的通用模式:将”规划层”与”渲染层”拆分为独立 Skill,上游负责大纲编排、素材规划和结构化输出,下游负责实际渲染执行。[[raw/2026-06-19/AI沃茨/开源一个为演讲而生的PPT Skill,再不用跟观众大眼瞪小眼了.md|来源: 开源一个为演讲而生的PPT Skill,再不用跟观众大眼瞪小眼了.md]]

  • 在其 PPT 工作流中,Humanize PPT 做上游规划,下游接 guizang-ppt-skill 或 frontend-slides 做渲染,渲染器可替换。
  • 在图像场景中,已有类似端倪:Hermes 多 Agent 将图像工作流拆为构思、出图、筛选、回写几步。上游结构化编排 + 下游 API 调用的分层思路可推广为一个”视觉编排”Skill 规划图片需求列表,再由具体生图 Skill 按结构化规范执行。
  • 另一条验证路径:通过 Codex 的 Image Gen 生图后导入 PPT,系列风格统一图片可直接作为演示文稿原材料。[[raw/2026-06-05/澜桥老师/Codex做PPT的72个Skills,用AI做PPT止于此篇(终结).md|来源: Codex做PPT的72个Skills,用AI做PPT止于此篇(终结).md]]

图像在内容管线中的多步角色

Humanize PPT 工作流将 GPT Image 2 嵌入了更长的内容管线:大纲编排 → GPT Image 2 配图 → SVG 流程图 → Remotion 视频生产。[[raw/2026-06-19/AI沃茨/开源一个为演讲而生的PPT Skill,再不用跟观众大眼瞪小眼了.md|来源: 开源一个为演讲而生的PPT Skill,再不用跟观众大眼瞪小眼了.md]] 图像不再只是终端产物,而是多步骤内容生产的一个中间环节——同一份素材可经 SVG 进入流程图、再导入 Remotion 驱动动画视频。

这也暴露了一道验证缺口:HTML PPT 渲染缺陷(如页码吃掉正文)在静态扫描下全绿通过但实际不可用,类似问题在 AI 图像生成中同样存在——构图畸形、文字乱码、元素重叠等缺陷无法被自动化工具检出,需要人工复核或对比验证作为质检环节。[[raw/2026-06-19/AI沃茨/开源一个为演讲而生的PPT Skill,再不用跟观众大眼瞪小眼了.md|来源: 开源一个为演讲而生的PPT Skill,再不用跟观众大眼瞪小眼了.md]] 美团 PosterReward(CVPR 2026)是这一方向上的系统突破——作为首个专门面向海报质量评估的奖励模型,以 86% 准确率远超基线(40-53%),同时承担 RL 奖励函数和线上质检双重角色,弥补了 AI 图像生成中自动化质检的缺口。[[raw/2026-06-18/视觉智能/美团海报生成 AIGC 技术创新与实践.md|来源: 美团海报生成 AIGC 技术创新与实践.md]]

图像优先开发流程:GPT Image 2 作为开发规划工具

Wise Wong 的 Codex 实践提出了一种 GPT Image 2 的新角色:在开发之前先用 gpt-image-2 生成原型图和设计规范,让 AI 有了视觉参照后再开发,产出的 UI 不会千篇一律。 [[raw/2026-06-19/Wise Wong/交了200刀的学费,我总结了Codex的15个技巧.md|来源: 交了200刀的学费,我总结了Codex的15个技巧.md]]

  • 三阶段多轮设计流程:第一轮画方向稿(基于苹果人机交互指南、产品核心能力和目标人群确定视觉方向),第二轮画完整视觉稿(细化所有界面),第三轮输出设计规范——然后将规范更新进 AGENTS.md/CLAUDE.md,作为长期开发指南。这与”Skill 架构:上游编排与下游渲染分离”中记录的分层思路形成呼应,但新增了”规范持久化到项目指南”这一关键步骤,形成设计输出到开发执行的闭环。
  • 图像作为 AI 开发的参照物:AI 有了图像参照后,UI 输出不再局限于格子布局和紫色调等默认模式。gpt-image-2 被评价为画图能力可靠,能将模糊的产品描述转化为具体的视觉方向,再逐步细化为完整设计规范。
  • 从视觉产出工具到开发规划工具:此模式将 GPT Image 2 的角色从”内容生产的视觉产出工具”延伸到了”软件开发的规划工具”——图像不再是最终产物,而是开发流程的输入规范和参照物。这与”图像在内容管线中的多步角色”中图像作为中间环节的趋势一致,但应用场景从内容生产拓展到了软件开发本身。

美团海报 AIGC:生成-编辑-评判技术闭环

美团技术团队构建了覆盖”能生成、能编辑、能评判”的海报 AIGC 完整技术体系,三篇顶会论文(ICLR 2026 x1 + CVPR 2026 x2)全部开源于 MeiGen-AI。与 GPT Image 2 的通用模型路线不同,美团走的是任务专用模型路线——针对海报设计场景训练专用模型,在特定设计任务上达到接近商业产品的水平。[[raw/2026-06-18/视觉智能/美团海报生成 AIGC 技术创新与实践.md|来源: 美团海报生成 AIGC 技术创新与实践.md]]

  • PosterCraft(ICLR 2026):摒弃传统模块化流水线,采用四阶段级联优化——文字渲染→高质量微调→RL 美学优化→VLM 反馈精炼。文字召回率接近闭源商业系统,核心思路将”生成好图片”从一次性 prompt 拆解为逐阶段精炼的迭代过程。这与前述”Skill 架构”中的分层思路在哲学上一脉相承,只是实现层面从工程编排降到了训练管线。
  • PosterOmni(CVPR 2026):单一模型覆盖扩图/补全/比例调整/风格迁移等六类设计任务。核心挑战在于局部保真与全局重构之间存在根本性任务冲突,解决方案是”先专家再蒸馏”——先单独训练局部编辑专家和全局创作专家,再通过蒸馏融合为统一学生模型。这与 Humanize PPT 的”规划层与渲染层分离”构成有趣的平行对照:前者在工程层面通过 Skill 拆分解决冲突,后者在模型层面通过蒸馏融合解决冲突。
  • PosterReward(CVPR 2026):首个专门面向海报质量评估的奖励模型,86% 准确率远超基线(40-53%),同时承担 RL 奖励函数和线上质检双重角色。其 negative-pair 策略将参考图标记为 rejected、编辑结果标记为 chosen,显式强化”有效修改本身有价值”的认知,防止模型直接拷贝参考图投机。
  • 结构化评估体系:营销海报元素定位(12 类元素/90%+ 准确率)、色系识别(11 色系/96.2%)、风格识别(12 种/91.5%),构成可解释的设计规范标准。
  • 跨模型验证管线:CLIP/DINOv3/HPSv3/GLM-4.5V/Gemini-2.5-Pro/GPT-5 多模型共识判定用于偏好数据构建,各阶段训练依赖大量人工设计的偏好对和过滤规则——印证了”大模型是实验科学”的判断。

矛盾:GPT Image 2 走通用模型路线(一个模型处理所有图像类型)vs 美团走专用模型路线(为海报场景训练专用模型,三篇论文三个模型),两条路线各有适用场景尚无收敛趋势。“Skill 架构”中的上下游分离是工程层面的编排策略,PosterCraft/PosterOmni 的级联/蒸馏是训练层面的优化策略,两者解决同一类问题(复杂任务分解)但在不同抽象层次。

相关页面

  • [[wiki/entities/Claude 创作连接器与专业软件集成]]
  • [[wiki/concepts/Skills、Agents 与工具设计]]
  • [[wiki/concepts/Superpowers 与编程治理框架]]

输入关键词开始搜索