Clipping 微信公众号

GPT-5.5 炸场发布:碾压Opus4.7,OpenAI夺回王座,AI 编程进入「少 token 干大活」时代

by AI兴观点 原文 ↗
Created: 2026-04-24

公众号名称:程叙架构与AI.

作者名称:AI兴观点

发布时间:2026-04-24 17:19

✅点击上方🔺公众号🔺关注我✅

昨晚,OpenAI 正式发布 GPT-5.5。这是他们迄今为止最聪明、用起来最顺手的模型。如果用一句话概括,就是:它更快了,但也更聪明了——不是那种”又大又慢”的方向,而是真正做到了智能与效率的统一。更重要的是,这次的进步不是某一个点的突破,而是在编程、计算机操作、知识工作、科学研究四个核心场景上全面开花。


一、GPT-5.5 核心升级:理解更快,执行更多

GPT-5.5 最核心的改变,可以用两个词概括:理解更快执行更多。它不再需要你把任务拆解得很细、一步一步喂给它。给它一个模糊的、多步骤的任务,它自己会规划、用工具、检查结果、在模糊中做出判断,然后一直推进到任务完成。

案例:数学助理 Bartosz Naskręcki 只用了一句提示词,就让 Codex(内置 GPT-5.5)在 11 分钟内构建了一个代数几何可视化应用,绘制两条二次曲面的交线,并将其转换为椭圆曲线。图片由 Bartosz Naskręcki 提供。

OpenAI 官方公布的综合评测数据如下:

这里有几个数字值得专门说一下:

  • Expert-SWE达到73.1%,在OpenAI内部的Expert-SWE评测,专门测那些人类预估中位完成时间20小时的长周期编程任务,GPT-5.5拿到73.1%,同样高于GPT-5.4的68.5%。

  • SWE-Bench Pro达到58.6%,不及Opus,在业界公认最能反映真实GitHub问题解决能力的评测SWE-Bench Pro中,GPT-5.5得分58.6%,略逊色于Claude Opus 4.7的64.3%。

  • Terminal-Bench 2.0 达到 82.7%,这意味着模型在复杂的命令行工作流中,已经能够独立完成绝大多数任务——规划、迭代、跨工具协调,全套自主完成。

  • GDPval 84.9%——这个评测模拟了 44 个真实职业的工作场景,GPT-5.5 在大多数职业中都处于领先。

  • FrontierMath Tier 4 达到 35.4%——这是目前最难的前沿数学题,难度相当于数学家的研究级问题。GPT-5.5 做到了前代两倍以上的成绩。


二、编程能力:质的飞跃

编程是 GPT-5.5 进步最明显的领域。

OpenAI 内部数据显示,超过 85% 的 OpenAI 员工每周都在使用 Codex(内置 GPT-5.5),覆盖软件工程、财务、通信、营销、数据科学、产品管理等各种职能。这本身就是一个很强的信号——做出这个模型的人,是最早开始用它的人。

具体的编程评测结果:

关键在于:GPT-5.5 在编程任务上不仅更准确,消耗的 Token 还更少。

Every 创始人兼 CEO Dan Shipper 的评价很直接:​_“GPT-5.5 是我使用过的第一个具有真正概念清晰度(serious conceptual clarity)的编程模型。”_

他讲了一个具体案例:产品上线后遇到一个问题,他花了几天调试无果后,请来最好的工程师重写了一部分系统。后来他想测试一下 GPT-5.5——如果让模型回到那个”坏掉的初始状态”,它能自己搞定吗?GPT-5.4 做不到。GPT-5.5 可以。

MagicPath CEO Pietro Schirano 也有类似体验:GPT-5.5 一次处理了一个包含数百个前端和重构变更的分支合并,20 分钟左右完成。

NVIDIA 的一位工程师甚至说:“失去 GPT-5.5 的访问权限,就像截肢了一样。”

Cursor 联合创始人兼 CEO Michael Truell 的评价聚焦在长期任务上:“GPT-5.5 比 GPT-5.4 明显更聪明、更持久,在工具使用上更可靠。它能在更长时间内持续工作而不中途停止——这对于用户委托给 Cursor 的复杂、长时任务来说,是最关键的。”

Cursor 对这个评测结果感到满意。

下面展示一下 Codex(内置 GPT-5.5)的实际能力:

在计算机使用上,Codex操作电脑能力更强了。无论是识别屏幕内容,还是点击、打字、导航,甚至是跨工具流转上下文信息,它都能轻松搞定。

Codex还可以生成更高质量的电子表格、PPT和文档,如下是一个财务建模的demo。应用内新增的文件查看器,可加快审阅、修订和迭代速度,让文件更快准备好分享。


三、AA 独立评测:Intelligence Index 全球第一

OpenAI 自己说的不算,独立第三方怎么说?

Artificial Analysis 是目前最受认可的 AI 模型独立评测机构之一。他们发布的 GPT-5.5 评测结果非常能打:

GPT-5.5 在 Artificial Analysis Coding Index 上达到 60 分,排名全球第一。

而且关键在于:同样完成一项编程任务,GPT-5.5 消耗的 Token 数量比竞品前沿模型减少了一半。

AI 编程场景下,Token 用量直接关联成本。减少一半,意味着企业用 GPT-5.5 做代码辅助,成本只有竞品的一半,但智能水平更高。这个账很容易算。

此外,Artificial Analysis 的评测还关注了一个重要指标:幻觉率(Hallucination Rate)

大模型在编程场景中最怕的不是慢,是”一本正经地胡说八道”——代码看起来没问题,一运行全是错。GPT-5.5 在保持高准确率的同时,幻觉率大幅下降。真实工作场景下,GPT-5.5 的输出可靠性明显更高。

综合来看,Artificial Analysis 的评测维度覆盖了​准确率、幻觉率、Token 效率、上下文保持能力等多个关键指标,GPT-5.5 均处于前列。用更少的资源,做更准确的事,这正是 GPT-5.5 的核心价值。


四、知识工作与科学研究

编程之外,GPT-5.5 在知识工作和科学研究上也展现了真正的进步。

知识工作评测数据:

OpenAI 自己内部的实际应用案例也值得关注:

  • 财务团队:用 GPT-5.5 审查了 24,771 份 K-1 税表,共计 71,637 页,整个流程比上一年提前了两周完成。
  • GTM 团队:一位员工自动化生成了每周业务报告,每周节省 5-10 小时
  • 通讯团队:分析六个月的演讲请求数据,建立评分和风险框架,验证了自动化 Slack 机器人的可行性。
  • 科学研究方面,有几个令人印象深刻的进展:

GPT-5.5 在 GeneBench(遗传学和定量生物学多阶段分析评测)上达到 25.0%,远超 GPT-5.4 的 19.0%。这个评测的特殊之处在于:任务对应的是科学专家需要数天才能完成的项目

BixBench(真实生物信息学和数据分析)上,GPT-5.5 也取得了领先成绩。

更惊人的是,一个内置 GPT-5.5 的定制系统帮助发现了一个关于 Ramsey 数的新证明——这是组合数学中的核心问题之一,后来在 Lean 中得到了验证。

Jackson Laboratory 基因组医学免疫学教授 Derya Unutmaz 用 GPT-5.5 Pro 分析了一个包含 62 个样本、近 28,000 个基因的基因表达数据集。他说:这项工作如果由他的团队来完成,需要数月时间


五、速度不打折:GPT-5.4 的延迟,GPT-5.5 的智能

通常来说,更大、更聪明的模型,响应速度会更慢。但 OpenAI 这次做到了一个关键突破:

GPT-5.5 在保持 GPT-5.4 延迟水平的同时,智能水平大幅提升。

这背后的核心是 NVIDIA GB200 和 GB300 NVL72 系统。OpenAI 重新设计了推理架构,将整个系统作为一个整体来优化,而不是单独优化某个环节。

有趣的是,​Codex 和 GPT-5.5 本身也参与了这次优化工作——用 AI 来改进 AI 的基础设施。其中一个具体案例:Codex 分析了数周的生产流量数据,写了自定义启发式算法来优化负载均衡和任务分配,最终将 Token 生成速度提升了 ​20% 以上

简单说:这个模型帮助改进了它自己的运行环境。


六、FrontierMath:最难的数学

GPT-5.5 在 FrontierMath 前沿数学评测上取得了令人瞩目的突破:

FrontierMath Tier 4 达到 35.4%,是 GPT-5.4 的两倍以上,难度相当于数学家的研究级问题。GPT-5.5 Pro 更是达到 39.6%,在最难档位进一步拉开了差距。


七、API 定价与产品可用性

GPT-5.5 即日起向以下用户开放:

  • ChatGPT:Plus、Pro、Business、Enterprise 用户
  • Codex:Plus、Pro、Business、Enterprise、Edu、Go 用户,400K 上下文窗口
  • GPT-5.5 Pro:Pro、Business、Enterprise 用户

API 即将上线:

  • gpt-5.5:$5 / 1M tokens 输入,$30 / 1M tokens 输出
  • gpt-5.5-pro:$30 / 1M tokens 输入,$180 / 1M tokens 输出
  • Batch 定价:半价

虽然单价高于 GPT-5.4,但由于 Token 效率大幅提升,实际使用成本反而可能更低。


八、安全与防护

GPT-5.5 部署了 OpenAI 迄今为止最强的安全防护体系。网络安全能力被评定为”High”级别(在 Preparedness Framework 下),OpenAI 同步推出了多项措施:

  • 为网络攻击能力设计了更严格的控制机制
  • 通过 Trusted Access for Cyber 项目,向合规用户提供更宽松的网络安全能力访问权限
  • 与外部专家进行了数月的测试和迭代

这是行业向前走的必经之路:强大 AI 能力的释放,需要配套的信任机制和防护体系。


总结

GPT-5.5 的发布,意义不只是”又一个大模型”。

它真正值得关注的地方在于三点:

  1. 效率与智能的统一:更快、更聪明,不是以牺牲一个来换取另一个
  2. 编程能力的质变:在真实复杂任务上表现出真正的概念理解力,不只是统计模式匹配
  3. Token 效率的大幅提升:同样任务用更少 Token,对实际应用的成本结构有显著影响

如果说 GPT-4 是”能帮你写代码”,GPT-5.4 是”能帮你完成较长任务”,那么 GPT-5.5 正在接近的,是帮你完成需要真正理解的复杂工程工作

NVIDIA 企业 AI 副总裁 Justin Boitano 的评价算是做了一个很好的注脚:

“GPT-5.5 带来了持续性能,让我们能够从自然语言提示端到端交付功能,将复杂代码库的调试时间从几天缩短到几小时,将数周的实验变成一夜之间的进展。这不仅仅是更快的编程——而是一种全新的工作方式,让人们能够以完全不同的速度运作。”

如果觉得这篇文章有帮助,欢迎点赞、在看、转发!有问题也可以在评论区留言,我会尽量回复!


cover_image

AI兴观点 程叙架构与AI.

输入关键词开始搜索