我最初想把 GPT-5.6、GPT-5.5 和 Claude 排成一张大表。写到一半就停了。那样看起来很完整,实际却帮不了我做决定。
原因很简单。GPT-5.6 是模型族,Codex 是拿模型干活的产品,图像理解和图像生成又是两条不同的赛道。把它们混成“谁最强”,最后只会得到一个很像结论、却没法落到工作里的答案。
所以这篇不做万能排名。我更关心三件事:日常写代码时,默认该开哪个档位;遇到真正麻烦的改造时,什么时候值得花更多钱;需要处理截图、文档或出图时,到底该比较什么。
价格均为 2026-07-13 的官方美元 API 价,单位为每百万 token。ChatGPT/Codex 的订阅额度与 API 账单不是一回事。
钱花在哪里,先算清
上图把公开的 DeepSWE v1.1 分数和标准 API 成本放在一起。它不是独立测评,也不该被当成采购结论,但它把我关心的取舍暴露得很直白:Terra 已经很接近 Sol,账单却小得多;Sol 和 GPT-5.5 的标价相同,继续停在 5.5 没什么道理;Fable 5 的分数有竞争力,但它的价格不是“顺手多开一个”的级别。
| 模型 | 我会把它放在哪 | 上下文 / 最大输出 | 输入 / 缓存读 / 输出 | 100 万输入 + 100 万输出 |
|---|---|---|---|---|
| GPT-5.6 Sol | 跨模块改造、疑难问题、长链验证 | 105 万 / 12.8 万 | $5 / $0.50 / $30 | $35 |
| GPT-5.6 Terra | 日常默认 | 105 万 / 12.8 万 | $2.50 / $0.25 / $15 | $17.50 |
| GPT-5.6 Luna | 已验证为简单的批量工作 | 105 万 / 12.8 万 | $1 / $0.10 / $6 | $7 |
| GPT-5.5 | 旧提示词或行为回归 | 105 万 / 12.8 万 | $5 / $0.50 / $30 | $35 |
| Claude Fable 5 | 高价值任务的第二意见 | 100 万 / 12.8 万 | $10 / $1 / $50 | $60 |
| Claude Opus 4.8 | 已在 Anthropic 工作流里的复杂任务 | 100 万 / 12.8 万 | $5 / $0.50 / $25 | $30 |
| Claude Sonnet 5 | 成本和质量都要控住的工作流 | 100 万 / 12.8 万 | $2 / $0.20 / $10 至 8 月 31 日 | $12 |
| Claude Haiku 4.5 | 分类、提取、吞吐优先的批量任务 | 20 万 / 6.4 万 | $1 / $0.10 / $5 | $6 |
还有两个容易被表格掩盖的细节。OpenAI 的输入超过 128K 后会进入长上下文价格,Sol 变成 $10 输入 / $45 输出;缓存写也不是免费。Anthropic 则提示新 tokenizer 对同一段文本可能会多出约 30% token。标价相近,月末账单不一定相近。
跑分让我改了默认选择
我不会拿一张 benchmark 决定整个团队的模型策略。但它对“先试谁”很有用。
| 模型 | SWE-Bench Pro | DeepSWE v1.1 | Terminal-Bench 2.1 |
|---|---|---|---|
| GPT-5.6 Sol | 64.6 | 72.7 | 88.8 |
| GPT-5.6 Terra | 63.4 | 69.6 | 87.4 |
| GPT-5.6 Luna | 62.7 | 67.2 | 84.7 |
| GPT-5.5 | 59.4 | 67.0 | 85.6 |
| Claude Fable 5 | 80.0 | 69.7 | 83.1 |
| Claude Opus 4.8 | 69.2 | 59.0 | 78.9 |
这些数来自 OpenAI 的 GPT-5.6 发布对照,里面也列了 Claude。它们更像一张方向图,而不是裁判判决。
我的落点是这样的:Terra 负责每天的改代码、跑测试和中型重构;问题开始跨模块、需要浏览器或长链复查时,我再切 Sol。关键修复如果很贵,或者我已经被一次错误答案坑过,我会让 Fable 5 或 Opus 4.8 再跑一遍。不是为了“多模型显得专业”,而是为了让第二次推理有不同的失败方式。
Mythos 5 的公开成绩也很高,但它属于限量的 Project Glasswing。我不会把买不到的东西写进常规方案。
图片这部分,别再问“谁最强”
这张图是我写这篇文章时最想强调的一点。让模型读 UI 截图、看 PDF 里的图表,和让模型生成一张海报,输入、输出、错误形式都不同。把 Claude、GPT-5.6 和专用出图模型塞进同一份“图片能力榜”,结论一定会歪。
看截图、读表格、核文档
| 模型组 | 能力边界 | 我会用在什么地方 |
|---|---|---|
| GPT-5.6 Sol / Terra / Luna | Sol 在 OSWorld 2.0 的屏幕视觉加电脑操作任务为 62.6%;Codex 可在工作流里回看渲染结果 | UI 截图分析、浏览器操作、交付前检查 |
| GPT-5.5 | 同样走长上下文多模态路线,但公开 agent 指标通常弱于 5.6 | 兼容旧提示词、对照回归 |
| Claude Fable 5 / Opus 4.8 / Sonnet 5 | 最高 2576px 长边、4784 visual tokens;1M 上下文模型单请求最多 600 张图 | 高分辨率文档、表格、图表、多图比较 |
| Claude Haiku 4.5 | 标准分辨率 1568px、1568 visual tokens | 低成本分类、提取和问答 |
Claude 官方对坐标输出的说法很克制:它只能近似定位。涉及按钮位置、密集表格或 OCR 时,我仍会抽样复核。模型能看图,不等于它会替你承担错一个数字的代价。
真正要出图或修图,才去看 Arena
这份快照来自 Arena 的 Text-to-Image 榜 和 Image Editing 榜。它使用盲测偏好和 Elo,适合比较专用图片模型在“出一张新图”与“按指令改一张图”上的结果。
截至图中的快照,gpt-image-2 (medium) 同时位居两个任务的首位。这个信息对选出图模型很有用,但它不能证明 GPT-5.6 比 Claude 更会读合同,也不能替代产品自己的样本测试。榜单会更新,编辑任务里的 Muse 和 Grok 在快照中还标着 Preliminary,我用空心点保留了这个不确定性。
我更愿意拿一组小而脏的真实样本做最后判断:10 张 UI 截图、10 页带表格或图表的文档、10 个图片编辑请求。记录事实提取对不对、文字和布局错没错、人工返工几次、花了多久。这个 30 题小集,比一张漂亮的总榜更接近会不会真的省时间。
Codex 这次不只是换了模型
我更在意的产品变化其实在模型选择器之外。2026-07-09 后,Codex 进了 ChatGPT 桌面端,可以直接改 Markdown 和代码、对选中内容加行内注释;GitHub PR 审阅也放进侧栏,review 反馈和 diff 不必来回跳。一个项目还能跨多个仓库工作。
这不算改变编程的基本事实,但会改变我交代任务的方式。对于需要看代码、改文档、查 PR、再回头验证页面的工作,它少了一些“把上下文搬来搬去”的动作。CLI 0.144.0 还加了额度 reset credit 选择、writes 审批模式、MCP 交互式认证和 Ultra 用量预警。0.144.1 主要是安装与 code mode 的可靠性修复。
订阅的区别主要还是额度。Plus 是 $20/月,Pro 有 $100 与 $200 两档;Free/Go 的 Codex 使用 Terra,Plus 及以上可选 Sol、Terra、Luna。Ultra 从 Plus 起可用。最终能看到哪些模型,以自己账户里的 picker 为准。
我会怎么用
默认我会开 Terra。它不是每项公开分数都最高,但日常工作里最像一个不需要反复算账的选择。
碰到跨模块重构、疑难 bug、浏览器验证或需要长时间盯住一个任务时,我会换 Sol。能拆成许多互不干扰子任务、而且时间比额度更重要时,才开 Ultra。
需要一个独立复核时,我会用 Fable 5 或 Opus 4.8 再做一次,而不是把同一个模型重跑三遍。处理截图、表格和图表时,Sol 与 Claude 的高分辨率 vision 档都值得试。真正要生成或修图,就离开语言模型的赛道,直接比较专用图片模型。
COMMUNITY DISCUSSION
评论
使用 GitHub 账号登录后参与讨论,评论会同步到 GitHub Discussions。