跳到正文
世傲命的技术观测站 PERSONAL TECHNOLOGY OBSERVATORY
文章 AI 模型 2026-07

我会怎样选 GPT-5.6、Codex 与 Claude

不把模型名、Codex 更新和图像能力混成一张大表。用成本与 DeepSWE 图、Image Arena 快照和实际任务,整理我会怎样分配 GPT-5.6 与 Claude。

我最初想把 GPT-5.6、GPT-5.5 和 Claude 排成一张大表。写到一半就停了。那样看起来很完整,实际却帮不了我做决定。

原因很简单。GPT-5.6 是模型族,Codex 是拿模型干活的产品,图像理解和图像生成又是两条不同的赛道。把它们混成“谁最强”,最后只会得到一个很像结论、却没法落到工作里的答案。

所以这篇不做万能排名。我更关心三件事:日常写代码时,默认该开哪个档位;遇到真正麻烦的改造时,什么时候值得花更多钱;需要处理截图、文档或出图时,到底该比较什么。

价格均为 2026-07-13 的官方美元 API 价,单位为每百万 token。ChatGPT/Codex 的订阅额度与 API 账单不是一回事。

钱花在哪里,先算清

DeepSWE v1.1 与标准 API 成本取舍图

上图把公开的 DeepSWE v1.1 分数和标准 API 成本放在一起。它不是独立测评,也不该被当成采购结论,但它把我关心的取舍暴露得很直白:Terra 已经很接近 Sol,账单却小得多;Sol 和 GPT-5.5 的标价相同,继续停在 5.5 没什么道理;Fable 5 的分数有竞争力,但它的价格不是“顺手多开一个”的级别。

模型我会把它放在哪上下文 / 最大输出输入 / 缓存读 / 输出100 万输入 + 100 万输出
GPT-5.6 Sol跨模块改造、疑难问题、长链验证105 万 / 12.8 万$5 / $0.50 / $30$35
GPT-5.6 Terra日常默认105 万 / 12.8 万$2.50 / $0.25 / $15$17.50
GPT-5.6 Luna已验证为简单的批量工作105 万 / 12.8 万$1 / $0.10 / $6$7
GPT-5.5旧提示词或行为回归105 万 / 12.8 万$5 / $0.50 / $30$35
Claude Fable 5高价值任务的第二意见100 万 / 12.8 万$10 / $1 / $50$60
Claude Opus 4.8已在 Anthropic 工作流里的复杂任务100 万 / 12.8 万$5 / $0.50 / $25$30
Claude Sonnet 5成本和质量都要控住的工作流100 万 / 12.8 万$2 / $0.20 / $10 至 8 月 31 日$12
Claude Haiku 4.5分类、提取、吞吐优先的批量任务20 万 / 6.4 万$1 / $0.10 / $5$6

还有两个容易被表格掩盖的细节。OpenAI 的输入超过 128K 后会进入长上下文价格,Sol 变成 $10 输入 / $45 输出;缓存写也不是免费。Anthropic 则提示新 tokenizer 对同一段文本可能会多出约 30% token。标价相近,月末账单不一定相近。

跑分让我改了默认选择

我不会拿一张 benchmark 决定整个团队的模型策略。但它对“先试谁”很有用。

模型SWE-Bench ProDeepSWE v1.1Terminal-Bench 2.1
GPT-5.6 Sol64.672.788.8
GPT-5.6 Terra63.469.687.4
GPT-5.6 Luna62.767.284.7
GPT-5.559.467.085.6
Claude Fable 580.069.783.1
Claude Opus 4.869.259.078.9

这些数来自 OpenAI 的 GPT-5.6 发布对照,里面也列了 Claude。它们更像一张方向图,而不是裁判判决。

我的落点是这样的:Terra 负责每天的改代码、跑测试和中型重构;问题开始跨模块、需要浏览器或长链复查时,我再切 Sol。关键修复如果很贵,或者我已经被一次错误答案坑过,我会让 Fable 5 或 Opus 4.8 再跑一遍。不是为了“多模型显得专业”,而是为了让第二次推理有不同的失败方式。

Mythos 5 的公开成绩也很高,但它属于限量的 Project Glasswing。我不会把买不到的东西写进常规方案。

图片这部分,别再问“谁最强”

视觉理解和图像生成是不同的评测赛道

这张图是我写这篇文章时最想强调的一点。让模型读 UI 截图、看 PDF 里的图表,和让模型生成一张海报,输入、输出、错误形式都不同。把 Claude、GPT-5.6 和专用出图模型塞进同一份“图片能力榜”,结论一定会歪。

看截图、读表格、核文档

模型组能力边界我会用在什么地方
GPT-5.6 Sol / Terra / LunaSol 在 OSWorld 2.0 的屏幕视觉加电脑操作任务为 62.6%;Codex 可在工作流里回看渲染结果UI 截图分析、浏览器操作、交付前检查
GPT-5.5同样走长上下文多模态路线,但公开 agent 指标通常弱于 5.6兼容旧提示词、对照回归
Claude Fable 5 / Opus 4.8 / Sonnet 5最高 2576px 长边、4784 visual tokens;1M 上下文模型单请求最多 600 张图高分辨率文档、表格、图表、多图比较
Claude Haiku 4.5标准分辨率 1568px、1568 visual tokens低成本分类、提取和问答

Claude 官方对坐标输出的说法很克制:它只能近似定位。涉及按钮位置、密集表格或 OCR 时,我仍会抽样复核。模型能看图,不等于它会替你承担错一个数字的代价。

真正要出图或修图,才去看 Arena

Text-to-Image 与 Image Editing Arena 榜单快照

这份快照来自 Arena 的 Text-to-Image 榜Image Editing 榜。它使用盲测偏好和 Elo,适合比较专用图片模型在“出一张新图”与“按指令改一张图”上的结果。

截至图中的快照,gpt-image-2 (medium) 同时位居两个任务的首位。这个信息对选出图模型很有用,但它不能证明 GPT-5.6 比 Claude 更会读合同,也不能替代产品自己的样本测试。榜单会更新,编辑任务里的 Muse 和 Grok 在快照中还标着 Preliminary,我用空心点保留了这个不确定性。

我更愿意拿一组小而脏的真实样本做最后判断:10 张 UI 截图、10 页带表格或图表的文档、10 个图片编辑请求。记录事实提取对不对、文字和布局错没错、人工返工几次、花了多久。这个 30 题小集,比一张漂亮的总榜更接近会不会真的省时间。

Codex 这次不只是换了模型

我更在意的产品变化其实在模型选择器之外。2026-07-09 后,Codex 进了 ChatGPT 桌面端,可以直接改 Markdown 和代码、对选中内容加行内注释;GitHub PR 审阅也放进侧栏,review 反馈和 diff 不必来回跳。一个项目还能跨多个仓库工作。

这不算改变编程的基本事实,但会改变我交代任务的方式。对于需要看代码、改文档、查 PR、再回头验证页面的工作,它少了一些“把上下文搬来搬去”的动作。CLI 0.144.0 还加了额度 reset credit 选择、writes 审批模式、MCP 交互式认证和 Ultra 用量预警。0.144.1 主要是安装与 code mode 的可靠性修复。

订阅的区别主要还是额度。Plus 是 $20/月,Pro 有 $100 与 $200 两档;Free/Go 的 Codex 使用 Terra,Plus 及以上可选 Sol、Terra、Luna。Ultra 从 Plus 起可用。最终能看到哪些模型,以自己账户里的 picker 为准。

我会怎么用

默认我会开 Terra。它不是每项公开分数都最高,但日常工作里最像一个不需要反复算账的选择。

碰到跨模块重构、疑难 bug、浏览器验证或需要长时间盯住一个任务时,我会换 Sol。能拆成许多互不干扰子任务、而且时间比额度更重要时,才开 Ultra。

需要一个独立复核时,我会用 Fable 5 或 Opus 4.8 再做一次,而不是把同一个模型重跑三遍。处理截图、表格和图表时,Sol 与 Claude 的高分辨率 vision 档都值得试。真正要生成或修图,就离开语言模型的赛道,直接比较专用图片模型。

来源


COMMUNITY DISCUSSION

评论

使用 GitHub 账号登录后参与讨论,评论会同步到 GitHub Discussions。