先看任务
Text Arena 衡量的是人类偏好对战,不等同于代码、Agent、视觉或特定领域任务的全面能力。
将可核验的 Arena 文本偏好快照与官方 API 选型信号分开呈现,避免把榜单名次误读为通用结论。
MODEL SIGNAL / 2026.07.10 SNAPSHOT
这里把可复核的 Arena 文本偏好快照,与真实开发时更重要的上下文、价格、工具能力和中文可用性分开呈现。
Text Arena 衡量的是人类偏好对战,不等同于代码、Agent、视觉或特定领域任务的全面能力。
预览版、低投票模型的位次波动更大;状态标签与投票数和分数同样重要。
实际选型要回到官方 API 文档:上下文、输入类型、工具调用、区域可用性与价格。
DEVELOPER SHORTLIST
这些卡片不构成名次。它们只把适合优先试用的工作流,连同官方能力与价格入口放在一起。
Anthropic
1M 上下文;API 标价 $5 / $25 每百万 token。适合把可靠性放在成本之前的工作流。
OpenAI
1.05M 上下文;文档列出 $5 / $30 每百万 token,并支持图像输入、函数与结构化输出。
适合需要图像、长资料或 Google 工具链的原型;Preview 代表接口和价格仍可能变化。
阿里云百炼
官方文档标注 1M 上下文,并提供思考、工具调用、内置工具与结构化输出能力。
DeepSeek
1M 上下文;官方价格页列出缓存未命中输入 $0.435、输出 $0.87 每百万 token。
Moonshot AI
256K 上下文,支持文本、图像、视频输入、ToolCalls 与 JSON;按官方价格页确认具体套餐。
VERIFIABLE SNAPSHOT
这是有日期的静态快照,不是实时总榜,也不是跨基准的“最强模型”结论。
| Rank | Model / Lab | Score | 状态 | Votes | Price $/M | Context |
|---|---|---|---|---|---|---|
| #1 | claude-fable-5 Anthropic | 1505±8 | 样本较少 | 7,252 | — | — |
| #2 | claude-opus-4-6-thinking Anthropic | 1504±4 | 正式 | 58,968 | $5 / $25 | 1M |
| #3 | claude-opus-4-7-thinking Anthropic | 1503±4 | 正式 | 46,183 | $5 / $25 | 1M |
| #4 | claude-opus-4-6 Anthropic | 1498±4 | 正式 | 62,650 | $5 / $25 | 1M |
| #5 | claude-opus-4-7 Anthropic | 1494±4 | 正式 | 47,222 | $5 / $25 | 1M |
| #6 | muse-spark-1.1 Meta | 1490±10 | PRELIMINARY | 3,750 | $1.25 / $4.25 | — |
| #7 | muse-spark Meta | 1488±6 | PRELIMINARY | 13,573 | — | — |
| #8 | gpt-5.6-sol-xhigh OpenAI | 1486±14 | 样本较少 | 1,740 | $5 / $30 | 1.1M |
| #9 | gemini-3-pro Google | 1486±4 | 正式 | 41,308 | $2 / $12 | 1M |
| #10 | gemini-3.1-pro-preview Google | 1485±4 | Preview | 78,561 | $2 / $12 | 1M |