跳到正文
世傲命的技术观测站 PERSONAL TECHNOLOGY OBSERVATORY

Arena 大模型排行榜

将可核验的 Arena 文本偏好快照与官方 API 选型信号分开呈现,避免把榜单名次误读为通用结论。

MODEL SIGNAL / 2026.07.10 SNAPSHOT

别把一张总榜,当成你的模型选型结论。

这里把可复核的 Arena 文本偏好快照,与真实开发时更重要的上下文、价格、工具能力和中文可用性分开呈现。

01

先看任务

Text Arena 衡量的是人类偏好对战,不等同于代码、Agent、视觉或特定领域任务的全面能力。

02

再看样本

预览版、低投票模型的位次波动更大;状态标签与投票数和分数同样重要。

03

最后算成本

实际选型要回到官方 API 文档:上下文、输入类型、工具调用、区域可用性与价格。

DEVELOPER SHORTLIST

按工作流选,不按综合分数选

这些卡片不构成名次。它们只把适合优先试用的工作流,连同官方能力与价格入口放在一起。

01

Anthropic

Claude Opus 4.8

复杂推理、长文档与高风险交付

1M 上下文;API 标价 $5 / $25 每百万 token。适合把可靠性放在成本之前的工作流。

02

OpenAI

GPT-5.6 Sol

工具调用、结构化输出与多模态产品

1.05M 上下文;文档列出 $5 / $30 每百万 token,并支持图像输入、函数与结构化输出。

03

Google

Gemini 3.1 Pro Preview

多模态理解、Google 生态与长上下文实验

适合需要图像、长资料或 Google 工具链的原型;Preview 代表接口和价格仍可能变化。

04

阿里云百炼

Qwen3.7 Max

中文推理、工具调用与企业应用

官方文档标注 1M 上下文,并提供思考、工具调用、内置工具与结构化输出能力。

05

DeepSeek

DeepSeek V4-Pro

成本敏感的推理、JSON 与工具调用

1M 上下文;官方价格页列出缓存未命中输入 $0.435、输出 $0.87 每百万 token。

06

Moonshot AI

Kimi K2.6

中文多模态、搜索与日常 Agent 原型

256K 上下文,支持文本、图像、视频输入、ToolCalls 与 JSON;按官方价格页确认具体套餐。

VERIFIABLE SNAPSHOT

Text Arena Overall

这是有日期的静态快照,不是实时总榜,也不是跨基准的“最强模型”结论。

  • 2026 年 7 月 10 日采样日期
  • 7,274,904累计 votes
  • 374入榜 models
查看 Arena 官方实时数据 价格与上下文为该快照的展示字段;正式采购或集成前,请以厂商当日 API 文档为准。
Rank Model / Lab Score 状态 Votes Price $/M Context
#1 claude-fable-5 Anthropic 1505±8 样本较少 7,252
#2 claude-opus-4-6-thinking Anthropic 1504±4 正式 58,968 $5 / $25 1M
#3 claude-opus-4-7-thinking Anthropic 1503±4 正式 46,183 $5 / $25 1M
#4 claude-opus-4-6 Anthropic 1498±4 正式 62,650 $5 / $25 1M
#5 claude-opus-4-7 Anthropic 1494±4 正式 47,222 $5 / $25 1M
#6 muse-spark-1.1 Meta 1490±10 PRELIMINARY 3,750 $1.25 / $4.25
#7 muse-spark Meta 1488±6 PRELIMINARY 13,573
#8 gpt-5.6-sol-xhigh OpenAI 1486±14 样本较少 1,740 $5 / $30 1.1M
#9 gemini-3-pro Google 1486±4 正式 41,308 $2 / $12 1M
#10 gemini-3.1-pro-preview Google 1485±4 Preview 78,561 $2 / $12 1M