FFALCONSHIRE / 研究
MODEL COMPARISON 数据快照 · 2026.09.30

推理强度,
值不值得再加一档?

五款模型,25 组原生推理组合。把表现、每题费用与等待时间放在一起,找出适合你任务的那一档。

GPT-5.6 SolGPT-6 SolGPT-6.1 SolGPT-6 AstraClaude Opus 5.5
追求最高综合表现 · Opus Max
57.62

本次比较的最高综合分

每题 $5.982;基准生成约 807 秒,首答等待约 693 秒。

6.1 Sol · XHigh → Max
+0.80分

边际收益下降,费用增加 84%

生成时间增加 110%。如果任务已在 XHigh 解决,Max 的额外投入未必值得。

比较口径:综合分是 AA Intelligence Index v4.3.2,不是正确率;每题费用是统一测试套件的加权平均“每次尝试”模型费用。生成时间按输出 token 与速度折算,包含推理输出量,未包含首 token 等待、工具执行及其他开销。
01 / OVERVIEW

同一档位,一眼比较

Low 对应 Codex 桌面的 Light;XHigh 对应 Extra High。每个面板独立着色。

综合能力

指数点 · 越高越好
模型 / 强度
Low
Medium
High
Xhigh
Max
GPT-5.6 Sol
33.5
39.2
42.3
44.0
47.0
GPT-6 Sol
33.9
39.8
42.8
44.1
47.5
GPT-6.1 Sol
42.1
47.8
50.2
51.0
51.8
GPT-6 Astra
45.8
49.6
50.9
52.4
52.7
Opus 5.5
42.3
51.2
53.6
56.0
57.6

每题模型费用

USD · 越低越好
模型 / 强度
Low
Medium
High
Xhigh
Max
GPT-5.6 Sol
$0.26
$0.50
$0.81
$1.18
$1.99
GPT-6 Sol
$0.13
$0.25
$0.38
$0.52
$1.05
GPT-6.1 Sol
$0.13
$0.21
$0.32
$0.39
$0.72
GPT-6 Astra
$0.82
$1.54
$1.73
$2.31
$3.26
Opus 5.5
$0.55
$1.34
$1.82
$3.46
$5.98

基准生成时间

秒 · 越低越好
模型 / 强度
Low
Medium
High
Xhigh
Max
GPT-5.6 Sol
54
107
177
252
353
GPT-6 Sol
48
70†
150
221
406
GPT-6.1 Sol
54
127
203
271
569
GPT-6 Astra
92
207
238
340
472
Opus 5.5
86
216
294
503
807

500 token 响应时间

秒 · 越低越好
模型 / 强度
Low
Medium
High
Xhigh
Max
GPT-5.6 Sol
9.0
11.8
16.0
31.3
104.6
GPT-6 Sol
9.2
10.2†
22.3
55.3
198.6
GPT-6.1 Sol
8.6
13.4
64.8
76.5
275.1
GPT-6 Astra
13.1
15.6
51.1
137.0
314.3
Opus 5.5
19.3
28.6
59.6
142.6
698.0
更弱 / 更贵 / 更慢 → 更强 / 更省 / 更快
† 6 Sol Medium 的时间:网页摘要缺测速,原始页面保留 100K 输入测试:91.93 token/s、首答 4.73 秒、500 token 响应 10.17 秒;每题输出 6442.47 token ÷ 91.93 = 70.1 秒。其他 24 行采用默认 10K 输入测速。该行时间口径不同,不能作严格横向排名;能力与费用仍同口径。
02 / ALL 25 COMBINATIONS

完整数据,每一档都列出

默认显示全部组合。筛选模型、强度或排序,查看你关心的取舍。手机可左右滑动表格。

模型强度综合分 ↑编程成功率 ↑HLE 正确率 ↑职业工作 Elo ↑每题 USD ↓生成秒数 ↓
GPT-5.6 SolLow33.471.0%39.4%1289$0.26154.4
GPT-5.6 SolMedium39.2414.6%42.2%1403$0.505107.0
GPT-5.6 SolHigh42.3520.7%46.0%1480$0.808176.9
GPT-5.6 SolXhigh44.0124.7%47.3%1548$1.184251.6
GPT-5.6 SolMax46.9739.9%49.5%1588$1.988353.1
GPT-6 SolLow33.909.1%34.9%1176$0.13347.6
GPT-6 SolMedium39.7818.7%41.0%1320$0.24770.1†
GPT-6 SolHigh42.8226.3%44.1%1376$0.375150.5
GPT-6 SolXhigh44.1030.3%46.3%1437$0.524221.3
GPT-6 SolMax47.5343.9%47.9%1487$1.049405.8
GPT-6.1 SolLow42.0830.8%47.4%1297$0.13154.1
GPT-6.1 SolMedium47.7848.0%49.9%1433$0.214126.9
GPT-6.1 SolHigh50.2451.5%51.4%1486$0.319202.7
GPT-6.1 SolXhigh51.0454.0%52.6%1510$0.393271.1
GPT-6.1 SolMax51.8356.1%52.9%1575$0.724568.7
GPT-6 AstraLow45.7841.9%49.2%1366$0.81891.7
GPT-6 AstraMedium49.5749.5%52.7%1468$1.541206.5
GPT-6 AstraHigh50.9254.0%53.1%1485$1.725238.3
GPT-6 AstraXhigh52.3959.6%54.6%1516$2.309339.5
GPT-6 AstraMax52.6759.1%54.7%1542$3.258471.5
Opus 5.5Low42.3131.3%48.3%1224$0.55186.2
Opus 5.5Medium51.2452.5%54.7%1576$1.336215.9
Opus 5.5High53.5856.6%55.6%1692$1.823294.2
Opus 5.5Xhigh55.9959.6%57.5%1820$3.459503.1
Opus 5.5Max57.6259.6%61.4%1846$5.982806.5
模型强度测速输入首答等待 / 秒 ↓500 token 响应 / 秒 ↓输出 token/s ↑
GPT-5.6 SolLow10K2.39.074.0
GPT-5.6 SolMedium10K4.911.872.7
GPT-5.6 SolHigh10K9.416.075.3
GPT-5.6 SolXhigh10K24.831.377.3
GPT-5.6 SolMax10K98.7104.684.7
GPT-6 SolLow10K2.09.269.0
GPT-6 SolMedium100K†4.7†10.2†91.9†
GPT-6 SolHigh10K14.722.365.9
GPT-6 SolXhigh10K48.255.370.3
GPT-6 SolMax10K192.1198.676.2
GPT-6.1 SolLow10K1.88.674.4
GPT-6.1 SolMedium10K5.313.462.0
GPT-6.1 SolHigh10K57.364.866.2
GPT-6.1 SolXhigh10K68.776.563.6
GPT-6.1 SolMax10K267.6275.166.8
GPT-6 AstraLow10K2.813.148.7
GPT-6 AstraMedium10K4.915.646.8
GPT-6 AstraHigh10K41.151.149.8
GPT-6 AstraXhigh10K126.9137.049.3
GPT-6 AstraMax10K305.6314.357.0
Opus 5.5Low10K12.519.373.6
Opus 5.5Medium10K21.928.674.5
Opus 5.5High10K52.959.674.1
Opus 5.5Xhigh10K136.3142.679.6
Opus 5.5Max10K692.6698.092.5
显示 25 / 25 组
编程:Terminal-Bench 4.0;职业工作:GDPval-AA v2.1。
下载全部 25 组;CSV 中的成功率 / 正确率以 0–1 小数保存。
等待时间不能直接相加:首答等待含回答前的思考;500 token 响应 = 首答等待 + 500 ÷ 输出速度。基准生成时间也包含推理输出量,二者有重叠、任务集合不同,不能相加作为整个任务耗时。6.1 Sol 从 Medium 升到 High,首答等待由约 5 秒跳到约 57 秒。
03 / TRADE-OFFS

接近综合能力时,谁更划算?

选择综合分相差不超过 1 点的配对;不是对所有具体任务等价的断言。

比较:左 / 右综合分每题美元左侧省钱生成秒数左侧时间变化
6.1 Medium / 6 Max47.78 / 47.53$0.214 / $1.04979.6%126.9 / 405.8短 68.7%
6.1 High / Astra High50.24 / 50.92$0.319 / $1.72581.5%202.7 / 238.3短 15.0%
6.1 XHigh / Opus Medium51.04 / 51.24$0.393 / $1.33670.6%271.1 / 215.9长 25.6%
Opus High / Astra Max53.58 / 52.67$1.823 / $3.25844.1%294.2 / 471.5短 37.6%

差值、百分比和情景费用按未舍入数据计算。分数接近不代表统计上等价;更便宜也不一定更快。

XHigh → Max:额外投入买到了什么?

模型综合分增加费用增加生成时间增加
GPT-5.6 Sol+2.96+68%+40%
GPT-6 Sol+3.43+100%+83%
GPT-6.1 Sol+0.80+84%+110%
GPT-6 Astra+0.29+41%+39%
Opus 5.5+1.64+73%+60%

具体任务,会改变排名

5.6 Sol 在全部五档的 GDPval 和 HLE 都高于 6 Sol,编程成功率则低于 6 Sol。只看综合分,会漏掉这类差异。

Astra 的编程成功率从 XHigh 的 59.6% 到 Max 的 59.1%。更高强度不会保证每个分项都上升。

Opus Max 的综合分最高,但 Astra XHigh 的编程成功率与它同为 59.6%;不能把一个分项的并列扩大到整体能力。

编程与终端任务成功率

% · 越高越好
0204060LowMediumHighXhighMaxGPT-5.6 Sol low: 1.0GPT-5.6 Sol medium: 14.6GPT-5.6 Sol high: 20.7GPT-5.6 Sol xhigh: 24.7GPT-5.6 Sol max: 39.9GPT-6 Sol low: 9.1GPT-6 Sol medium: 18.7GPT-6 Sol high: 26.3GPT-6 Sol xhigh: 30.3GPT-6 Sol max: 43.9GPT-6.1 Sol low: 30.8GPT-6.1 Sol medium: 48.0GPT-6.1 Sol high: 51.5GPT-6.1 Sol xhigh: 54.0GPT-6.1 Sol max: 56.1GPT-6 Astra low: 41.9GPT-6 Astra medium: 49.5GPT-6 Astra high: 54.0GPT-6 Astra xhigh: 59.6GPT-6 Astra max: 59.1Opus 5.5 low: 31.3Opus 5.5 medium: 52.5Opus 5.5 high: 56.6Opus 5.5 xhigh: 59.6Opus 5.5 max: 59.6

职业工作质量

GDPval-AA Elo · 越高越好
1200140016001800LowMediumHighXhighMaxGPT-5.6 Sol low: 1289.3GPT-5.6 Sol medium: 1403.0GPT-5.6 Sol high: 1480.0GPT-5.6 Sol xhigh: 1547.6GPT-5.6 Sol max: 1587.9GPT-6 Sol low: 1175.6GPT-6 Sol medium: 1320.1GPT-6 Sol high: 1376.0GPT-6 Sol xhigh: 1436.7GPT-6 Sol max: 1486.9GPT-6.1 Sol low: 1297.0GPT-6.1 Sol medium: 1432.9GPT-6.1 Sol high: 1486.4GPT-6.1 Sol xhigh: 1510.4GPT-6.1 Sol max: 1575.1GPT-6 Astra low: 1365.6GPT-6 Astra medium: 1467.9GPT-6 Astra high: 1484.5GPT-6 Astra xhigh: 1516.5GPT-6 Astra max: 1541.9Opus 5.5 low: 1223.5Opus 5.5 medium: 1576.2Opus 5.5 high: 1691.7Opus 5.5 xhigh: 1820.1Opus 5.5 max: 1846.2
GPT-5.6 SolGPT-6 SolGPT-6.1 SolGPT-6 AstraOpus 5.5
04 / PRICING

强度改变用量,不改变 token 单价

Standard API 短上下文价格;USD / 百万 token。输出费用包含推理 token。

模型输入缓存读取缓存写入输出,含推理
GPT-5.6 Sol$4.00$0.40$5.00$20.00
GPT-6 Sol$2.00$0.20$2.50$10.00
GPT-6.1 Sol$2.00$0.10$2.50$10.00
GPT-6 Astra$10.00$1.00$12.50$50.00
Opus 5.5$4.00$0.20$5 / 5分钟 · $8 / 1小时$20.00
OpenAI 超过 272K 输入的请求适用长上下文价格:输入与缓存单价翻倍,输出单价增加 50%。Opus 5.5 的整个 1M 上下文采用相同 Standard 单价。

Codex credits / 百万 token

模型输入缓存读取输出
GPT-5.6 Sol10010500
GPT-6 Sol505250
GPT-6.1 Sol502.5250
GPT-6 Astra250251250

API 与包月额度分开看

Codex credits 和 API 美元是不同计费口径,不能用每题美元费用反推包月剩余条数。Codex credit 计费没有单独的缓存写入收费。

本页比较 Standard 模式,未将 Fast、Ultrafast、Batch 的价格或速度混入主表。Claude 订阅使用其独立计费与限额。

05 / ULTRA SCENARIO

Ultra 能省多少时间?先看任务怎么拆

多代理并行模式,整体结果取决于拆分、协调和验证。以下是条件估算,不是实测。

调整估算假设

以各模型 Max 为单代理基线。假设分支等量独立、各代理使用同一模型的 Max;这不是对内部调度的事实描述。

任务无法拆分时,加速前提不成立。
重复读取上下文、写入缓存会提高这一比例。
费用 = (r + o) × 基线;生成时间 = (1/n + o) × 基线
1.25× 费用 · 0.58× 生成时间

估算结果 · 非实测

模型情景每题美元情景生成秒数
GPT-5.6 Sol$2.486206.0
GPT-6 Sol$1.312236.7
GPT-6.1 Sol$0.905331.7
GPT-6 Astra$4.072275.0

默认情景:三个分支各占原任务 ⅓,串行协调占 25%,不计重复上下文成本。费用增加 25%,生成部分缩短约 42%。

这里估算的是生成部分,不是完整等待时间,也不预测质量提升。不能把单代理 Max 分数直接当成 Ultra 整体分数。Opus 5.5 没有 Codex Ultra 这一原生选项。

06 / WHAT TO CHOOSE

把比较变成选择

基于这套基准的选择建议;具体任务的质量和验证要求仍决定最终档位。

简单任务 · 快速来回

6.1 Sol Low

$0.131 / 题;首答约 1.8 秒。

日常开发 · 分析 · 迭代

6.1 Sol Medium

综合 47.78;$0.214 / 题;首答约 5.3 秒。

更复杂的单任务

6.1 Sol High / XHigh

综合 50.24 / 51.04;每题 $0.319 / $0.393。接受约一分钟的首答等待。

预算充足 · 重视整体质量

Opus 5.5 High

综合 53.58;职业工作 Elo 1692;$1.823 / 题。

追求最高综合分

Opus 5.5 Max

综合 57.62;$5.982 / 题;首答等待约 11.5 分钟。

有独立分工的大任务

Ultra

按分支、上下文重复量与协调开销估算,而非固定的强度倍数。

07 / SOURCES & METHODOLOGY

数据来源与口径

核心能力、每题费用与时间数据由同一 AA 页面快照提取;官方文档用于核对价格与模式。

同一能力指数AA Intelligence Index v4.3.2 综合十项评估。本页 25 组原生推理组合都有非估算综合分,不将不同版本指数拼接。
测速是滚动中位数10K 输入测速取过去 72 小时;100K 取过去 14 天。快照日期不表示所有测量均在当天进行,也不是你所在地的延迟承诺。
Opus 的配置与审阅Opus 均为 AA 默认 Adaptive Reasoning、Default Fallback。研究口径与计算经 Opus 5.5 High 独立审阅;没有把基准结果扩展成所有任务的质量保证。