GPT-6.1 Sol 只卖旗舰五分之一,开发者该算清哪几笔账
发布时间:2026/10/7 14:18:21 作者:尧图编辑部 阅读量:1,286

OpenAI 在 9 月 29 日的 DevDay 上发布了 GPT-6.1 Sol。据多家媒体报道它把标准 API 价格定在每百万输入 token 2 美元、输出 10 美元缓存输入 0.10 美元——大约是其旗舰 GPT-6 Astra 的五分之一。Astra 的定价是输入 10 美元、输出 50 美元。同时谷歌在 9 月 30 日发布了主打编程与网络安全的 Gemini 4 Argon。一周之内头部厂商把前沿能力和低价这两件事摆上了同一张桌子。对我来说这轮发布的重点不是又多了几个跑分而是大模型的计价方式在变而这直接决定普通团队能不能把 Agent 跑起来。变的是什么计价从按量走向按缓存先把事实摆清楚。据报道GPT-6.1 Sol 的 API 模型 ID 是gpt-6.1-sol上下文窗口约 105 万 token单次最大输出 12.8 万 token。几种模式的单价大致如下单位美元/百万 token模式输入缓存输入缓存写入输出标准2.000.102.5010.00批量 / 弹性1.000.051.255.00快速4.000.205.0020.00最值得注意的是缓存输入只要 0.10 美元比标准输入便宜 95%。对单轮问答这点差别不大但对 Agent 这种一个任务里反复带上同一大段上下文的用法差别是数量级的。另外据报道单次请求输入超过 27.2 万 token 时整次请求按 2 倍输入、1.5 倍输出计费这轮促销价至少持续到 2026 年 11 月 21 日。没变的是什么模型能力的上限依然由旗舰模型把持。据报道在最难的研究任务上OpenAI 仍推荐用 AstraSol 的定位是接近旗舰、但便宜得多。它的价值不在登顶而在把可用的智能压到能规模化的价位。算一笔真实的账不要被每百万 token 两美元这种数字骗了Agent 的成本是乘出来的。下面这段代码可以直接跑按官方单价估算一轮任务的成本# 按公布单价估算单次调用成本单位美元PRICE{sol:{in:2.00,cached_in:0.10,out:10.00},astra:{in:10.00,cached_in:1.00,out:50.00},opus_5_5:{in:4.00,cached_in:0.20,out:20.00},}defcost(model,in_tok,cached_tok,out_tok):pPRICE[model]return(in_tok/1e6)*p[in]\(cached_tok/1e6)*p[cached_in]\(out_tok/1e6)*p[out]# 假设一轮 Agent10 万输入其中 9 万命中缓存1 万输出print(sol :,round(cost(sol,100_000,90_000,10_000),4))print(astra :,round(cost(astra,100_000,90_000,10_000),4))print(opus :,round(cost(opus_5_5,100_000,90_000,10_000),4))跑一遍就能看到同样一轮任务缓存命中和不命中之间差着一大截。据报道在 Terminal-Bench Science 0.1 这类科研评测上Sol 单任务平均成本约 5.47 美元而 Opus 5.5 约 23.21 美元、Astra 约 23.80 美元。差距主要就来自单价和缓存的组合。对从业者意味着什么第一先分清能力需求和成本需求。复杂架构设计、跨模块调试仍然该用能扛住的模型批量生成、跑测试、写文档这种重复劳动完全可以用便宜档位。用同一个贵模型跑完整个流水线是最容易烧钱的用法。第二缓存要主动设计。把系统提示、代码库摘要、工具定义这些不变的部分放在前面并固定下来让它们命中缓存成本能掉一个台阶。这是工程问题不是模型问题。第三注意长上下文罚金。超过阈值后按倍率计费意味着把整个仓库塞进去未必划算分块检索可能比一次性长输入更省。第四别只看价格表。据报道Sol 目前只在 ChatGPT Work 和 Codex 中对 Plus 及以上付费用户开放普通 Chat 用不了是否存在限速、并发限制要看具体账户条款。开通前先用小额流量实测再决定是否迁移。收尾这一轮的价格战本质是把能用得起这件事往前推了一大步。但便宜的模型不等于省钱计价模式越复杂越考验工程上的取舍。你的项目现在是按能力选模型还是按成本选模型评论区聊聊。