9月30日谷歌发布了新一代旗舰模型 Gemini 4 Argon。这次最扎眼的参数不是某个跑分而是单次输出上限从过去的 6.4 万 token 一口气提到 100 万 token翻了十五倍以上。据多家媒体报道它在 18 项基准测试中有 13 项拿下第一API 定价为每百万输入 token 2 美元、每百万输出 token 10 美元缓存输入还有 95% 的折扣。首批只向受信任的网络安全防御者开放之后才会逐步放开给付费 API 客户和 Google AI Ultra 订阅者。我这边的第一反应是又发新模型了。但仔细看了下这次的重点其实不在谁又屠榜了而在输出这个词上。这个东西值得普通开发者花十分钟搞明白。先分清读和写输出上限和上下文窗口是两码事这几天的讨论里最容易混淆的就是这两个概念我得先把它掰开。上下文窗口Context Window指的是模型一次能读进去多少 token。这两年大家比的就是这个从 8K 涨到 128K、再到百万级。单次输出上限Output Token Limit指的是模型一次任务里能写出来多少 token。这个数字长期被卡在 8K 到 64K 之间涨得比上下文慢得多。打个不太精确的比方上下文窗口是模型的书桌有多大能摊开多少资料输出上限是它一口气能写多长的报告。书桌早就换成大班台了但笔一直不太够用写几段就得停下来等你催一句继续。Argon 这次把笔换长了。据媒体报道它能在一个任务轨迹里维持连续的推理链从头到尾生成数万行带上下文关联的代码而不是被人一段一段拆着喂。官方释出的内部案例里有一个是把 libgav1 的 C/C 代码迁移到 Rust替换掉约 3.2 万行 SIMD 代码产出的内存安全解码器据称比原来的 Rust 移植版快 2.7 倍。这个变长对哪类任务有用主要是三类大型代码迁移、深度研究、多步骤的企业流程。反过来如果你平时就是问一句答一句改个 bug输出上限涨到多少跟你关系不大。没变的东西比变了的更值得看新模型发布吹的部分看官方稿就够了我更想看它没解决什么。第一评测成绩和真实体验仍有差距。据彭博社报道谷歌内部对 Gemini 4 在编码等关键任务上的表现仍有疑问有知情人士称模型在行业基准上很亮眼但员工实际使用时部分编码任务还是难以稳定完成。这话不是黑它是所有模型都有的老问题——跑分是跑分干活是干活。谁能把这两个数字对齐谁才真的赢。第二宣称的自我改进要打问号。这几天有 DeepMind 研究员在社交平台上宣称 Gemini 4 已实现 RSI递归自我改进相关论文也挂到了预印本库。这个说法目前处在据报道的阶段学界和工业界对它的界定还有很大争议。作为普通从业者看到AI 自己训练自己这种标题先别激动等可复现的结果出来再说。第三开放策略变保守了。以前谷歌发模型基本是全量放开这次走的是分阶段、先给网络安全防御者的路子还参与了美国政府推动的模型预发布自愿流程。这背后是一整套安全考量对网络攻击和生化核相关滥用请求做限制、内部激活监测、自动化红队测试。说白了能力越强厂商越不敢一次放出来。对普通开发者现在能做什么别踩什么坑能做什么模型能力逼近、价格又便宜对做长文档生成、代码库迁移、多步骤自动化的人来说是实打实的利好。尤其是缓存输入享 95% 折扣这条——如果你反复用同一份长文档比如一份几万行的大文件、一本技术手册当背景成本会明显下来。调用上谷歌的官方 SDK 形态大致是这样模型名以官方文档为准不要照抄我这里的占位符fromgoogleimportgenai clientgenai.Client(api_keyYOUR_API_KEY)respclient.models.generate_content(modelgemini-4-argon,# 名称以官方文档为准contents把这些 C 代码迁移到 Rust保持语义一致并给出改动说明,)print(resp.text)**别踩的坑**1.**输出 token 比输入贵得多**。输入2美元、输出10美元每百万 token是5倍的关系。输出上限提到100万听着爽但真让它吐100万 token账单也不便宜。长输出之前先想清楚是不是真需要。2.2.**长输出不等于长质量**。模型能连续写不代表每一段都靠谱。几十万 token 的结果人工审查的成本可能比生成成本还高。指望它一次生成完就交付风险很大。3.3.**现在大概率还用不上**。首批只给网络安全防御者普通开发者和企业要等后续开放。看到发布了就急着改自己项目的架构属于给自己加戏。4.4.**别把它当万能迁移工具**。内部案例是谷歌自己挑的、自己跑的你没看到失败的那一批。大规模代码迁移还是得准备回滚和测试。## 收尾一句话总结Gemini4Argon 最实质的变化是把模型的连续写作能力往上顶了一个量级这对长周期、大工程类任务是有意义的进步但它能不能兑现还得看真实工作里的稳定性以及普通开发者什么时候能用上。至于AI 自己训练自己那套说法观望就好。 你觉得输出上限涨到100万 token对日常工作是真需求还是参数内卷评论区聊聊。