DeepSeek V4.1 Flash发布:轻量模型反超旗舰,API升级与计费要点
发布时间:2026/9/13 23:46:58 作者:尧图编辑部 阅读量:1,286

9月10日DeepSeek发布了V4.1 Flash。有点反常识的是这是它新架构系列里尺寸最小的一款官方却说在基准测试里超过了包括V4 Pro在内的旗舰模型。据报道9月11日腾讯旗下WorkBuddy、CodeBuddy已全量接入OpenCode同步接入。对普通开发者来说最实际的是三件事模型名怎么换、价格怎么算、老模型什么时候下线。这次到底变了什么架构上V4.1 Flash是552B参数的MoE混合专家模型但用了一套新的Causal-Encoder-Decoder结构特点是输入和输出不对称——输入只激活8B参数输出激活16B。翻成大白话读进去的部分便宜写出来的部分才贵而模型总盘子还是很大。这和过去参数越大越强、成本越高的线性印象不太一样。成本上最狠的是缓存。官方称新一代把KV Cache压得很小对HBM高带宽显存的需求降到上一代的1/4对SSD的需求降到1/8相比初代模型KV Cache一共缩小了437倍。这个数字对做Agent、做长上下文应用的人最有意义因为这类场景里缓存命中的费用往往占大头。还有个信号Flash这次是反超Pro的。官方已明确将有序下线V4 Pro。过去Flash一直是廉价快速版如今轻量型号开始接替旗舰这在国产大模型里并不常见。对开发者意味着什么没变的是OpenAI兼容的调用方式没变base_url没变多模态还是输入图片、输出文字这个路子。变的是模型名和计费。模型名方面新版调用名改为deepseek-flash。旧的deepseek-v4-flash、deepseek-v4-flash-vision-exp已经下线出于兼容会被临时路由到V4.1 Flash。据官方说明北京时间9月14日12:00之后deepseek-v4-pro的请求也会全部路由到V4.1 Flash并按V4.1 Flash单价计费。也就是说代码里写死了老模型名短期不会报错但效果和价格在悄悄变。计费是峰值、闲时两档。闲时缓存命中输入0.02元/百万token缓存未命中输入1元/百万token输出4元/百万token高峰时段工作日9:00–12:00、14:00–18:00按2倍计。据报道缓存命中价相比上一代下降约六成。代码最简单基本就是改一个字符串fromopenaiimportOpenAI clientOpenAI(api_keysk-你的key,# 在 platform.deepseek.com 申请base_urlhttps://api.deepseek.com,)respclient.chat.completions.create(modeldeepseek-flash,# V4.1 Flash 的新模型名messages[{role:user,content:用 Python 写一个快速排序带注释}],)print(resp.choices[0].message.content) 标准openai库即可不用换SDK。## 怎么选、怎么省、有哪些坑1.**批量任务挪到闲时。**输出单价闲时是高峰的一半数据清洗、离线摘要、批量代码生成这种不急的活丢到晚上跑账单能省一半在线客服、实时补全这类场景就别为了省钱去等。2.**固定前缀让缓存命中。**命中0.02元 vs 未命中1元差50倍。做法是把系统提示、固定的知识片段放在消息最前面且不随轮次改后面再拼用户输入。前缀一变缓存就废了。3.**别迷信反超旗舰的宣传口径。**官方基准和你的业务常有差距。上生产前用真实样本跑一遍重点看格式遵循率、长上下文里指令有没有丢、以及你这类图片上的理解准确率。有测评称速度有数倍提升但那些数字来自内测第三方正式版要自己测。4.**留个回滚开关。**模型名、价格、能力这一周内都调整过把模型名做成配置项出问题能一键切回别硬编码。 想自己部署的话模型已在Hugging Face开源官方称大规模部署需要2k卡GPU和存储集群这门槛一般团队够不上走API更现实。 这一代的关键词其实是便宜和够快一起到位而不是单纯堆参数。你最近有没有把线上模型换掉换来换去省下的钱够不够覆盖重调一遍prompt的时间评论区聊聊。