DeepSeek 又开源一个 763B 模型:每个 token 只激活 16B、1M 上下文,第三方实测输出每百万 1.
9 月 10 日,DeepSeek 放出 V4.1 Flash:权重已经在 Hugging Face 上,MIT 许可、可商用;结构是 MoE,总参数 763B、每个 token 只激活 16B,上下文窗口 1M,支持文字加图片输入。Hacker News 上这条当天拿到 1,001 分,是这周热度最高的一条模型消息。
真正值得看的是第三方的独立测试。Artificial Analysis 给出的数据是:智能指数 40 分,输出速度 190 tokens/秒,首 token 延迟 1.00 秒;按 DeepSeek 的 API 计价,输入每百万 0.30 美元、输出每百万 1.20 美元,缓存折扣 98%。价格和速度都排在开源模型的第一档——它把"接近旗舰、便宜一截"这条线又往下压了一格。
但同一份评测里有个不好看的数据:跑完整个智能指数,这个模型生成了 2.5 亿个输出 token,同尺寸开源模型的中位数是 1.3 亿,接近两倍。价格低、话多,最后的账单不一定低——这跟上个月几个编码模型被吐槽"过度思考、轮次太多"是同一类问题。
官方渠道目前只有公告和权重仓,DeepSeek 官方 API 定价页上列的仍然是 deepseek-v4-flash 和 deepseek-v4-pro 两行,没有单独给 V4.1 Flash 列价;第三方报的 0.30/1.20 美元是它自己的测评计价口径,官方页面的峰谷价是另一套数字(缓存未命中输入 0.22—0.44 美元、输出 0.66—1.32 美元每百万)。另外,跑分、速度都是第三方环境的结果,跟你的任务分布可能差很远。
我的判断:想给编码 Agent 换便宜模型的团队,可以把它放进候选,但别只看单价。先量一遍自己工作流里输出 token 的占比,如果输出占大头,啰嗦模型的单价优势会被它自己吃掉。
你换模型时先看单价,还是先看它跑一轮实际花多少 token?
