群发资讯网

API 越用越贵?扩散模型 Mercury 2.5 上线:1107 token/

API 越用越贵?扩散模型 Mercury 2.5 上线:1107 token/秒、输入每百万 4 美分,编码 Agen
Inception Labs 9 月 8 日发布 Mercury 2.5,一家做“扩散式大模型”的公司,主打用更低的算力成本跑出接近前沿模型的输出。
官方口径三个数字最重要:1107 token/秒的生成速度、260K 上下文、API 输入每百万 token 0.20 美元、输出 0.75 美元,上线期再打 80% 折扣,等于输入 0.04 美元、输出 0.15 美元。对按 token 计费的开发团队,这意味着大量“次要但高频”的模型调用有了便宜得多的去处。
质量上官方称比 Mercury 2 提升 40%,定位对标 GPT-5.6 Luna(低档)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 这类“成本优化型”模型,而不是旗舰。它真正的卖点在实测:Augment Code 把上下文压缩这类杂活切给 Mercury,延迟从约 150 秒降到 27 秒(降 82%),成本降 90%;做电话 AI 的 OpenCall 说切换后 P99 响应从几分钟掉到 1 秒,P50 从 0.4 秒降到 0.2 秒以下。搜索、语音、编码子 Agent 这类要反复调用的场景,是它现在的主战场。

它质量对标的是中端成本模型,不是最强推理;“扩散式 LLM”是新路线,生态和兼容性比主流模型小;折扣价是发布期促销,不是永久价格;企业要的数据驻留和合规控制得单独谈。
我的判断:Mercury 2.5 不是要取代你的主模型,而是给“plan/压缩/路由/总结”这类高频低难度调用一个省钱选项——先算清楚哪些调用在烧钱,再决定要不要加这条路。

如果你在跑编码 Agent,最想先拿哪种调用试水:上下文压缩,还是模型路由?