10 分钟录音 2 秒转完:欧洲实验室一次放出 18 个端侧模型,但评论区认出 Voz 的底子是英伟达 Parakeet
9 月 9 日,欧洲的 Desert Ant Labs(做视频 App Detail 的团队)一次放出 18 个端侧模型,12 个稳定版、6 个 beta,一套 SDK 覆盖 Swift、Kotlin、JavaScript,主打"每个模型毫秒级返回、跑在用户设备上、不按 token 计费",10 万月活设备以内免费,不用登录。公司还在 HN 上拿了 449 分、96 条评论。
数字挑几个关键的:Voz 在 iPhone 上把 10 分钟音频转成文字只要 2 秒,官方称比 Whisper 快 4.7 倍,还带每个词的起止时间;Clear 只有 9MB,做音频增强,官方实测在 iPhone 16 Pro 上是 302 倍实时;Tongue 用 2MB 从三个词里认出 84 种语言,准确率 0.933,对标的是 293MB 的检测器(0.887);Redact 12MB、27 种语言、实时遮蔽姓名地址卡号,抓取率 88.8%,接近 2.3GB 的 GLiNER-PII(91.1%)。这几类都是高频、低难度、又在烧云 API 账单的活。
但评论区把问题问到了点上。有人直接指出 Voz 实际上是英伟达 Parakeet v3 加一层 macOS/iOS 推理壳;创始人回复确认——"是 Parakeet 的 ANE 优化版本,推理是我们自己写的",并说下一代 Voz 会从零训练、至少快一倍。还有评论指出 Clear 对应的是 DeepFilterNet 3。
目前基本是 Apple 平台优先,Android 和 Web 官方只说"几周内";所有基准都跑在新款 iPhone 上,老设备没有数据;没有 Python SDK;超过 10 万月活之后怎么收费是"联系销售",没有公开价目。我的判断是,"端侧小模型替掉高频云端调用"这笔账是真能算的——官方博客引用的英伟达研究估计,40% 到 70% 的大模型调用可以换给小模型;但现在挑模型要分清自研和"开源底子加推理优化"——后者不丢人,只是别按前沿实验室自研质量的预期去评估它。
如果要先搬一个到手机上,你会挑转写、脱敏,还是语言识别?
