又一个极小的语音合成模型,tts,cpu上就能跑。
项目特色:已知最小的神经TTS家族——参数294k到230万
在3美元微控制器上实时运行——在 ESP32-S3,速度是实时的2.6倍,配备Xtensa LX7 SIMD内核 Arduino 库默认组装(BOARDS.md,2026-09-04)。 同一板上的标量C为1.58,即比实际时间慢
直接在浏览器中运行 — WebAssembly,无需服务器
每声部大小根据精度介于 0.3 到 8.7 MB 之间——337 KB int8(心纳米), ~3 MB fp16,5.5-8.7 MB fp32 — 零依赖关系(含 espeak-ng 音素器)
浏览器演示中包含16种语言的30个声音——英语、德语, 法语、西班牙语、意大利语、葡萄牙语、俄语、捷克语、罗马尼亚语、土耳其语, 阿拉伯语、尼泊尔语(नेपाली)、印地语(हिन्दी)、越南语(Tiếng Việt), 印尼语(Bahasa),中文(中文)。PIP包可以发27件 13种语言;尼泊尔语、印地语和中文目前仅限浏览器
新(2026-09-08):新增十种语言——德语、土耳其语、俄语、法语, 西班牙语、意大利语、葡萄牙语、罗马尼亚语、捷克语和阿拉伯语——各有1~56万 其中八个参数也属于~511k变体。低语词错误率 域外文本的比例为0.038(葡萄牙语)至0.392(罗马尼亚语);即 每语16句话的可理解性,而非自然性,但没有人做到 做个听力测试。实验/证据/ood-tatoeba-20260908.json中的数字与方法
heart,2.27M参数(24 kHz)下最佳音质,以及Heart-nano,294k参数下的同一个声音——完整的文本转语音 栈,int8,337 KB。两者都在浏览器演示中实时合成
项目地址:github.com/Ampixa/sanoTTS