MOSS-TTS-Nano 是由 OpenMOSS 团队与 MOSI.AI 开源的超轻量、低延迟、可运行于 CPU 的多语言语音合成(TTS)模型。
它的核心定位是“极低门槛的本地流式语音生成与声音克隆”,旨在让普通的个人电脑甚至端侧设备(如浏览器、移动端)也能离线流畅运行高质量的语音合成。
核心功能
-
零样本声音克隆(Zero-shot Voice Cloning)
-
仅需提供一段几秒钟的参考音频(Prompt Speech),无需针对特定人声进行微调训练,就能直接用该音色朗读目标文本。
-
-
超低延迟流式生成(Real-time Streaming TTS)
-
支持边生成边播放(Streaming Inference),首包响应极快。在普通的 4 核 CPU 上即可做到“实时率”(生成速度大于播放速度)。
-
-
高品质 48 kHz 双声道/立体声输出
-
搭载自研的
MOSS-Audio-Tokenizer-Nano音频编解码器,虽然模型本体只有 0.1B(100M)参数,但能直接输出 48 kHz 双声道(Stereo)的高保真音频。
-
-
多语言与长文本合成
-
原生支持中文、英文、日语、韩语、西班牙语等多语言文本合成;
-
内置长文本自动分句分块逻辑,支持对长文章/图书进行稳定连续的朗读。
-
-
纯 CPU/ONNX 极速推理与端侧应用
-
提供独立导出的 ONNX 模型格式,脱离 PyTorch 重度依赖,运行效率翻倍;
-
衍生开发了浏览器扩展组件(如
MOSS-TTS-Nano-Reader),可以直接在浏览器网页内调用本地模型朗读网页文本。
-
![图片[1]-MOSS-TTS-Nano –由 OpenMOSS 团队与 MOSI.AI 开源的超轻量、低延迟、可运行于 CPU 的多语言语音合成(TTS)模型-共赢源码](https://gongyingchuanbo.oss-cn-shenzhen.aliyuncs.com/wp-content/uploads/2026/09/arch_moss_audio_tokenizer_nano-scaled.jpg)
应用场景
-
本地网页/小说朗读助手: 作为浏览器插件或离线软件,直接对长文本进行朗读。
-
低算力设备/端侧语音交互: 嵌入树莓派、智能家居设备或 Android/iOS 移动端应用中。
-
实时 AI 语音助手/NPC 语音: 结合轻量级 LLM,搭建低延迟、成本极低的实时对话机器人或游戏语音交互系统。
根据官方仓库及部署说明,本地运行该项目的硬件配置要求如下:
硬件最低配置与推荐配置
| 硬件维度 | 最低要求(CPU 纯软解/基础运行) | 推荐配置(更流畅 / GPU 加速) |
| 处理器 (CPU) | 4 核主流 CPU(如 Intel i5/i7 8代以上,AMD Ryzen 3000 系列及以上) | 8 核 CPU 或 Apple Silicon (M1/M2/M3/M4 系列) |
| 内存 (RAM) | 8 GB RAM | 16 GB RAM 或更高 |
| 显卡 (GPU) | 非必需(可以完全无需 GPU) | Nvidia 独显(显存 ≥ 4GB,如 RTX 2060 / 3060 或更高) |
| 存储空间 (Disk) | 至少 10 GB 剩余空间(用于放置 Python 环境、模型权重文件及生成音频) | 固态硬盘 (SSD) 空间 20 GB 以上 |
硬件与性能特点解析
-
CPU 性能极佳:
-
由于只有约 100M 参数,官方支持 ONNX CPU 推理。
-
即使在单核或 4 核 CPU(如 MacBook Air 或普通 PC)上,也能顺畅做到流式生成,甚至能作为浏览器插件(如 MOSS-TTS-Nano-Reader)在本地直接进行文本朗读。
-
-
显存/内存占用极低:
-
运行时模型加载后的内存/显存占用通常只有 2 GB – 4 GB 左右,不会对系统造成很大负担。
-
-
GPU 加速(可选):
-
如果拥有英伟达显卡,只需安装支持 CUDA 的
onnxruntime-gpu或 PyTorch CUDA 版本,就可以进一步降低首包延迟(First Audio Latency),获得极高倍速的推理体验。
-









暂无评论内容