MOSS-TTS-Nano –由 OpenMOSS 团队与 MOSI.AI 开源的超轻量、低延迟、可运行于 CPU 的多语言语音合成(TTS)模型

MOSS-TTS-Nano 是由 OpenMOSS 团队与 MOSI.AI 开源的超轻量、低延迟、可运行于 CPU 的多语言语音合成(TTS)模型

它的核心定位是“极低门槛的本地流式语音生成与声音克隆”,旨在让普通的个人电脑甚至端侧设备(如浏览器、移动端)也能离线流畅运行高质量的语音合成。

核心功能

  1. 零样本声音克隆(Zero-shot Voice Cloning)

    • 仅需提供一段几秒钟的参考音频(Prompt Speech),无需针对特定人声进行微调训练,就能直接用该音色朗读目标文本。

  2. 超低延迟流式生成(Real-time Streaming TTS)

    • 支持边生成边播放(Streaming Inference),首包响应极快。在普通的 4 核 CPU 上即可做到“实时率”(生成速度大于播放速度)。

  3. 高品质 48 kHz 双声道/立体声输出

    • 搭载自研的 MOSS-Audio-Tokenizer-Nano 音频编解码器,虽然模型本体只有 0.1B(100M)参数,但能直接输出 48 kHz 双声道(Stereo)的高保真音频。

  4. 多语言与长文本合成

    • 原生支持中文、英文、日语、韩语、西班牙语等多语言文本合成;

    • 内置长文本自动分句分块逻辑,支持对长文章/图书进行稳定连续的朗读。

  5. 纯 CPU/ONNX 极速推理与端侧应用

    • 提供独立导出的 ONNX 模型格式,脱离 PyTorch 重度依赖,运行效率翻倍;

    • 衍生开发了浏览器扩展组件(如 MOSS-TTS-Nano-Reader),可以直接在浏览器网页内调用本地模型朗读网页文本。

图片[1]-MOSS-TTS-Nano –由 OpenMOSS 团队与 MOSI.AI 开源的超轻量、低延迟、可运行于 CPU 的多语言语音合成(TTS)模型-共赢源码

应用场景

  • 本地网页/小说朗读助手: 作为浏览器插件或离线软件,直接对长文本进行朗读。

  • 低算力设备/端侧语音交互: 嵌入树莓派、智能家居设备或 Android/iOS 移动端应用中。

  • 实时 AI 语音助手/NPC 语音: 结合轻量级 LLM,搭建低延迟、成本极低的实时对话机器人或游戏语音交互系统。

 

根据官方仓库及部署说明,本地运行该项目的硬件配置要求如下:

 硬件最低配置与推荐配置

硬件维度 最低要求(CPU 纯软解/基础运行) 推荐配置(更流畅 / GPU 加速)
处理器 (CPU) 4 核主流 CPU(如 Intel i5/i7 8代以上,AMD Ryzen 3000 系列及以上) 8 核 CPUApple Silicon (M1/M2/M3/M4 系列)
内存 (RAM) 8 GB RAM 16 GB RAM 或更高
显卡 (GPU) 非必需(可以完全无需 GPU) Nvidia 独显(显存 ≥ 4GB,如 RTX 2060 / 3060 或更高)
存储空间 (Disk) 至少 10 GB 剩余空间(用于放置 Python 环境、模型权重文件及生成音频) 固态硬盘 (SSD) 空间 20 GB 以上

 硬件与性能特点解析

  1. CPU 性能极佳:

    • 由于只有约 100M 参数,官方支持 ONNX CPU 推理

    • 即使在单核或 4 核 CPU(如 MacBook Air 或普通 PC)上,也能顺畅做到流式生成,甚至能作为浏览器插件(如 MOSS-TTS-Nano-Reader)在本地直接进行文本朗读。

  2. 显存/内存占用极低:

    • 运行时模型加载后的内存/显存占用通常只有 2 GB – 4 GB 左右,不会对系统造成很大负担。

  3. GPU 加速(可选):

    • 如果拥有英伟达显卡,只需安装支持 CUDA 的 onnxruntime-gpu 或 PyTorch CUDA 版本,就可以进一步降低首包延迟(First Audio Latency),获得极高倍速的推理体验。

 

代码下载地址

Github仓库:https://github.com/OpenMOSS/MOSS-TTS-Nano

© 版权声明
THE END
喜欢就支持一下吧
点赞5 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容