返回 Demo 列表
AI 语音合成技术演示

MOSS-TTS-Nano

开源多语言微型文本转语音系统,基于 Python 与深度学习技术,
实现超低资源占用的高保真语音合成

Python Deep Learning Multilingual Ultra-Lightweight

实时语音合成

音频可视化

等待生成音频...
未生成
00:00 / 00:00
5M
参数量
50ms
首包延迟
0.1x
实时率(RTF)

模型架构

📝
文本输入
Phoneme
Transformer
Encoder
声学模型
Prosody
韵律预测
Vocos
Decoder
声码器
🔊
音频输出
24kHz

模型大小对比 (MB)

语音质量评分 (MOS)

多语言支持

🇨🇳
中文
普通话
🇺🇸
英文
US/UK
🇯🇵
日文
日本語
🇫🇷
法文
Français
🇩🇪
德文
Deutsch

技术优势

极速推理

采用轻量化架构设计,在 CPU 上即可实现实时语音合成,RTF < 0.1,适用于边缘设备部署。

跨语言支持

支持中英日法德等 10+ 种语言,采用统一音素体系,实现跨语言语音克隆与代码切换。

开源生态

基于 MIT 协议开源,提供完整的 Python 推理接口与训练代码,支持 ONNX 导出与量化压缩。

快速开始

# 安装依赖
pip install moss-tts-nano
# Python 推理示例
from moss_tts import TTSNano

# 初始化模型
tts = TTSNano(model_path="nano_v1.pt")

# 合成语音
wav = tts.synthesize(
    text="你好,世界!",
    lang="zh",
    speaker_id=0
)

# 保存音频
tts.save_wav(wav, "output.wav")