
VoiceCraft
jasonppy
Zero-Shot Speech Editing and Text-to-Speech in the Wild
AI 简介
VoiceCraft 是一个基于神经编解码器的语音编辑与零样本文本转语音(TTS)模型,支持仅用数秒参考音频即可克隆或编辑任意未见过的说话人声音。其核心技术是 token infilling 架构,在真实场景音频(如播客、有声书、网络视频)上实现高质量语音生成与局部编辑,无需目标说话人训练数据。项目提供 Gradio 交互界面、Colab 快速体验、Docker 部署及命令行脚本,便于集成到语音内容生产、无障碍辅助、音视频后期等实际应用中。
Jupyter Notebook
Other8.5k
Stars
796
Forks
97
Watchers
95
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分64.7
默认分支master