yanghaha0908

WavCube

yanghaha0908

Official code for "WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling"

AI 简介

WavCube 是一个统一语音表征模型,将语音理解、重建与生成映射到同一连续潜在空间中。其核心是128维、50Hz采样率的紧凑表征,通过语义-声学联合建模融合高层语义结构与底层声学细节,并专为扩散模型等生成任务优化(相比SSL特征压缩率达8倍)。适用于语音合成、语音识别后处理、语音编辑、跨任务表征迁移等需要统一表征的端到端语音处理场景。

Python
MIT License
62
Stars
7
Forks
3
Watchers
3
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分42.71
默认分支master