NVIDIA-NeMo

Speech

NVIDIA-NeMo

A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)

AI 简介

NVIDIA NeMo Speech 是一个面向语音AI研究与开发的可扩展生成式AI框架,专注于自动语音识别(ASR)和文本到语音(TTS)任务。它提供预训练模型、模块化组件、端到端流水线及对流式低延迟推理的支持,基于FastConformer等先进架构,支持多语言、标点恢复、说话人分离与语音翻译等功能。项目深度集成NVIDIA GPU加速与混合精度训练,适用于语音助手、实时字幕、会议转录、无障碍交互等需要高精度与低延迟语音处理的工业级场景。

Python
17.8k
Stars
3.5k
Forks
231
Watchers
91
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分67
默认分支main