
minimind-o
jingyaogong
🎙️ 「大模型」从0训练0.1B能听能说能看的全模态Omni模型!A 0.1B Omni model trained from scratch, capable of listening, speaking, and seeing!
AI 简介
MiniMind-O 是一个从零训练的轻量级全模态大模型,单权重支持文本、语音、图像三模态输入,并可同步输出文本与流式语音。其核心采用 Thinker–Talker 双路径架构,在仅约0.1B参数规模下实现端到端多模态理解与生成;完全基于 PyTorch 原生实现,支持音频投影、视觉投影、Mimi 离散编码、多令牌预测(MTP)及实时语音打断等关键技术。适用于个人开发者在单卡消费级 GPU(如 RTX 3090)上快速复现、调试和定制 Omni 模型,特别适合多模态教学、低资源语音交互原型开发与端侧轻量部署研究。
Python
Apache License 2.02k
Stars
237
Forks
15
Watchers
3
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分59.13
默认分支master