其声音理解性能在22个公开评测集上刷新多模态大模型最好成绩(SOTA),单样本推理的首Token延迟(TTFT)为业界先进模型的1/4,同等显存下的数据吞吐效率是业界先进模型的20倍以上。
具体来看,MiDashengLM-7B基于Xiaomi Dasheng作为音频编码器和Qwen2.5-Omni-7B Thinker作为自回归解码器,通过通用音频描述训练策略,实现了对语音、环境声音和音乐的统一理解。
此前小米于2024年首次发布Xiaomi Dasheng声音基座模型,此次开源的7B模型是该模型的扩展。目前该系列模型在小米智能家居、汽车座舱等领域有30多个落地应用。小米称,音频理解是构建全场景智能生态的关键领域。
MiDashengLM通过统一理解语音、环境声与音乐的跨领域能力,不仅能听懂用户周围发生了什么事情,还能分析发现这些事情的隐藏含义,提高用户场景理解的泛化性。MiDashengLM的训练数据由100%公开数据构成。
亮点:
1、支持跨场景音频理解能力音频编码器多项测试超Whisper
2、推理效率提升单样本4倍加速与百倍并发支持
3、训练范式改变:从碎片化转录到全局语义刻画
4、全栈开源,透明可复现
小米AI 小米 雷军 多模态 AI 人工智能 MiDashengLM XiaomDasheng 声音理解大模型多模态大模型












