微信扫码
添加专属顾问
我要投稿
小米开源语音大模型MiMo-Audio,在多项基准测试中超越谷歌和OpenAI的闭源模型,展现强大性能。 核心内容: 1. 模型采用创新预训练架构,基于上亿小时数据训练 2. 首次实现语音领域少样本泛化能力,展现"涌现"行为 3. 在多个基准测试中超越同规模开源模型及闭源商业模型
模型名称
Xiaomi-MiMo-Audio,是小米新开源的第一个原生端到端语音大模型。
训练数据规模与预训练架构
用“上亿小时训练数据”进行预训练。
基于“创新预训练架构”。
少样本泛化 (Few-Shot / ICL) 与“涌现”行为
在语音领域首次实现了基于 ICL(in-context learning)的少样本泛化能力。
在预训练过程中观察到明显的“涌现”(emergent)行为。
后训练阶段还提升了智商、情商、表现力与安全性等跨模态对齐能力,以及语音对话的自然度、情感表达、交互适配性。
性能比较 / 基准测评
在多个标准评测中,MiMo-Audio 的表现如下:
开源情况与构成
MiMo-Audio 是开源模型。
开源内容包括:无损压缩的 Tokenizer,全新模型结构,训练方法和评测体系。
支持混合思考(“Thinking”)方式同时应用于语音理解和语音生成过程。
7B 参数量
在同参数量级(7B)中,MiMo-Audio 是最优表现者。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2026-05-07
本地4B开源模型,把任何App当Skill用!告别token焦虑,私密性强~
2026-05-07
Browser Use 0.12 杀疯了!弃用 Playwright,token 用量减半
2026-05-07
本地部署这件事,终于被国产开源AI做明白了!
2026-05-07
多模型管理太麻烦?手把手教你本地搭建这个开源 AI 网关!
2026-05-06
Ollama 换引擎,苹果 M5 封神了
2026-05-06
DeepSeek V4 Pro桌面应用来了:1.6T参数,MIT协议开源
2026-05-04
开源!OpenClaw 桌面版 v0.4.0,对话、文件、模型与工具配置全面升级
2026-04-29
海外著名投资人的内部 AI 工具,才是真干货
2026-03-30
2026-04-03
2026-03-23
2026-04-09
2026-03-31
2026-02-14
2026-02-18
2026-03-03
2026-02-22
2026-04-01
2026-04-22
2026-04-21
2026-04-15
2026-04-09
2026-04-01
2026-03-17
2026-03-13
2026-03-02