AI音频与音乐生成:小米声音大模型智能创作与技术解析
2026-04-06
小米自研全链路AI音频创作体系,核心包含两大音频生成模型:Xiaomi Any2Speech 剧本式语音生成模型与 Dasheng AudioGen 语音环境音一体化模型,搭配成熟的跨模态AI音乐生成技术,可全方位覆盖语音复刻、多人对话、沉浸式音频制作、原创音乐创作等全场景需求。下文将分别拆解两大核心音频模型的技术能力、应用场景,同时介绍小米AI音乐生成的核心技术范式与优势。
01
Xiaomi Any2Speech:全场景多人指令式语音生成模型
依托小米自研 AI 语音技术,Xiaomi Any2Speech 主打先理解再思考生成:即先理解场景、上下文等信息,然后通过思考的方式,推理出最合适的语音表达。拥有全方位、高灵活度的语音定制与生成能力,覆盖音色设计、长文本语音合成、多人语音生成等核心功能,支持全局 level、句子 level 、token level 三级精细化指令调控,可自由复刻、塑造各类语音形态。同时可以建模声场环境、如室内、剧场等。针对多人对话场景,模型可精准模拟人声打断、声音重叠、精确对话节奏,等真实交互细节,高度还原自然对话逻辑。目前支持纯文本指令生成和文本+参考音频复刻生成两种创作模式,全方位适配各类多元化语音创作需求。
▎适配创作场景
依托灵活的语音生成能力,可落地多种音频创作场景:经典音色复刻、单人/多人播客、脱口秀、相声、电台节目、有声书、广播剧、儿童绘本等。
▎纯文本指令生成
支持多路语音同步生成,流畅实现多人问答、对话交互效果,每一路人声可独立调控情感、音量,角色区分清晰、对话自然逼真,可满足多角色音频剧本、情景模拟、电影片,智能会议录音复刻等创作与使用需求。
02
Dasheng AudioGen:语音环境音一体化模型
作为小米与上海交通大学联合研发的沉浸式音频生成模型,Dasheng AudioGen 实现了人声与环境音效的一体化同步生成,单次请求即可同时输出人物对白、旁白及匹配场景的背景音效,涵盖咖啡厅、雨天、车厢等各类常见场景,打造极具空间感的沉浸式音频体验。核心能力及适用场景如下:该技术涵盖人物对白生成、智能环境音叠加、多说话人对话三大核心能力,全方位支撑沉浸式音频创作,具体能力与适配场景如下:
1. 人物对白生成
支持中、英、日多语种语音合成,可根据文本生成自然流畅的人声,支持自定义说话人音色、情感、语速,适配多样化人声播报需求,广泛应用于客服机器人、智能语音播报、AI虚拟主持人等场景。
2. 环境音叠加
可自动识别文本场景标签,匹配生成咖啡厅、雨天、车内等对应背景音效,自动完成人声与环境音混音,高度还原真实场景氛围,适用于智能车载助手、AR/VR沉浸式交互、沉浸式教学等场景。
03
AI 音乐生成:跨模态原创音乐创作技术
小米自研 AI 音乐生成技术,基于深度学习与跨模态融合算法,让 AI 具备自主创作高品质、多风格原创音乐的艺术能力。该技术已落地应用于智能硬件、内容创作等多个领域,为手机终端、车载场景、视频剪辑、新媒体创作等场景,提供高效、优质的AI创意内容支撑。
我们专注于三大核心范式:
文本驱动音乐 (Text-to-Music):将文字意图转化为具体旋律与节奏。
这首歌以低沉幽邃的钢琴旋律起笔,如同在寂静深海中独自潜行,随之缓缓加入的电子合成器音色宛如透进水面的点点微光,在A小调的忧郁底色中交织出一种克制而深情的现代古典美感,既描绘了低谷中的孤独,也透着一种平静蓄力的生命韧性。
这是一首旋律轻快、节奏感鲜明的歌曲,融合了流行与电子元素,给人以充满活力和愉悦的听觉体验。明亮的合成器音色与富有弹性的鼓点交织,营造出一种轻松自在、适合舞动的氛围。整首作品结构流畅,副歌部分朗朗上口,易于记忆和传唱。
这首曲子以约 128 BPM 的强劲鼓点贯穿始终,融合了 Trance 的空灵空间感与 House 的硬朗律动,在 E 小调冷峻的底色下,明亮的电子合成器音色如同在深夜赛道上疾驰的霓虹光束,爆发出一股极具现代感的科技张力与启动活力。
图像驱动音乐 (Image-to-Music):提炼视觉意境,映射至听觉氛围。
视频驱动音乐 (Video-to-Music):解析视频动态,实现音乐与画面的时序协同
在音乐性方面,我们通过大规模预训练提升作品的艺术水准,掌握乐理并捕捉情感,使生成作品具备专业级的连贯性与真实感。
在指令遵循方面,我们强化模型解析复杂意图的能力,精准响应用户对流派、乐器、情绪等细节指令,实现"所思即所得"。
在长音频时序方面,我们攻克长时结构稳定性难题,确保长篇乐曲在主题一致性下具备合理变化,支持长视频配乐等复杂需求。