StableAudio2.5企业级音频生成AI模型发布，号称“3分钟曲目2秒钟完成”

文章来源：08ai导航网发布时间：2025-10-14 15:28:08

9月14日消息，StabilityAI现已正式发布企业级音频生成模型StableAudio2.5，相对上一代主要围绕音频细节、生成速度方面进行提升，号称“仅需2秒钟即可创建3分钟音频曲目”。

据介绍，StableAudio2.5的核心改进集中在音乐生成能力方面，号称生成结果更加贴合实际编曲逻辑，可呈现前奏、发展与结尾等完整多段式结构。同时新模型对提示词的理解更为准确，尤其在情绪描述和音乐风格词汇的把握上，响应更符合预期。

此外，新版模型还显著改进了音频生成速度，StabilityAI称这主要得益于研发团队提出的后训练方法ARC（注：AdversarialRelativistic-Contrastive），这一技术通过结合相对式对抗训练与对比判别器，加速扩散模型的生成过程，可在保证音轨质量的同时显著降低GPU推理耗时，从而实现2秒钟生成长达3分钟的音频内容。

除此之外，StableAudio2.5还新增了音频修补能力，用户可以导入自己的音频文件，并指定“延展位置”，模型即可根据音频前后内容及整体曲风，将音频一键“延长”，特别适合剪辑等场景。

目前，StableAudio2.5已可通过StableAudio官网直接试用，同时支持本地化部署。不过官方规定，用户上传的音频文件不得包含受版权保护的内容，StableAudio网站将利用自带的内容识别系统进行检测，以确保不侵犯他人版权。