幕后花絮:我们的人工智能如何生成音乐
有没有想过在点击“生成”和听到完成的曲目之间的 45 秒内发生了什么?让我们揭开为 musvideo 提供动力的技术的帷幕。
基础:神经网络
musvideo 的核心是使用经过数百万小时音乐训练的深度神经网络。但不仅仅是任何神经网络——我们开发了一种专门为音乐理解而设计的定制架构。
三个核心组件
1.作曲家网络 了解音乐理论、和声和结构。该网络知道某些和弦进行可以很好地协同工作,并且可以创造出既新颖又具有音乐连贯性的旋律。
2.编曲网络 决定何时演奏哪些乐器、它们如何相互作用并创建整体安排。这就是使简单的旋律成为完整作品的原因。
3.生产网络 处理最终的声音打磨——均衡器、压缩、混响以及制作专业音乐的所有微妙细节。
生成过程
第 1 步:理解提示(0-5 秒)
当您提交提示时,我们的自然语言处理系统会将其分解为结构化的音乐参数:
- 类型分类
- 情绪载体
- 节奏和节奏模式
- 仪器仪表要求
- 制作风格偏好
第 2 步:构图规划(5-15 秒)
作曲家网络创建了一个音乐“蓝图”:
- 和弦进行
- 旋律主题
- 歌曲结构
- 谐波运动
- 节奏模式
这发生在“潜在空间”——音乐的数学表示,我们的人工智能可以在音乐创意变成音频之前对其进行操纵。
第三步:安排(15-30秒)
编曲网络使乐曲变得栩栩如生:
- 将乐器分配给零件
- 创建变化和填充
- 增加动态和表达
- 构建能量弧
步骤 4:音频合成(30-45 秒)
最后,制作网络将所有内容渲染为实际音频:
- 生成真实的乐器声音
- 应用生产技术
- 平衡和混合所有元素
- 添加最终润色和母带处理
为什么我们的方法与众不同
培训注重质量,而非数量
许多人工智能音乐系统都接受过一切可用的训练。我们精心策划了训练数据集,仅包含专业制作的音乐,以确保高质量的输出。
音乐智能
我们的网络不仅仅预测下一个音符,它们还理解:
- 为什么某些进程会产生紧张和释放
- 乐器如何在合奏中协同工作
- 是什么让旋律令人难忘
- 如何构建一首完整的歌曲
可控性
我们构建的系统是为了给您控制权。提示中的每个参数都会直接影响生成过程的特定方面。
技术堆栈
对于技术好奇的人:
架构:具有分层注意力的基于自定义变压器的模型 参数:32亿个可训练参数 训练数据:400 万首歌曲,800,000 小时的音频 计算:512 个 A100 GPU 用于训练,16 个用于推理 延迟:平均生成时间为 45 秒
处理不同类型
不同的音乐风格需要不同的方法:
古典音乐
- 长远架构规划
- 复杂的和声进行
- 逼真的管弦乐器建模
电子音乐
- 精确的节奏生成
- 合成器参数控制
- 现代生产技术
流行/摇滚
- 朗朗上口的旋律
- 标准歌曲结构
- 无线电混音
持续改进
我们的人工智能不会停止学习。每一代人都有助于改善未来的结果:
- 用户反馈训练奖励模型
- A/B 测试确定更好的方法 3.定期模型更新融入新技术
- 社区数据有助于识别边缘情况
限制和挑战
我们对人工智能能做什么、不能做什么保持透明:
目前的优势
✅ 旋律创作 ✅ 谐波级数 ✅ 排列多样 ✅ 生产品质 ✅ 风格一致性
需要改进的地方
⚠️长篇作文(>5分钟) ⚠️极其复杂的多节奏 ⚠️非常具体的抒情内容 ⚠️ 复制精确的参考曲目
未来
我们正在积极研究:
- 互动生成:创作过程中实时控制
- 多轨输出:自动分离主干
- 较长的作品:完整专辑、电影配乐
- 情商:更好地理解情绪和感觉
自己尝试一下
既然您了解了这项技术,为什么不尝试一下呢? 创建您自己的人工智能生成音乐 →
欣赏人工智能能力的最好方法就是使用它。
了解更多
想深入了解吗?查看:
对我们的技术有疑问吗?给我们的研究团队发送电子邮件:[email protected]