MusicGen Large

免费

元数据 AI最大的开源音乐生成模型,有33亿个参数,从文本描述或基于上传的旋律创建成分.

534视图
访问网站

概览

大型音乐Gen

MusicGen大型神经网络简介

MusicGen Large是Meta AI开发的最大开放音乐生成模式,于2023年6月发行. 神经网络有33亿个参数,可以从文本描述(文本到音乐模式)和安排用户上传的旋律(melody-to-music模式)两种方式创建工具成分.

该模型在20 000小时的许可证清洁数据集上进行了培训。 MusicGen Large的主要特点是其完全开放:源代码在麻省理工学院许可下分发,允许神经网络免费用于任何目的,包括商业目的. 同时,一个产生的碎片的最大长度约为30秒,强烈推荐一个GPU进行舒适操作.

大型音乐Gen 的特性

特征数值
类型音乐生成器
开发者梅塔人工智能
发布日期2023年6月12日 (英语).
参数数33亿
培训数据集规模20 000小时
许可证麻省理工学院(开源)
开源
音频质量32千赫立体声
最大生成长度30 秒钟
API 可用性是(通过复制, 套接字空间)

谁适合MusicGen Large?

音乐家和作曲家

MusicGen Large)对于音乐家来说是有用的,他们希望迅速勾画出未来音轨的器乐基础,找到一个鼓舞人心的安排,或者在出人意料的流派中延续现有的旋律. 续作模式可以让您上传自己的旋律,并获得其发展方式的几种变体.

开发者和内容创建者

对于游戏开发者,视频编辑,以及播客制作者来说,该模型作为背景器乐的免费生成者发挥作用. 开放的麻省理工学院许可证允许生成的音轨用于商业项目而不向版权持有人支付使用费.

研究人员和机器学习爱好者

由于源代码的可用性和在当地运行的能力,MusicGen Large在学术和爱好者实验中被积极使用. 社区发布根据具体流派和任务调整的模型精细版.

如何使用MusicGen大调?

通过 Python 本地发射

要安装和运行MusicGen Large,需要Python环境. 用命令安装音频软件包 pip install audiocraft然后,在代码中,导入 MusicGen,装入 facebook/musicgen-large 模型,指定生成时间(例如30秒),并调用 generate 使用文本提示的方法。 对于GPU操作,建议使用CUDA 11.8或较新的和至少16GB的视频内存.

通过API和演示版本使用

如果局部发射不可能,该模型可通过复制平台API(每运行定价)和HuggingFace Spaces免费演示获得. 这些选项不需要强大的硬件,让你在浏览器中直接评估模型的能力.

MusicGen Large 的关键特性

从文本描述生成音乐

用户输入一个自然语言文本的提示,指定想要的流派,情绪,节奏,和乐器,模型会产生相应的工具片段. 流行流派得到支持:流行,摇滚,爵士乐,电子音乐,管弦乐安排,以及许多其他.

继续模式(金属安排)

音乐Gen 大让您上传已有的旋律并获得其续作或新的安排. 该模型分析了原始音频的结构和风格,并创造了和谐地开发上传材料的成分.

决定输出

当使用相同的文字即时和相同的种子时,神经网络产生相同的结果. 这对于需要可复制性的任务很重要:生产工作,测试,或类似轨迹的系列生成.

大型音乐游戏的优点

完全开源代码

由于麻省理工学院的许可,神经网络可以免费用于任何目的,包括商业目的. 由于没有使用费付款和对云服务的任何依赖,用户可以完全控制该工具。

高音频质量

MusicGen大型输出立体声,采样率32千赫. 开发者认为,该音频没有包含早期基因模型中典型的文物,使得结果适合用于项目而无需额外处理.

积极的社区和微调版本

围绕MusicGen形成了一个开发者社区,为特定流派和任务发布了该模型的微调版本. 这扩大了神经网络的基础能力,使得在狭窄的音乐方向上获得更好的效果成为可能.

大型音乐游戏的缺点

有限生产长度

原生的模型会产生碎片 每个请求30秒长。 创造全长的轨迹可能需要将几个生成的段缝合在一起,这并不总是产生平滑的结果.

没有声音

MusicGen Large专为器乐创作. 如果您的项目需要声波,您必须单独添加声波或使用其他神经网络.

所需硬件

在合理时间内生成需要至少16GB的视频内存(例如RTX 3080或更好)的GPU. 在CPU或更古老的图形卡上,这一过程可能过于缓慢.

与商业服务相比,质量较低

虽然MusicGen Large能提供体面的成果,但Suno和Udio等商业替代品能提供更高的整体生成质量和声乐支持.

MusicGen Large 解决什么任务?

从文本描述创建工具构成

神经网络使得在理想的流派,节奏和情绪中迅速获得工具音轨成为可能,而不需要知道如何演奏乐器.

继续并安排上传的旋律

用户可以上传自己的旋律,并收到其开发或重新解释的不同风格的几种变体.

生产可再生产

得益于定型输出,MusicGen Large适合执行需要稳定和可重复结果的任务,如在相同条件下融入更大的软件产品或连载音乐创作.

MusicGen 大额定价

MusicGen Large完全免费. 该模式在麻省理工学院许可下作为开源发行,该许可对用户没有财务义务. 通过复制平台的API以每台运行成本提供. 此外,HuggingFace Spaces上还有免费的演示,无需安装即可进行评审.

大型MusicGen的使用条件

该型号在麻省理工学院许可证下分发,允许任何用途,包括商业用途,而无需额外支付. 训练数据集由许可的音轨组成,但开发者建议检查输出成分与版权作品的匹配,因为模型可能会不慎复制可识别的音乐碎片.

大型音乐Gen

神经网络通过HuggingFace变形器库和Meta AI官方寄存器AudioCraft提供. 局部发射需要一台带有GPU的计算机;建议使用RTX 3080或更高. 该模型也可以通过HuggingFace Spaces演示空间和复制API在线试用.

MusicGen Large 如何与替代品不同

MusicGen Large是一个开放型号,可以在当地运行而不依赖于云服务. 它只产生器乐. 相比之下,Suno和Udio是封闭的商业服务:它们支持声波并交付质量更高的结果,但其源代码不可用,它们不在当地运行,它们需要付费订阅或个人运行. MusicGen Large的主要优势是完全可以自由使用,并且没有任何付款.

结论

MusicGen Large是一个来自Meta AI的强大的开放神经网络,用于生成器乐. 它提供两种操作模式(从文本描述和基于上传的旋律),产生高质量的立体声音频,并且由于麻省理工学院的许可不需要使用费支付. 主要限制是声波不足,一次最多30秒的生成,以及需要GPU. 对于需要当地免费生成器乐的任务,MusicGen Large仍然是市场上最好的开放解决方案之一.

从文本描述创建工具组件
基于上传旋律的音乐生成
生成轨道的商业使用

定价

计划价格特征限制
免费免费开源 麻省理工学院许可证 从文字描述,续作模式,决定性输出,HuggingFace Spaces上可自由演示的音乐生成最大生成长度 30 秒, 需要使用 16 GB VRAM 的 GPU, 不支持声波
通过复制的 API从每次0.014起API 访问, 使用没有强大硬件的模型每跑一次付费,最大生成长度30秒

常问问题

另见

MusicGen Large——神经网络的描述和能力