MusicGen Large

Bebas

Meta Model pembuatan musik open-source terbesar Al dengan 3.3 miliar parameter, menciptakan komposisi dari deskripsi teks atau berdasarkan melodi yang diunggah.

Tinjau

Musisi Besar

Deskripsi jaringan saraf besar MusicGen

MusicGen Large adalah model generasi musik terbuka terbesar yang dikembangkan oleh Meta AI dan dirilis pada bulan Juni 2023. Jaringan saraf memiliki 3,3 miliar parameter dan dapat membuat komposisi instrumental baik dari deskripsi teks (teks -to-music mode) dan dengan mengatur melodi diunggah oleh pengguna (melody- to-music mode).

Model ini dilatih pada data lisensi bersih 20.000 jam. Fitur utama MusicGen Large adalah keterbukaan lengkap: kode sumber didistribusikan di bawah lisensi MIT, memungkinkan jaringan saraf digunakan bebas biaya untuk tujuan apapun, termasuk yang komersial. Pada saat yang sama, panjang maksimum dari satu fragmen yang dihasilkan adalah sekitar 30 detik, dan GPU sangat direkomendasikan untuk operasi yang nyaman.

Karakter Musisi Besar

KarakterNilai
TipeGenerator musik
PengembangMeta AI
Tanggal rilis12 Juni 2023
Jumlah parameter3,3 miliar
Ukuran data pelatihan20.000 jam
LisensiMIT (open source)
Sumber terbukaYa
Kualitas audio32 kHz stereo
Panjang pembuatan maksimum30 detik
Ketersediaan APIYa (via Replicate, HuggingFace Spaces)

Siapa musisi Besar cocok untuk?

Musisi dan komposer

MusicGen Large dapat berguna bagi musisi-musisi yang ingin dengan cepat menggambar sebuah yayasan instrumental untuk trek masa depan, menemukan pengaturan inspiratif, atau melanjutkan melodi yang ada dalam genre yang tak terduga. Mode kelanjutan memungkinkan Anda mengunggah melodi Anda sendiri dan mendapatkan beberapa variasi tentang bagaimana hal itu dapat berkembang.

Pengembang dan pencipta isi

Untuk pengembang game, penyunting video, dan pembuat podcast, model bekerja sebagai generator bebas dari latar belakang musik instrumental. Lisensi MIT terbuka memungkinkan trek yang dihasilkan digunakan dalam proyek komersial tanpa pembayaran royalti kepada pemegang hak cipta.

Para peneliti dan penggemar belajar mesin

Berkat ketersediaan Source Code dan kemampuan untuk menjalankannya secara lokal, MusicGen Large aktif digunakan dalam eksperimen akademis dan hobbyist. Masyarakat melepaskan baik-tuned versi model beradaptasi dengan aliran tertentu dan tugas.

Bagaimana menggunakan MusicGen Large?

Peluncuran lokal melalui Python

Untuk memasang dan menjalankan MusicGen Large, Anda akan memerlukan lingkungan Python. Pasang paket audiocraft dengan perintah pip install audiocraftKemudian, dalam kode, impor MusicGen, memuat facebook/musicgen-large model, tentukan durasi generasi (misalnya, 30 detik), dan panggil generate metode dengan pesan teks. Untuk operasi GPU, CUDA 11.8 atau lebih baru dan setidaknya 16 GB memori video direkomendasikan.

Menggunakan melalui versi API dan demo

Jika peluncuran lokal tidak mungkin, model tersedia melalui platform API Replicate (per- run pricing) dan melalui demo bebas pada Spasi HuggingFace. Pilihan-pilihan ini tidak memerlukan perangkat keras yang kuat dan membiarkan Anda mengevaluasi model kemampuan langsung dalam peramban Anda.

Fitur kunci dari Besar MusicGen

Generasi musik dari deskripsi teks

Pengguna memasuki teks bahasa natural- singkat yang menyatakan aliran yang diinginkan, suasana hati, tempo, dan instrumen, dan model menciptakan fragmen instrumental yang sesuai. Genre populer didukung: pop, rock, jazz, musik elektronik, orchestral pengaturan, dan banyak lainnya.

Mode kelanjutan (pengaturan melodi)

MusicGen Besar memungkinkan Anda mengunggah melodi yang ada dan mendapatkan kelanjutan atau pengaturan baru. Model menganalisis struktur dan gaya audio asli dan menciptakan komposisi yang secara harmonis mengembangkan material yang diunggah.

Keluaran deterministik

Ketika teks yang sama cepat dan benih yang sama digunakan, jaringan saraf menghasilkan hasil yang identik. Hal ini penting bagi tugas yang memerlukan reproduksi: pekerjaan produksi, pengujian, atau generasi seri dari trek yang sama.

Kemajuan Musisi Besar

Kode sumber terbuka penuh

Berkat lisensi MIT, jaringan saraf dapat digunakan gratis biaya untuk tujuan apapun, termasuk yang komersial. Ketidakhadiran pembayaran royalti dan setiap ketergantungan pada layanan awan memberikan pengguna kontrol penuh atas alat.

Kualitas audio tinggi

MusicGen Large mengeluarkan suara stereo dengan tingkat sampling 32 kHz. Menurut para pengembang, audio tidak mengandung satu pun artefak dari model awal yang generatif, membuat hasil yang cocok untuk digunakan dalam proyek tanpa pemrosesan tambahan.

Komunitas aktif dan baik-tuned versi

Sebuah komunitas pengembang telah terbentuk di sekitar MusicGen yang merilis versi akhir dari model untuk jenis dan tugas tertentu. Ini memperluas jaringan saraf kemampuan dasar dan memungkinkan untuk mendapatkan hasil yang lebih baik dalam arah musik yang sempit.

Disadvantages dari Musisi Besar

Panjang generasi terbatas

Natif, model menciptakan fragmen up sampai 30 detik panjang per permintaan. Membuat trek full- panjang mungkin memerlukan stitching bersama beberapa segmen yang dihasilkan, yang tidak selalu menghasilkan hasil yang halus.

Tidak ada vokal

MuucGen Besar menghasilkan musik instrumental eksklusif. Jika proyek Anda perlu vokal, Anda harus menambahkan mereka secara terpisah atau menggunakan jaringan saraf lainnya.

Menuntut kebutuhan perangkat keras

Menghasilkan dalam waktu yang masuk akal membutuhkan GPU dengan setidaknya 16 GB memori video (misalnya, RTX 3080 atau lebih baik). Pada kartu grafis CPU atau lebih tua, proses mungkin terlalu lambat.

Kualitas rendah dibandingkan dengan layanan komersial

Meskipun MusicGen Large memberikan hasil yang layak, alternatif komersial seperti Suno dan Udio menawarkan kualitas dan dukungan keseluruhan generasi yang lebih tinggi.

Tugas apa yang menyelesaikan masalah MuucGen Large?

Membuat komposisi instrumental dari deskripsi teks

Jaringan saraf memungkinkan untuk cepat mendapatkan jalur instrumen di aliran yang diinginkan, tempo, dan suasana hati tanpa perlu tahu bagaimana memainkan instrumen musik.

Melanjutkan dan mengatur melodi upload

Pengguna dapat mengunggah melodi mereka sendiri dan menerima beberapa variasi pengembangan atau interpretasi ulang dengan gaya yang berbeda.

Generasi reproduksi untuk produksi

Berkat keluaran deterministik, MusicGen Large cocok untuk tugas yang memerlukan hasil yang stabil dan berulang, seperti integrasi ke dalam produk perangkat lunak yang lebih besar atau pembuatan musik serial di bawah kondisi yang identik.

Harga musisi Besar

Musisi Besar benar-benar bebas. Model ini didistribusikan sebagai sumber terbuka di bawah lisensi MIT, yang menempatkan tidak ada kewajiban keuangan pada pengguna. API melalui platform Replicate tersedia pada biaya per- run. Selain itu, demo gratis tersedia di Ruang Wajah HuggingFace untuk evaluasi tanpa instalasi.

Akhir penggunaan untuk Besar MusicGen

Model ini didistribusikan di bawah lisensi MIT, yang memungkinkan penggunaan apapun, termasuk penggunaan komersial, tanpa pembayaran tambahan. Dataset pelatihan terdiri dari trek berlisensi, tapi pengembang merekomendasikan memeriksa komposisi keluaran untuk mencocokkan dengan karya hak cipta, sebagai model mungkin sengaja mereproduksi fragmen musik dikenali.

Ketersediaan Musik Besar

Jaringan saraf tersedia melalui perpustakaan Transformers HuggingFace dan repositori resmi Meta AI, AudioCraft. Peluncuran lokal memerlukan komputer dengan GPU; RTX 3080 atau lebih tinggi disarankan. Model ini juga dapat dicoba secara online melalui ruang demo Spasi Wajah HuggingFace dan API Replicate.

Bagaimana MusicGen Besar berbeda dari alternatif

MusicGen Large adalah model terbuka yang dapat dijalankan secara lokal tanpa bergantung pada layanan awan. Ini menghasilkan hanya musik instrumental. Sebaliknya, Suno dan Udio adalah layanan komersial tertutup: mereka mendukung vokal dan memberikan hasil berkualitas tinggi, tetapi kode sumber mereka tidak tersedia, mereka tidak menjalankan lokal, dan mereka membutuhkan pembayaran untuk langganan atau berjalan individu. Keuntungan utama dari MuucGen Large adalah kebebasan menggunakan dan tidak adanya pembayaran.

Kesimpulan

MusicGen Large adalah jaringan saraf terbuka yang kuat dari Meta AI untuk menghasilkan musik instrumental. Ini menawarkan dua mode operasi (dari deskripsi teks dan berdasarkan melodi yang diunggah), menghasilkan audio stereo berkualitas tinggi, dan tidak memerlukan pembayaran royalti berkat lisensi MIT. Batas utama adalah kurangnya vokal, maksimal 30 detik dari generasi pada suatu waktu, dan kebutuhan untuk GPU. Untuk tugas yang membutuhkan generasi musik instrumental lokal gratis, MuucGen Large tetap salah satu solusi terbuka terbaik di pasar.

Membuat komposisi instrumental dari deskripsi teks
Generasi musik berdasarkan melodi yang diupload
penggunaan komersial dari trek yang dihasilkan

Harga

RencanaHargaFiturBatas
BebasBebasSumber terbuka, lisensi MIT, generasi musik dari deskripsi teks, mode kelanjutan, keluaran deterministik, demo bebas yang tersedia pada Spasi HuggingFacePanjang maksimum generasi 30 detik, membutuhkan GPU dengan 16 GB VRAM, tidak mendukung vokal
API via Replicatedari 0.014 per runAkses API, gunakan model tanpa perangkat keras yang kuatBayar per run, panjang generasi maksimum 30 detik

Pertanyaan yang sering ditanyakan

Lihat juga

MusicGen Large - deskripsi dan kemampuan jaringan saraf