Llama 3.2 90B Instruct
Model bahasa multimodal yang besar dari Meta untuk analisis gambar dan pembuatan teks.
Tinjau
Llama 3.2 90B Instruct
Keterangan dari Llama 3.2 90B Instruct Neural Network
Llama 3.2 90B Instruct adalah model bahasa multimodal yang dikembangkan oleh Meta. Ia dapat memproses baik teks maupun gambar secara bersamaan, membuka kesempatan yang luas untuk tugas pengenalan visual, menganalisis konten grafis, dan secara otomatis menghasilkan takarir gambar.
Model mendukung konteks hingga 128.000 token, memungkinkan untuk bekerja dengan jumlah besar data dalam satu permintaan. Hal ini terutama penting bagi tugas-tugas yang memerlukan analisis dokumen panjang atau gambar besar. Llama 3.2 90B Instruct dioptimalkan untuk penyebaran tidak hanya pada infrastruktur server tetapi juga di tepi dan perangkat mobile, sehingga dapat diakses untuk berbagai kasus penggunaan.
Model dirilis pada tanggal 25 September 2024, dan didistribusikan di bawah lisensi llama3 _ 2. Tersedia baik melalui API dan untuk penyebaran lokal, termasuk melalui repositori Wajah Hugging.
Kapabilitas Multimodal
Llama 3.2 90B Instruksikan kombinasi pemrosesan teks dan gambar. Model dapat "lihat" gambar, menganalisis konten mereka, menjawab pertanyaan tentang gambar, dan menghasilkan deskripsi teks. Hal ini menjadikan alat serbaguna untuk AI visual.
Kinerja dan Benchmarks
Dalam tes, model menunjukkan hasil yang kuat: AI2D - 92.3%, DocVQA - 90.1%, VQAv2 - 78.1%. Nilai rata-rata di benchmark suite adalah 71.3%, mengkonfirmasi kompetisinya antara model bahasa besar.
Llama 3.2 90B Instruct Spesifikasi
| Karakter | Nilai |
|---|---|
| Tipe | Model bahasa multimodal |
| Parameter | 90.0 miliar |
| Konteks | 128.000 token |
| Tanggal rilis | 25 September 2024 |
| Nilai rata-rata | 71,3% |
| Lisensi | llamem3 _ 2 |
| Pengembang | Meta |
| Harga per masukan (token 1M) | $1.20 |
| Harga per keluaran (token 1M) | $1.20 |
| Token masukan Max | 128.000 |
| Token keluaran maksimum | 128.000 |
| Kemampuan yang didukung | Panggilan fungsi, Keluaran Terstruktur, Eksekusi Kode, Pencarian Web, Inferensi Batch, Fine- tuning |
Siapa Llama 3.2 90B Instruct jaringan saraf cocok untuk?
Pengembang dan Insinyur Pembelajaran Mesin
Model sesuai dengan spesialis yang membangun aplikasi visi komputer, chatbot, sistem analisis dokumen, atau alat-alat pembuatan konten. Terima kasih atas dukungan untuk Panggilan Fungsi, Keluaran Terstruktur, dan Eksekusi Kode, Llama 3.2 90B Instruct dapat diintegrasikan ke dalam produk perangkat lunak kompleks.
Peneliti dan ML Entreaists
Lisensi dan ketersediaan bobot di Hugging Face membuat model menarik untuk proyek penelitian. Kemampuan untuk menemukan-lagu dan melakukan inferensi batch memungkinkan model untuk beradaptasi dengan tugas tertentu.
Tim yang bekerja dengan Konten Visual
Llama 3.2 90B Instruct akan berguna bagi pemrosesan gambar otomatis: menggambarkan foto, mengekstrak teks dari dokumen, menganalisis grafik dan diagram, dan mengenali objek.
Bagaimana menggunakan Llama 3.2 90B menginstruksikan jaringan saraf?
Via API
Model tersedia melalui API. Halaman model menyediakan link ke dokumentasi API, memungkinkan integrasi cepat. Penggunaan biaya $1,20 per 1 juta token untuk kedua masukan dan keluaran.
Penyebaran Lokal
Bagi mereka yang ingin bekerja dengan model pada server atau perangkat mereka sendiri, repositori Hugging Face tersedia di mana berat model dapat diunduh. Llama 3.2 90B Instruct dioptimalkan untuk dijalankan di tepi dan perangkat mobile, memungkinkan penyebaran bahkan di lingkungan dengan sumber daya komputasi terbatas.
Integrasi ke Aplikasi
Model ini mendukung banyak kemampuan canggih: Panggilan Fungsi, Keluaran Terstruktur, Eksekusi Kode, Pencarian Web, dan Inferensi Batch. Ini membuatnya menjadi alat fleksibel untuk memasukkan ke dalam sistem yang sudah ada.
Fitur Kunci Llama 3.2 90B Instruct
Multimodalitas
Model ini mendukung pengenalan visual, penalaran tentang isi gambar, dan pembuatan judul otomatis. Ini dapat memproses kedua kueri teks dan data grafis dalam satu sesi.
Konteks Panjang
Panjang konteks dari 128.000 token memungkinkan pemrosesan volume besar informasi - dokumen panjang, seluruh buku, PDFs multi- halaman, atau seri gambar - tanpa memecah permintaan menjadi bagian-bagian.
Kemampuan Fungsional
Llama 3.2 90B Instruct mendukung pemanggilan fungsi, memungkinkan model untuk berinteraksi dengan alat eksternal dan APIs. Keluaran Terstruktur memastikan dikembalikan dalam format yang dispesifikasikan. Kemampuan untuk mengeksekusi kode dan pencarian web memperluas kemungkinan penggunaan kasus.
Fine- tuning dan Batch Processing
Model mendukung fine- tuning, memungkinkan untuk beradaptasi dengan tugas-tugas tertentu dan domain. Inferensi Batch memungkinkan memproses banyak permintaan secara bersamaan, mengurangi latensi dan biaya.
Kemajuan Llama 3.2 90B Instruct
Performa Benchmark Tinggi
Model menunjukkan hasil yang kuat dalam gambar dan dokumen pemahaman tugas, seperti AI2D (92.3%), DocVQA (90.1%), dan VQAv2 (78.1%). Hal ini menegaskan kemampuannya untuk menganalisis informasi visual secara akurat.
Operasi Efisien Edge
Tidak seperti banyak model besar, Llama 3.2 90B Instruct dioptimalkan untuk penyebaran di tepi dan perangkat mobile. Ini menurunkan kebutuhan infrastruktur dan memungkinkan model untuk digunakan dalam skenario offline.
Biaya Affordable
Harga sebesar $1,20 per 1 juta token untuk kedua input dan keluaran adalah kompetitif untuk sebuah model dengan 90 miliar parameter. Harga ini memungkinkan penggunaan skala besar.
Penyebaran Fleksibilitas
Model ini dapat digunakan melalui API, ditempatkan secara lokal, atau diakses melalui Hugging Face. Dukungan bagi banyak fitur lanjutan (Panggilan Fungsi, Keluaran Terstruktur, Eksekusi Kode, Pencarian Web, Inferensi Batch, Fine- tuning) memungkinkan untuk beradaptasi dengan berbagai macam tugas.
Kerugian Llama 3.2 90B Instruct
Permintaan Sumber Daya Tinggi untuk Penyebaran Lokal
Meskipun optimasi untuk perangkat tepi, model dengan 90 miliar parameter membutuhkan daya komputasi yang signifikan dan memori untuk operasi lokal penuh. Sumber daya perangkat keras yang serius diperlukan untuk menjalankannya dengan benar perangkat standar.
Informasi Terbatas dalam Ketersediaan Regional
Data sumber tidak menentukan pembatasan regional pada penggunaan model. Hal ini dapat menciptakan kesulitan bagi pengguna di negara-negara tertentu atau daerah di mana akses ke model Meta mungkin terbatas.
Apa tugas melakukan Llama 3.2 90B Instruct memecahkan?
Pengakuan Visual dan Analisis Gambar
Model ini dapat mengenali objek, adegan, teks, dan elemen lain dalam gambar. Hal ini memungkinkan untuk digunakan untuk pemrosesan konten visual otomatis di berbagai bidang.
Membaca Tentang Isi Gambar
Llama 3.2 90B Instruct tidak hanya mengenali objek tetapi juga dapat menarik kesimpulan logis berdasarkan apa yang dilihatnya: menjawab pertanyaan, membandingkan elemen, dan menafsirkan adegan.
Penangkapan Gambar
Salah satu tugas kunci model secara otomatis menghasilkan deskripsi teks untuk gambar. Hal ini dapat diterapkan dalam sistem bantu untuk gangguan penglihatan, manajemen konten, dan katalog.
Tugas Generatif
Model ini juga dapat menangani tugas-tugas berdasarkan teks murni: menulis teks, menjawab pertanyaan, summarisasi, dan pembuatan kode. Ini membuatnya menjadi alat serbaguna yang tidak terbatas pada pemrosesan gambar.
Llama 3.2 90B Instruksi Harga
Biaya penggunaan model adalah $1,20 per 1 juta token untuk kedua masukan (masukan) dan keluaran (teks yang dihasilkan). Dengan demikian, harga adalah simetris - tingkat yang sama berlaku untuk permintaan pengguna dan tanggapan model.
Pendekatan harga ini standar bagi banyak LLM dan membuatnya mudah untuk menghitung biaya tergantung pada volume penggunaan. Untuk proyek besar dengan beban tinggi, model mendukung inferensi batch, yang dapat mengurangi biaya akhir untuk permintaan massa.
Llama 3.2 90B Instruksi Terms dari Penggunaan
Model ini didistribusikan di bawah lisensi lamut _ 2 yang dikembangkan oleh Meta. Lisensi ini memaksakan kondisi tertentu pada penggunaan komersial dan non- komersial, termasuk pembatasan terkait dengan penyebaran skala dan potensi area aplikasi.
Pengembang disarankan untuk hati-hati meninjau teks lisensi sebelum menggunakan model, terutama jika penyebaran komersial atau fine- tuning pada data proprietary direncanakan. Data sumber tidak menentukan pembatasan rinci, jadi istilah saat ini harus diperiksa pada halaman resmi Meta dan Hugging Face.
Llama 3.2 90B Instruksikan Ketersediaan
Model tersedia untuk diunduh dan digunakan melalui platform Hugging Face, di mana bobot diterbitkan. Hal ini juga dapat digunakan di tepi dan perangkat seluler berkat optimisasi yang dilakukan (Dan demi yang turun dari langit dengan cepat) yakni demi malaikat-malaikat yang melayang turun dari langit dengan membawa perintah-Nya.
Halaman model tidak menentukan pembatasan regional. Pengguna di berbagai negara harus secara independen memeriksa ketersediaan layanan Meta di wilayah mereka. Untuk penggunaan API, juga diperlukan untuk meninjau persyaratan layanan penyedia.
Bagaimana Llama 3.2 90B Instruct Differs dari Alternatif
Multimodalitas dengan Konteks Besar
Di antara alternatif seperti Llama 3.2 11B Instruct, Gemma 3 27B, Mistral Kecil 3.1 24B Instruct, atau GPT OSS 20B, Llama 3.2 90B Instruct menonjol dengan ukuran terbesar (90 miliar parameter) dan dukungan untuk konteks 128 juta token. Hal ini memungkinkan model untuk memproses lebih banyak data dalam satu permintaan daripada banyak pesaing.
Biaya Balanced
Pada $1,20 per 1 juta token, model duduk di kisaran pertengahan harga untuk ukurannya. Beberapa alternatif yang lebih kecil mungkin lebih murah tapi kurang performan, sementara lebih besar pesaing model mungkin biaya lebih.
Optimisasi bagi Perangkat Tepi
Tidak semua model multimodal besar dioptimalkan untuk dijalankan di tepi dan perangkat mobile. Llama 3.2 90B Instruct dirancang dengan kebutuhan dalam pikiran, pengaturan terpisah dari banyak alternatif fokus eksklusif pada penyebaran server.
Dukungan bagi Set Broad Fitur
Tidak seperti beberapa alternatif, Llama 3.2 90B Instruct mendukung semua kemampuan kunci modern: Panggilan fungsi, Keluaran Terstruktur, Eksekusi Kode, Pencarian Web, Inferensi Batch, dan Fine- tuning. Ini membuatnya menjadi solusi universal yang tidak memerlukan alat tambahan untuk integrasi.
Kesimpulan
Llama 3.2 90B Instruct adalah model multimodal yang kuat dari Meta dengan konteks 128,000 token, dioptimalkan untuk edge dan perangkat mobile. Ini mencapai hasil yang kuat dalam benchmark seperti AI2D (92.3%), DocVQA (90.1%), dan VQAv2 (78.1%), dan menawarkan berbagai luas kemampuan yang didukung, termasuk fine- tuning dan batch processing. Penggunaan biaya $1,20 per 1 juta token untuk kedua masukan dan keluaran. Model ini tersedia melalui Hugging Face dan API, membuatnya menjadi alat fleksibel untuk pengenalan visual, analisis gambar, dan tugas pembuatan teks.