Gemma 3 4B

Bebas

Model bahasa multimodal dari Google dengan 4 miliar parameter dan 128K token jendela konteks.

Tinjau

Gemma 3 4B

Deskripsi jaringan saraf Gemma 3 4B

Gemma 3 4B adalah model bahasa multimodal open source yang dikembangkan oleh Google. Model ini dilengkapi dengan 4 miliar parameter dan dapat bekerja dengan baik tekstual dan informasi visual secara bersamaan, membuatnya alat serbaguna untuk berbagai macam tugas kecerdasan buatan.

Fitur kunci - bobot terbuka

Tidak seperti banyak model komersial, Gemma 3 4B didistribusikan dengan bobot terbuka. Ini berarti pengembang tidak hanya dapat menggunakan model sebagai - adalah, tetapi juga fine- tune untuk skenario mereka sendiri, beradaptasi perilaku jaringan saraf ke spesifik proyek mereka.

Dukungan multimodalitas dan bahasa

Proses model baik kueri teks dan gambar, menghasilkan tanggapan teks. Hal ini memungkinkan hal ini digunakan dalam skenario yang memerlukan analisa konten visual: menggambarkan gambar, mengekstrak informasi dari grafik dan diagram, dan bekerja dengan dokumen yang dipindai. Selain itu, model ini mendukung beberapa bahasa, memperluas jangkauan geografis dari aplikasinya.

Lepaskan tanggal dan pengetahuan cutoff

Gemma 3 4B dibebaskan tanggal 12 Maret 2025. Model apos; s pengetahuan cutoff adalah 1 Agustus 2024, berarti jaringan saraf dilatih pada data saat ini sampai tanggal itu.

Spesifikasi Gemma 3 4B

KarakterNilai
TipeModel bahasa multimodal
PengembangGoogle
Jumlah parameter4.0B
Jendela konteks128K token (131.1K di halaman)
Tanggal rilis12 Maret 2025
Token pelatihan4.0T token
Pemotongan Pengetahuan1 Agustus 2024
Nilai rata-rata (ZeroEval)53.0%
Token masukan maksimum131.1K
Token keluaran maksimum131.1K
LisensiGemma
Harga token masukan (per 1M)$0.02
Harga token keluaran (per 1M)$0.04
Kemampuan yang didukungPanggilan fungsi, Keluaran Terstruktur, Eksekusi Kode, Pencarian Web, Inferensi Batch, Fine- tuning

Siapa Gemma 3 4B jaringan saraf yang cocok?

Pengembang perangkat lunak dan insinyur pembelajaran mesin

Gemma 3 4B terutama ditujukan untuk profesional yang membangun dan menyebarkan solusi AI. Beban terbuka memungkinkan fine- tuning model untuk tugas bisnis tertentu - dari chatbot untuk sistem analisis dokumen. Dukungan untuk Panggilan Fungsi dan Eksekusi Kode membuat model yang cocok untuk integrasi ke dalam produk perangkat lunak yang memerlukan eksekusi kode atau interaksi dengan fungsi eksternal.

Peneliti dan peminat AI

Untuk tugas penelitian, model ini menarik karena ukuran kompak (4B parameter) dan multimodalitas. Hal ini memungkinkan untuk mempelajari perilaku model-model kecil pada tugas-tugas yang mengerti gambar dan teks tanpa memerlukan sumber daya komputasi yang signifikan. Biaya inferensi rendah juga membuatnya dapat diakses untuk percobaan.

Tim bekerja dengan konten visual

Spesialis yang perlu menganalisis gambar - dari pasar ke ahli teknis - dapat menggunakan model untuk deskripsi otomatis, kategorikan, dan ekstraksi data dari foto, cuplikan layar, diagram, dan grafik.

Bagaimana cara menggunakan jaringan saraf Gemma 3 4B?

Layanan API dan awan Via

Model tersedia untuk panggilan melalui API dengan gaji -as -you-go harga - $0.02 per 1 juta token masukan dan $0.04 per 1 juta token keluaran. Hal ini memungkinkan Anda untuk cepat menguji fungsionalitas tanpa harus menyebarkan model pada infrastruktur Anda sendiri.

Penempatan lokal dan fine- tuning

Berkat beban terbuka, model dapat diunduh dan dijalankan secara lokal. Ini memerlukan sebuah GPU dengan memori video yang cukup. Batch Inference - batch pengolahan permintaan - didukung, yang mempercepat bekerja dalam skenario produksi. Mekanisme Fine- tuning memungkinkan model untuk diadaptasi ke daerah subjek yang sempit.

Melalui antarmuka dengan Pencarian Web

Model ini mendukung Pencarian Web, memungkinkan untuk mengambil informasi up- to-date dari internet ketika menjawab permintaan. Hal ini terutama berguna untuk tugas-tugas yang membutuhkan data segar di luar model pengetahuan cutoff.

Fitur utama Gemma 3 4B

Teks dan pemrosesan gambar

Gemma 3 4B menerima baik teks dan gambar sebagai masukan dan kembali menanggapi teks. Ini adalah fungsi multimodal inti yang mendasari semua kemampuan lainnya.

Fungsi Memanggil dan Keluaran Terstruktur

Model dapat menyebut fungsi eksternal, memungkinkan integrasi dengan layanan dan basis data lain. Dukungan Keluaran Terstruktur memastikan bahwa model menanggapi dikembalikan dalam format yang dispesifikasikan (misalnya, JSON), menyederhanakan pemrosesan hasil pemrograman.

Eksekusi Kode dan Inferensi Batch

Pembangunan dalam kemampuan eksekusi kode memungkinkan model untuk memecahkan tugas komputasi dan memproses algoritma. Inferensi Batch memungkinkan pengiriman permintaan ke model dalam batch, menghemat waktu selama pemrosesan data massal.

Kemajuan Gemma 3 4B

Besar jendela konteks

Jendela konteks 128 ribu token adalah salah satu yang terbesar di antara model kompak. Hal ini memungkinkan pemrosesan dokumen panjang, log percakapan, source code dari proyek besar, dan volume besar lainnya informasi tanpa kehilangan konteks.

Biaya sangat rendah

Harga dari $0.02 per 1 juta token masukan dan $0.04 per 1 juta token keluaran membuat model salah satu yang paling biaya-efektif di pasar. Pada volume pemrosesan besar, ini menyediakan tabungan signifikan dibandingkan dengan alternatif yang lebih mahal.

Buka bobot dan multimodalitas

Kemampuan untuk menemukan-tune model dan menggunakannya dengan gambar sementara memiliki bobot terbuka adalah kombinasi langka. Kebanyakan model multimodal compact baik tidak memiliki kode terbuka atau biaya lebih.

Kerugian Gemma 3 4B

Jumlah parameter terbatas

4 miliar parameter adalah ukuran compact yang mungkin tidak memberikan kualitas yang sama tanggapan pada tugas logis kompleks dan penalaran dalam sebagai model yang lebih besar (misalnya, 70B atau 100B +). Skenario yang sangat khusus atau kompleks mungkin memerlukan fine- tuning.

Nilai rata-rata benchmark

Nilai rata-rata ZeroEval adalah 53.0%, menunjukkan hasil biasa-biasa saja pada tugas-tugas tes biasa tanpa tambahan tuning. Dalam beberapa skenario, model mungkin jatuh pendek dari mitra yang lebih besar atau lebih khusus tanpa fine- tuning.

Tugas apa yang dilakukan Gemma 3 4B?

Pertanyaan menjawab dan meringkas

Model ini dapat memberikan jawaban rinci pada konten tekstual dan visual, serta menghasilkan rangkuman singkat (abstrak) teks panjang. Jendela konteks besar memungkinkan seluruh artikel atau bab buku untuk dimasukan sebagai masukan.

Penalaran logis dan analisis

Gemma 3 4B cocok untuk tugas-tugas yang membutuhkan pembangunan sebab-dan-efek hubungan, membandingkan data, dan menarik kesimpulan dari informasi yang diberikan. Ini termasuk rantai logis murni tekstual dan analisis numerik data dari tabel atau grafik.

Pemahaman gambar

Jaringan saraf dapat menganalisa informasi visual: mengenali objek dalam gambar, menggambarkan adegan, dan menafsirkan diagram dan grafik. Ini adalah permintaan dalam tugas yang berhubungan dengan dokumen aliran otomatisasi, arsip, dan bekerja dengan konten media.

Gemma 3 4B harga

Model menggunakan model pembayaran berbasis token. Token masukan (teks dan gambar dilewatkan sebagai masukan) biayanya $0.02 per 1 juta token. Token keluaran (menghasilkan respon) biaya $0.04 per 1 juta token. Ini membuat model salah satu yang termurah di kelasnya. Harga yang tepat untuk gambar (dalam token ekuivalen) bergantung pada resolusi dan detail gambar.

Akhir penggunaan untuk Gemma 3 4B

Model ini didistribusikan di bawah lisensi Gemma. Tersedia untuk diunduh dan digunakan secara gratis. Bobot terbuka memungkinkan model tersebut baik-baik saja dan digunakan dalam proyek komersial subjek lisensi. Pengembang disarankan untuk meninjau teks lisensi penuh sebelum memulai penggunaan komersial.

Kemampuan Gemma 3 4B

Gemma 3 4B tersedia melalui API dari Google dan ketiga penyedia partai yang mendukung model. Model juga dapat diunduh langsung dari repositori resmi untuk penyebaran lokal. Berbagai frameworks untuk inferensi dan fine- tuning didukung. Ketersediaan dari Pencarian Web, Inferensi Batch, dan kemampuan lainnya tergantung pada metode penyebaran tertentu.

Bagaimana Gemma 3 4B berbeda dari rekan-rekan

Perbandingan dengan model Gemma 3n

Dalam keluarga Gemma 3, ada konfigurasi yang berbeda: Gemma 3n E2B, Gemma 3n E4B, seperti yang diinstruksikan dan versi ringan (Instructed LiteRT Preview). Gemma 3 4B adalah versi dasar dengan 4 miliar parameter. Versions dengan akhiran "n" mungkin berbeda dalam arsitektur dan kinerja. Versi LiteRT dioptimalkan untuk operasi pada perangkat dengan sumber daya terbatas.

Perbandingan dengan MedGemma 4B IT

MedGemma 4B IT adalah versi khusus baik-disetel pada data medis. Sebaliknya, Gemma 3 4B adalah model general- tujuan tidak disesuaikan ke daerah subjek tertentu, tetapi memungkinkan independen finetuning untuk domain apapun.

Perbandingan dengan Gemini 1.5 Flash 8B

Gemini 1.5 Flash 8B adalah model yang lebih besar dari Google (parameter 8B) berfokus pada kecepatan dan latensi rendah. Gemma 3 4B kalah dalam jumlah parameter tapi menang berkat bobot terbuka dan kemampuan penyesuaian penuh. Kedua model mendukung multimodalitas dan jendela konteks yang besar.

Kesimpulan

Gemma 3 4B adalah model multimodal kompak dengan bobot terbuka dari Google, menampilkan jendela konteks besar 128 ribu token dan biaya penggunaan rendah. Hal ini cocok untuk menjawab pertanyaan, rangkuman, penalaran logis, dan analisis informasi visual. Terima kasih atas kode open-source, dukungan untuk Fungsi Memanggil, Kode Eksekusi, dan fine- tuning kemampuan, model adalah bunga untuk pengembang, peneliti, dan tim otomatis bekerja dengan tekstual dan konten visual. Harga rendah ($0.02 per 1 juta token masukan) membuatnya menjadi sebuah pilihan berharga untuk penggunaan largescale.

Menghasilkan jawaban untuk pertanyaan
summarisasi teks
Analisis gambar
alasan logis

Pertanyaan yang sering ditanyakan

Lihat juga

Gemma 3 4B - tinjauan jaringan saraf multimodal Google