Gemma 3 4B
Model bahasa multimodal dari Google dengan 4 miliar parameter dan 128K token jendela konteks.
Tinjau
Gemma 3 4B
Deskripsi jaringan saraf Gemma 3 4B
Gemma 3 4B adalah model bahasa multimodal open source yang dikembangkan oleh Google. Model ini dilengkapi dengan 4 miliar parameter dan dapat bekerja dengan baik tekstual dan informasi visual secara bersamaan, membuatnya alat serbaguna untuk berbagai macam tugas kecerdasan buatan.
Fitur kunci - bobot terbuka
Tidak seperti banyak model komersial, Gemma 3 4B didistribusikan dengan bobot terbuka. Ini berarti pengembang tidak hanya dapat menggunakan model sebagai - adalah, tetapi juga fine- tune untuk skenario mereka sendiri, beradaptasi perilaku jaringan saraf ke spesifik proyek mereka.
Dukungan multimodalitas dan bahasa
Proses model baik kueri teks dan gambar, menghasilkan tanggapan teks. Hal ini memungkinkan hal ini digunakan dalam skenario yang memerlukan analisa konten visual: menggambarkan gambar, mengekstrak informasi dari grafik dan diagram, dan bekerja dengan dokumen yang dipindai. Selain itu, model ini mendukung beberapa bahasa, memperluas jangkauan geografis dari aplikasinya.
Lepaskan tanggal dan pengetahuan cutoff
Gemma 3 4B dibebaskan tanggal 12 Maret 2025. Model apos; s pengetahuan cutoff adalah 1 Agustus 2024, berarti jaringan saraf dilatih pada data saat ini sampai tanggal itu.
Spesifikasi Gemma 3 4B
| Karakter | Nilai |
|---|---|
| Tipe | Model bahasa multimodal |
| Pengembang | |
| Jumlah parameter | 4.0B |
| Jendela konteks | 128K token (131.1K di halaman) |
| Tanggal rilis | 12 Maret 2025 |
| Token pelatihan | 4.0T token |
| Pemotongan Pengetahuan | 1 Agustus 2024 |
| Nilai rata-rata (ZeroEval) | 53.0% |
| Token masukan maksimum | 131.1K |
| Token keluaran maksimum | 131.1K |
| Lisensi | Gemma |
| Harga token masukan (per 1M) | $0.02 |
| Harga token keluaran (per 1M) | $0.04 |
| Kemampuan yang didukung | Panggilan fungsi, Keluaran Terstruktur, Eksekusi Kode, Pencarian Web, Inferensi Batch, Fine- tuning |
Siapa Gemma 3 4B jaringan saraf yang cocok?
Pengembang perangkat lunak dan insinyur pembelajaran mesin
Gemma 3 4B terutama ditujukan untuk profesional yang membangun dan menyebarkan solusi AI. Beban terbuka memungkinkan fine- tuning model untuk tugas bisnis tertentu - dari chatbot untuk sistem analisis dokumen. Dukungan untuk Panggilan Fungsi dan Eksekusi Kode membuat model yang cocok untuk integrasi ke dalam produk perangkat lunak yang memerlukan eksekusi kode atau interaksi dengan fungsi eksternal.
Peneliti dan peminat AI
Untuk tugas penelitian, model ini menarik karena ukuran kompak (4B parameter) dan multimodalitas. Hal ini memungkinkan untuk mempelajari perilaku model-model kecil pada tugas-tugas yang mengerti gambar dan teks tanpa memerlukan sumber daya komputasi yang signifikan. Biaya inferensi rendah juga membuatnya dapat diakses untuk percobaan.
Tim bekerja dengan konten visual
Spesialis yang perlu menganalisis gambar - dari pasar ke ahli teknis - dapat menggunakan model untuk deskripsi otomatis, kategorikan, dan ekstraksi data dari foto, cuplikan layar, diagram, dan grafik.
Bagaimana cara menggunakan jaringan saraf Gemma 3 4B?
Layanan API dan awan Via
Model tersedia untuk panggilan melalui API dengan gaji -as -you-go harga - $0.02 per 1 juta token masukan dan $0.04 per 1 juta token keluaran. Hal ini memungkinkan Anda untuk cepat menguji fungsionalitas tanpa harus menyebarkan model pada infrastruktur Anda sendiri.
Penempatan lokal dan fine- tuning
Berkat beban terbuka, model dapat diunduh dan dijalankan secara lokal. Ini memerlukan sebuah GPU dengan memori video yang cukup. Batch Inference - batch pengolahan permintaan - didukung, yang mempercepat bekerja dalam skenario produksi. Mekanisme Fine- tuning memungkinkan model untuk diadaptasi ke daerah subjek yang sempit.
Melalui antarmuka dengan Pencarian Web
Model ini mendukung Pencarian Web, memungkinkan untuk mengambil informasi up- to-date dari internet ketika menjawab permintaan. Hal ini terutama berguna untuk tugas-tugas yang membutuhkan data segar di luar model pengetahuan cutoff.
Fitur utama Gemma 3 4B
Teks dan pemrosesan gambar
Gemma 3 4B menerima baik teks dan gambar sebagai masukan dan kembali menanggapi teks. Ini adalah fungsi multimodal inti yang mendasari semua kemampuan lainnya.
Fungsi Memanggil dan Keluaran Terstruktur
Model dapat menyebut fungsi eksternal, memungkinkan integrasi dengan layanan dan basis data lain. Dukungan Keluaran Terstruktur memastikan bahwa model menanggapi dikembalikan dalam format yang dispesifikasikan (misalnya, JSON), menyederhanakan pemrosesan hasil pemrograman.
Eksekusi Kode dan Inferensi Batch
Pembangunan dalam kemampuan eksekusi kode memungkinkan model untuk memecahkan tugas komputasi dan memproses algoritma. Inferensi Batch memungkinkan pengiriman permintaan ke model dalam batch, menghemat waktu selama pemrosesan data massal.
Kemajuan Gemma 3 4B
Besar jendela konteks
Jendela konteks 128 ribu token adalah salah satu yang terbesar di antara model kompak. Hal ini memungkinkan pemrosesan dokumen panjang, log percakapan, source code dari proyek besar, dan volume besar lainnya informasi tanpa kehilangan konteks.
Biaya sangat rendah
Harga dari $0.02 per 1 juta token masukan dan $0.04 per 1 juta token keluaran membuat model salah satu yang paling biaya-efektif di pasar. Pada volume pemrosesan besar, ini menyediakan tabungan signifikan dibandingkan dengan alternatif yang lebih mahal.
Buka bobot dan multimodalitas
Kemampuan untuk menemukan-tune model dan menggunakannya dengan gambar sementara memiliki bobot terbuka adalah kombinasi langka. Kebanyakan model multimodal compact baik tidak memiliki kode terbuka atau biaya lebih.
Kerugian Gemma 3 4B
Jumlah parameter terbatas
4 miliar parameter adalah ukuran compact yang mungkin tidak memberikan kualitas yang sama tanggapan pada tugas logis kompleks dan penalaran dalam sebagai model yang lebih besar (misalnya, 70B atau 100B +). Skenario yang sangat khusus atau kompleks mungkin memerlukan fine- tuning.
Nilai rata-rata benchmark
Nilai rata-rata ZeroEval adalah 53.0%, menunjukkan hasil biasa-biasa saja pada tugas-tugas tes biasa tanpa tambahan tuning. Dalam beberapa skenario, model mungkin jatuh pendek dari mitra yang lebih besar atau lebih khusus tanpa fine- tuning.
Tugas apa yang dilakukan Gemma 3 4B?
Pertanyaan menjawab dan meringkas
Model ini dapat memberikan jawaban rinci pada konten tekstual dan visual, serta menghasilkan rangkuman singkat (abstrak) teks panjang. Jendela konteks besar memungkinkan seluruh artikel atau bab buku untuk dimasukan sebagai masukan.
Penalaran logis dan analisis
Gemma 3 4B cocok untuk tugas-tugas yang membutuhkan pembangunan sebab-dan-efek hubungan, membandingkan data, dan menarik kesimpulan dari informasi yang diberikan. Ini termasuk rantai logis murni tekstual dan analisis numerik data dari tabel atau grafik.
Pemahaman gambar
Jaringan saraf dapat menganalisa informasi visual: mengenali objek dalam gambar, menggambarkan adegan, dan menafsirkan diagram dan grafik. Ini adalah permintaan dalam tugas yang berhubungan dengan dokumen aliran otomatisasi, arsip, dan bekerja dengan konten media.
Gemma 3 4B harga
Model menggunakan model pembayaran berbasis token. Token masukan (teks dan gambar dilewatkan sebagai masukan) biayanya $0.02 per 1 juta token. Token keluaran (menghasilkan respon) biaya $0.04 per 1 juta token. Ini membuat model salah satu yang termurah di kelasnya. Harga yang tepat untuk gambar (dalam token ekuivalen) bergantung pada resolusi dan detail gambar.
Akhir penggunaan untuk Gemma 3 4B
Model ini didistribusikan di bawah lisensi Gemma. Tersedia untuk diunduh dan digunakan secara gratis. Bobot terbuka memungkinkan model tersebut baik-baik saja dan digunakan dalam proyek komersial subjek lisensi. Pengembang disarankan untuk meninjau teks lisensi penuh sebelum memulai penggunaan komersial.
Kemampuan Gemma 3 4B
Gemma 3 4B tersedia melalui API dari Google dan ketiga penyedia partai yang mendukung model. Model juga dapat diunduh langsung dari repositori resmi untuk penyebaran lokal. Berbagai frameworks untuk inferensi dan fine- tuning didukung. Ketersediaan dari Pencarian Web, Inferensi Batch, dan kemampuan lainnya tergantung pada metode penyebaran tertentu.
Bagaimana Gemma 3 4B berbeda dari rekan-rekan
Perbandingan dengan model Gemma 3n
Dalam keluarga Gemma 3, ada konfigurasi yang berbeda: Gemma 3n E2B, Gemma 3n E4B, seperti yang diinstruksikan dan versi ringan (Instructed LiteRT Preview). Gemma 3 4B adalah versi dasar dengan 4 miliar parameter. Versions dengan akhiran "n" mungkin berbeda dalam arsitektur dan kinerja. Versi LiteRT dioptimalkan untuk operasi pada perangkat dengan sumber daya terbatas.
Perbandingan dengan MedGemma 4B IT
MedGemma 4B IT adalah versi khusus baik-disetel pada data medis. Sebaliknya, Gemma 3 4B adalah model general- tujuan tidak disesuaikan ke daerah subjek tertentu, tetapi memungkinkan independen finetuning untuk domain apapun.
Perbandingan dengan Gemini 1.5 Flash 8B
Gemini 1.5 Flash 8B adalah model yang lebih besar dari Google (parameter 8B) berfokus pada kecepatan dan latensi rendah. Gemma 3 4B kalah dalam jumlah parameter tapi menang berkat bobot terbuka dan kemampuan penyesuaian penuh. Kedua model mendukung multimodalitas dan jendela konteks yang besar.
Kesimpulan
Gemma 3 4B adalah model multimodal kompak dengan bobot terbuka dari Google, menampilkan jendela konteks besar 128 ribu token dan biaya penggunaan rendah. Hal ini cocok untuk menjawab pertanyaan, rangkuman, penalaran logis, dan analisis informasi visual. Terima kasih atas kode open-source, dukungan untuk Fungsi Memanggil, Kode Eksekusi, dan fine- tuning kemampuan, model adalah bunga untuk pengembang, peneliti, dan tim otomatis bekerja dengan tekstual dan konten visual. Harga rendah ($0.02 per 1 juta token masukan) membuatnya menjadi sebuah pilihan berharga untuk penggunaan largescale.
Pertanyaan yang sering ditanyakan
Alat AI serupa
Lihat juga

Sebuah agen pengembangan AI open source yang membantu menghasilkan, memperbaiki, dan kode debug langsung di IDE.

Asisten pemasaran AI yang membantu menciptakan strategi promosi dan mengoptimalkan kampanye iklan.

Asisten email AI yang berintegrasi dengan Gmail dan Outlook.

Sebuah platform untuk mengobrol dengan karakter AI virtual yang dapat Anda buat dan disesuaikan dengan diri Anda sendiri.

Platform AI untuk pemutaran ulang cepat yang membantu perekrut memilih kandidat yang cocok.

Sebuah platform untuk mengobrol dengan karakter AI virtual dengan generasi gambar selama percakapan.

Desktop Al asisten untuk MacOS, Windows, dan Linux yang meluncurkan melalui hotkey di atas semua jendela dan menggabungkan beberapa model bahasa dalam satu antarmuka.
Asisten cerdas dari Microsoft, dibangun dalam mesin pencari Bing dan browser Edge, didukung oleh GPT-4.