Gemma 3 4B
Modèle de langage multimodal de Google avec 4 milliards de paramètres et une fenêtre contextuelle 128K.
Aperçu général
Gemma 3 4B
Description du réseau neuronal Gemma 3 4B
Gemma 3 4B est un modèle de langage multimodal open-source développé par Google. Le modèle est équipé de 4 milliards de paramètres et peut fonctionner simultanément avec des informations textuelles et visuelles, ce qui en fait un outil polyvalent pour un large éventail de tâches d'intelligence artificielle.
Élément clé — poids ouverts
Contrairement à de nombreux modèles commerciaux, Gemma 3 4B est distribué avec des poids ouverts. Cela signifie que les développeurs peuvent non seulement utiliser le modèle tel quel, mais aussi l'affiner pour leurs propres scénarios, en adaptant le comportement du réseau neuronal aux spécificités de leurs projets.
Multimodalité et soutien linguistique
Le modèle traite les requêtes de texte et les images, générant des réponses de texte. Cela permet de l'utiliser dans des scénarios nécessitant une analyse visuelle du contenu : description des images, extraction de l'information des graphiques et des diagrammes, et travail avec des documents numérisés. En outre, le modèle prend en charge plusieurs langues, élargissant la portée géographique de ses applications.
Date de sortie et seuil de connaissances
Gemma 3 4B est sorti le 12 mars 2025. Le seuil de connaissance du modèle est le 1er août 2024, ce qui signifie que le réseau neuronal a été formé à l'actualisation des données à cette date.
Spécifications Gemma 3 4B
| Caractéristiques | Valeur |
|---|---|
| Type | Modèle de langage multimodal |
| Développeur | |
| Nombre de paramètres | 4,0B |
| Fenêtre contextuelle | 128K jetons (131.1K sur la page) |
| Date de sortie | 12 mars 2025 |
| Jetons de formation | Jetons 4.0T |
| Seuil de connaissances | 1er août 2024 |
| Score moyen (ZeroEval) | 53,0% |
| Jetons d'entrée maximum | 131.1K |
| Jetons de sortie maximum | 131.1K |
| Licence | gemme |
| Prix du jeton d'entrée (par 1M) | 0,02 $ |
| Prix du jeton de sortie (par 1M) | 0,04 $ |
| Capacités soutenues | Fonction Appel, Sortie structurée, Exécution de code, Recherche Web, Inférence de lot, Finissage |
Pour qui le réseau neuronal Gemma 3 4B convient-il ?
Développeurs de logiciels et ingénieurs en apprentissage automatique
Gemma 3 4B est principalement destiné aux professionnels qui construisent et déploient des solutions d'IA. Les poids ouverts permettent d'affiner le modèle pour des tâches d'affaires spécifiques — des chatbots aux systèmes d'analyse de documents. La prise en charge de l'appel de fonction et de l'exécution de code rend le modèle adapté pour l'intégration dans les produits logiciels qui nécessitent l'exécution de code ou l'interaction avec des fonctions externes.
Chercheurs et passionnés de l'IA
Pour les tâches de recherche, le modèle est intéressant en raison de sa taille compacte (4 paramètres B) et de sa multimodalité. Cela permet d'étudier le comportement des petits modèles sur les tâches de compréhension de l'image et du texte sans exiger de ressources informatiques importantes. Le faible coût d'inférence le rend également accessible pour les expériences.
Équipes travaillant avec du contenu visuel
Les spécialistes qui ont besoin d'analyser des images — des spécialistes du marketing aux experts techniques — peuvent utiliser le modèle pour la description automatique, la catégorisation et l'extraction de données à partir de photos, de captures d'écran, de diagrammes et de graphiques.
Comment utiliser le réseau neuronal Gemma 3 4B ?
Via les services API et cloud
Le modèle est disponible pour les appels via une API avec des prix à la carte – 0,02 $ par 1 million de jetons d'entrée et 0,04 $ par 1 million de jetons de sortie. Cela vous permet de tester rapidement la fonctionnalité sans avoir à déployer le modèle sur votre propre infrastructure.
Déploiement local et réglage fin
Grâce aux poids ouverts, le modèle peut être téléchargé et exécuté localement. Cela nécessite un GPU avec une mémoire vidéo suffisante. L'inférence par lots — traitement par lots des demandes — est prise en charge, ce qui accélère le travail dans les scénarios de production. Le mécanisme de réglage fin permet d'adapter le modèle à un domaine restreint.
Grâce à des interfaces avec la recherche Web
Le modèle prend en charge la recherche Web, lui permettant de récupérer des informations à jour à partir d'Internet tout en répondant aux demandes. Ceci est particulièrement utile pour les tâches qui nécessitent de nouvelles données au-delà du seuil de connaissances du modèle.
Principales caractéristiques de Gemma 3 4B
Traitement de texte et d'image
Gemma 3 4B accepte à la fois le texte et les images en entrée et renvoie les réponses texte. C'est la fonction multimodale de base qui sous-tend toutes les autres capacités.
Fonction Appel et sortie structurée
Le modèle peut appeler des fonctions externes, permettant l'intégration avec d'autres services et bases de données. L'appui à la production structurée garantit que les réponses du modèle sont retournées dans un format précis (p. ex. JSON), simplifie le traitement programmatique des résultats.
Exécution du code et inférence par lots
La capacité d'exécution de code intégrée permet au modèle de résoudre les tâches de calcul et les algorithmes de processus. L'inférence par lots permet d'envoyer des requêtes au modèle en lots, ce qui permet d'économiser du temps pendant le traitement de masse des données.
Avantages de Gemma 3 4B
Grande fenêtre contextuelle
La fenêtre contextuelle de 128 mille jetons est l'un des plus grands parmi les modèles compacts. Cela permet de traiter de longs documents, des journaux de conversation, le code source de grands projets et d'autres volumes importants d'information sans perdre de contexte.
Coût extrêmement faible
Le prix de 0,02 $ par 1 million de jetons d'entrée et de 0,04 $ par 1 million de jetons de sortie fait du modèle l'un des plus rentables du marché. À grands volumes de traitement, cela permet d'économiser beaucoup par rapport aux solutions de rechange plus coûteuses.
Poids ouverts et multimodalité
La possibilité d'affiner le modèle et de l'utiliser avec des images tout en ayant des poids ouverts est une combinaison rare. La plupart des modèles multimodaux compacts n'ont pas de code ouvert ou coûtent plus cher.
Inconvénients de Gemma 3 4B
Nombre limité de paramètres
4 milliards de paramètres sont une taille compacte qui peut ne pas fournir la même qualité de réponses sur des tâches logiques complexes et un raisonnement profond que des modèles plus grands (p. ex. 70B ou 100B+). Des scénarios très spécialisés ou complexes peuvent nécessiter un réglage fin.
Score de référence moyen
Le score moyen ZeroEval est de 53,0%, ce qui indique des résultats médiocres sur les tâches de test typiques sans réglage supplémentaire. Dans certains scénarios, le modèle peut ne pas correspondre à des contreparties plus grandes ou plus spécialisées sans réglage fin.
Quelles tâches Gemma 3 4B résout-elle ?
Réponse aux questions et synthèse
Le modèle peut fournir des réponses détaillées sur le contenu textuel et visuel, ainsi que produire de brefs résumés (résumés) de textes longs. La grande fenêtre contextuelle permet d'alimenter en entrée des articles entiers ou des chapitres de livres.
Raisonnement logique et analyse
Gemma 3 4B convient aux tâches qui nécessitent des relations de cause à effet, en comparant les données et en tirant des conclusions à partir des informations fournies. Cela comprend à la fois les chaînes logiques purement textuelles et l'analyse des données numériques des tableaux ou des graphiques.
Compréhension des images
Le réseau neuronal peut analyser l'information visuelle : reconnaître les objets dans les images, décrire les scènes et interpréter les diagrammes et les graphiques. Ceci est en demande dans les tâches liées à l'automatisation du flux de documents, à l'archivage et au travail avec le contenu des médias.
Prix Gemma 3 4B
Le modèle utilise un modèle de paiement basé sur des jetons. Les jetons d'entrée (texte et images transmises comme entrées) coûtent 0,02 $ par million de jetons. Les jetons de sortie (réponses générées) coûtent 0,04 $ par million de jetons. Cela fait du modèle l'un des moins chers de sa classe. Les prix exacts des images (en équivalent jeton) dépendent de la résolution et du détail des images.
Conditions d'utilisation de Gemma 3 4B
Le modèle est distribué sous licence gemma. Il est disponible gratuitement à télécharger et à utiliser. Les poids ouverts permettent d'affiner le modèle et de l'utiliser dans des projets commerciaux soumis aux conditions de licence. Il est conseillé aux développeurs d'examiner le texte complet de la licence avant de commencer l'utilisation commerciale.
Disponibilité de Gemma 3 4B
Gemma 3 4B est disponible via l'API de Google et de fournisseurs tiers qui prennent en charge le modèle. Le modèle peut également être téléchargé directement à partir du dépôt officiel pour un déploiement local. Divers cadres d'inférence et de réglage sont soutenus. La disponibilité de la recherche Web, de l'inférence par lots et d'autres capacités dépend de la méthode de déploiement spécifique.
Comment Gemma 3 4B diffère des homologues
Comparaison avec les modèles Gemma 3n
Au sein de la famille Gemma 3, il existe différentes configurations : Gemma 3n E2B, Gemma 3n E4B, ainsi que des versions instruites et légères (Instructed LiteRT Preview). Gemma 3 4B est la version de base avec 4 milliards de paramètres. Les versions avec le suffixe "n" peuvent différer dans l'architecture et les performances. Les versions LiteRT sont optimisées pour fonctionner sur des appareils avec des ressources limitées.
Comparaison avec MedGemma 4B IT
MedGemme 4B IT est une version spécialisée adaptée aux données médicales. En revanche, Gemma 3 4B est un modèle à usage général qui n'est pas adapté à un domaine spécifique, mais qui permet un réglage fin indépendant pour n'importe quel domaine.
Comparaison avec Gemini 1.5 Flash 8B
Gemini 1.5 Flash 8B est un modèle plus grand de Google (8 paramètres B) axé sur la vitesse et faible latence. Gemma 3 4B perd à elle dans le nombre de paramètres mais gagne grâce à des poids ouverts et la capacité de personnalisation complète. Les deux modèles supportent la multimodalité et un grand contexte.
Conclusion
Gemma 3 4B est un modèle multimodal compact avec des poids ouverts de Google, avec une grande fenêtre de contexte de 128 mille jetons et un faible coût d'utilisation. Il convient pour répondre aux questions, résumer, raisonner logiquement et analyser l'information visuelle. Grâce à son code open-source, son support pour l'appel de fonction, son exécution de code et ses capacités de réglage fin, le modèle est d'intérêt pour les développeurs, les chercheurs et les équipes automatisant le travail avec du contenu textuel et visuel. Le bas prix (0,02 $ par jeton d'entrée 1M) en fait un choix rentable pour une utilisation à grande échelle.
Foire aux questions
Outils d'IA similaires
Voir aussi

Plateforme d'IA pour le dépistage rapide de reprise qui aide les recruteurs à sélectionner les candidats appropriés.

Panneau d'IA latéral qui aide à répondre aux questions, à travailler avec les documents et à générer des images.

Application mobile alimentée par l'IA qui vous aide à trouver les bons mots pour différentes situations de vie dans votre correspondance.

AllChat est une plateforme universelle qui combine plusieurs modèles de langage populaires dans une interface unique pour la communication, la génération d'images, l'analyse de fichiers et l'exécution de code.

Boîte à outils alimentée par l'IA pour optimiser les flux de travail et augmenter la productivité.

Plateforme en ligne pour créer des jumelles d'IA interactives basées sur la biographie, la personnalité et l'expérience personnelle de l'utilisateur.

Une plate-forme multifonctionnelle pour la création et l'édition de contenus multimédias utilisant l'intelligence artificielle.

Une plate-forme pour discuter avec des caractères d'IA virtuels avec génération d'images pendant la conversation.