Gemma 3 4B

Gratuit

Modèle de langage multimodal de Google avec 4 milliards de paramètres et une fenêtre contextuelle 128K.

Aperçu général

Gemma 3 4B

Description du réseau neuronal Gemma 3 4B

Gemma 3 4B est un modèle de langage multimodal open-source développé par Google. Le modèle est équipé de 4 milliards de paramètres et peut fonctionner simultanément avec des informations textuelles et visuelles, ce qui en fait un outil polyvalent pour un large éventail de tâches d'intelligence artificielle.

Élément clé — poids ouverts

Contrairement à de nombreux modèles commerciaux, Gemma 3 4B est distribué avec des poids ouverts. Cela signifie que les développeurs peuvent non seulement utiliser le modèle tel quel, mais aussi l'affiner pour leurs propres scénarios, en adaptant le comportement du réseau neuronal aux spécificités de leurs projets.

Multimodalité et soutien linguistique

Le modèle traite les requêtes de texte et les images, générant des réponses de texte. Cela permet de l'utiliser dans des scénarios nécessitant une analyse visuelle du contenu : description des images, extraction de l'information des graphiques et des diagrammes, et travail avec des documents numérisés. En outre, le modèle prend en charge plusieurs langues, élargissant la portée géographique de ses applications.

Date de sortie et seuil de connaissances

Gemma 3 4B est sorti le 12 mars 2025. Le seuil de connaissance du modèle est le 1er août 2024, ce qui signifie que le réseau neuronal a été formé à l'actualisation des données à cette date.

Spécifications Gemma 3 4B

CaractéristiquesValeur
TypeModèle de langage multimodal
DéveloppeurGoogle
Nombre de paramètres4,0B
Fenêtre contextuelle128K jetons (131.1K sur la page)
Date de sortie12 mars 2025
Jetons de formationJetons 4.0T
Seuil de connaissances1er août 2024
Score moyen (ZeroEval)53,0%
Jetons d'entrée maximum131.1K
Jetons de sortie maximum131.1K
Licencegemme
Prix du jeton d'entrée (par 1M)0,02 $
Prix du jeton de sortie (par 1M)0,04 $
Capacités soutenuesFonction Appel, Sortie structurée, Exécution de code, Recherche Web, Inférence de lot, Finissage

Pour qui le réseau neuronal Gemma 3 4B convient-il ?

Développeurs de logiciels et ingénieurs en apprentissage automatique

Gemma 3 4B est principalement destiné aux professionnels qui construisent et déploient des solutions d'IA. Les poids ouverts permettent d'affiner le modèle pour des tâches d'affaires spécifiques — des chatbots aux systèmes d'analyse de documents. La prise en charge de l'appel de fonction et de l'exécution de code rend le modèle adapté pour l'intégration dans les produits logiciels qui nécessitent l'exécution de code ou l'interaction avec des fonctions externes.

Chercheurs et passionnés de l'IA

Pour les tâches de recherche, le modèle est intéressant en raison de sa taille compacte (4 paramètres B) et de sa multimodalité. Cela permet d'étudier le comportement des petits modèles sur les tâches de compréhension de l'image et du texte sans exiger de ressources informatiques importantes. Le faible coût d'inférence le rend également accessible pour les expériences.

Équipes travaillant avec du contenu visuel

Les spécialistes qui ont besoin d'analyser des images — des spécialistes du marketing aux experts techniques — peuvent utiliser le modèle pour la description automatique, la catégorisation et l'extraction de données à partir de photos, de captures d'écran, de diagrammes et de graphiques.

Comment utiliser le réseau neuronal Gemma 3 4B ?

Via les services API et cloud

Le modèle est disponible pour les appels via une API avec des prix à la carte – 0,02 $ par 1 million de jetons d'entrée et 0,04 $ par 1 million de jetons de sortie. Cela vous permet de tester rapidement la fonctionnalité sans avoir à déployer le modèle sur votre propre infrastructure.

Déploiement local et réglage fin

Grâce aux poids ouverts, le modèle peut être téléchargé et exécuté localement. Cela nécessite un GPU avec une mémoire vidéo suffisante. L'inférence par lots — traitement par lots des demandes — est prise en charge, ce qui accélère le travail dans les scénarios de production. Le mécanisme de réglage fin permet d'adapter le modèle à un domaine restreint.

Grâce à des interfaces avec la recherche Web

Le modèle prend en charge la recherche Web, lui permettant de récupérer des informations à jour à partir d'Internet tout en répondant aux demandes. Ceci est particulièrement utile pour les tâches qui nécessitent de nouvelles données au-delà du seuil de connaissances du modèle.

Principales caractéristiques de Gemma 3 4B

Traitement de texte et d'image

Gemma 3 4B accepte à la fois le texte et les images en entrée et renvoie les réponses texte. C'est la fonction multimodale de base qui sous-tend toutes les autres capacités.

Fonction Appel et sortie structurée

Le modèle peut appeler des fonctions externes, permettant l'intégration avec d'autres services et bases de données. L'appui à la production structurée garantit que les réponses du modèle sont retournées dans un format précis (p. ex. JSON), simplifie le traitement programmatique des résultats.

Exécution du code et inférence par lots

La capacité d'exécution de code intégrée permet au modèle de résoudre les tâches de calcul et les algorithmes de processus. L'inférence par lots permet d'envoyer des requêtes au modèle en lots, ce qui permet d'économiser du temps pendant le traitement de masse des données.

Avantages de Gemma 3 4B

Grande fenêtre contextuelle

La fenêtre contextuelle de 128 mille jetons est l'un des plus grands parmi les modèles compacts. Cela permet de traiter de longs documents, des journaux de conversation, le code source de grands projets et d'autres volumes importants d'information sans perdre de contexte.

Coût extrêmement faible

Le prix de 0,02 $ par 1 million de jetons d'entrée et de 0,04 $ par 1 million de jetons de sortie fait du modèle l'un des plus rentables du marché. À grands volumes de traitement, cela permet d'économiser beaucoup par rapport aux solutions de rechange plus coûteuses.

Poids ouverts et multimodalité

La possibilité d'affiner le modèle et de l'utiliser avec des images tout en ayant des poids ouverts est une combinaison rare. La plupart des modèles multimodaux compacts n'ont pas de code ouvert ou coûtent plus cher.

Inconvénients de Gemma 3 4B

Nombre limité de paramètres

4 milliards de paramètres sont une taille compacte qui peut ne pas fournir la même qualité de réponses sur des tâches logiques complexes et un raisonnement profond que des modèles plus grands (p. ex. 70B ou 100B+). Des scénarios très spécialisés ou complexes peuvent nécessiter un réglage fin.

Score de référence moyen

Le score moyen ZeroEval est de 53,0%, ce qui indique des résultats médiocres sur les tâches de test typiques sans réglage supplémentaire. Dans certains scénarios, le modèle peut ne pas correspondre à des contreparties plus grandes ou plus spécialisées sans réglage fin.

Quelles tâches Gemma 3 4B résout-elle ?

Réponse aux questions et synthèse

Le modèle peut fournir des réponses détaillées sur le contenu textuel et visuel, ainsi que produire de brefs résumés (résumés) de textes longs. La grande fenêtre contextuelle permet d'alimenter en entrée des articles entiers ou des chapitres de livres.

Raisonnement logique et analyse

Gemma 3 4B convient aux tâches qui nécessitent des relations de cause à effet, en comparant les données et en tirant des conclusions à partir des informations fournies. Cela comprend à la fois les chaînes logiques purement textuelles et l'analyse des données numériques des tableaux ou des graphiques.

Compréhension des images

Le réseau neuronal peut analyser l'information visuelle : reconnaître les objets dans les images, décrire les scènes et interpréter les diagrammes et les graphiques. Ceci est en demande dans les tâches liées à l'automatisation du flux de documents, à l'archivage et au travail avec le contenu des médias.

Prix Gemma 3 4B

Le modèle utilise un modèle de paiement basé sur des jetons. Les jetons d'entrée (texte et images transmises comme entrées) coûtent 0,02 $ par million de jetons. Les jetons de sortie (réponses générées) coûtent 0,04 $ par million de jetons. Cela fait du modèle l'un des moins chers de sa classe. Les prix exacts des images (en équivalent jeton) dépendent de la résolution et du détail des images.

Conditions d'utilisation de Gemma 3 4B

Le modèle est distribué sous licence gemma. Il est disponible gratuitement à télécharger et à utiliser. Les poids ouverts permettent d'affiner le modèle et de l'utiliser dans des projets commerciaux soumis aux conditions de licence. Il est conseillé aux développeurs d'examiner le texte complet de la licence avant de commencer l'utilisation commerciale.

Disponibilité de Gemma 3 4B

Gemma 3 4B est disponible via l'API de Google et de fournisseurs tiers qui prennent en charge le modèle. Le modèle peut également être téléchargé directement à partir du dépôt officiel pour un déploiement local. Divers cadres d'inférence et de réglage sont soutenus. La disponibilité de la recherche Web, de l'inférence par lots et d'autres capacités dépend de la méthode de déploiement spécifique.

Comment Gemma 3 4B diffère des homologues

Comparaison avec les modèles Gemma 3n

Au sein de la famille Gemma 3, il existe différentes configurations : Gemma 3n E2B, Gemma 3n E4B, ainsi que des versions instruites et légères (Instructed LiteRT Preview). Gemma 3 4B est la version de base avec 4 milliards de paramètres. Les versions avec le suffixe "n" peuvent différer dans l'architecture et les performances. Les versions LiteRT sont optimisées pour fonctionner sur des appareils avec des ressources limitées.

Comparaison avec MedGemma 4B IT

MedGemme 4B IT est une version spécialisée adaptée aux données médicales. En revanche, Gemma 3 4B est un modèle à usage général qui n'est pas adapté à un domaine spécifique, mais qui permet un réglage fin indépendant pour n'importe quel domaine.

Comparaison avec Gemini 1.5 Flash 8B

Gemini 1.5 Flash 8B est un modèle plus grand de Google (8 paramètres B) axé sur la vitesse et faible latence. Gemma 3 4B perd à elle dans le nombre de paramètres mais gagne grâce à des poids ouverts et la capacité de personnalisation complète. Les deux modèles supportent la multimodalité et un grand contexte.

Conclusion

Gemma 3 4B est un modèle multimodal compact avec des poids ouverts de Google, avec une grande fenêtre de contexte de 128 mille jetons et un faible coût d'utilisation. Il convient pour répondre aux questions, résumer, raisonner logiquement et analyser l'information visuelle. Grâce à son code open-source, son support pour l'appel de fonction, son exécution de code et ses capacités de réglage fin, le modèle est d'intérêt pour les développeurs, les chercheurs et les équipes automatisant le travail avec du contenu textuel et visuel. Le bas prix (0,02 $ par jeton d'entrée 1M) en fait un choix rentable pour une utilisation à grande échelle.

Générer des réponses aux questions
résumé du texte
Analyse des images
raisonnement logique

Foire aux questions

Voir aussi

Gemma 3 4B — aperçu du réseau neuronal multimodal de Google