Gemma 3 4B

Sin cargo

Modelo de lenguaje multimodal de Google con 4.000 millones de parámetros y una ventana de contexto token 128K.

Examen

Gemma 3 4B

Descripción de la red neuronal Gemma 3 4B

Gemma 3 4B es un modelo de lenguaje multimodal de código abierto desarrollado por Google. El modelo está equipado con 4.000 millones de parámetros y puede trabajar simultáneamente con información textual y visual, lo que lo convierte en una herramienta versátil para una amplia gama de tareas de inteligencia artificial.

Función clave — pesos abiertos

A diferencia de muchos modelos comerciales, Gemma 3 4B se distribuye con pesos abiertos. Esto significa que los desarrolladores no sólo pueden utilizar el modelo como-es, sino también ajustarlo para sus propios escenarios, adaptando el comportamiento de la red neuronal a las características específicas de sus proyectos.

Multimodalidad y apoyo lingüístico

El modelo procesa las consultas de texto y las imágenes, generando respuestas de texto. Esto permite que se utilice en escenarios que requieren análisis de contenido visual: describir imágenes, extraer información de gráficos y diagramas, y trabajar con documentos escaneados. Además, el modelo admite varios idiomas, ampliando el alcance geográfico de sus aplicaciones.

Fecha de lanzamiento y corte de conocimiento

Gemma 3 4B fue liberado el 12 de marzo de 2025. El corte de conocimiento del modelo es el 1 de agosto de 2024, lo que significa que la red neuronal se entrenó en la actualización de datos a esa fecha.

Gemma 3 4B especificaciones

CaracterísticasValor
TipoMultimodal language model
DesarrolladorGoogle
Número de parámetros4.0B
Context windowTokens 128K (131.1K en la página)
Fecha de lanzamiento12 de marzo de 2025
Tokens de capacitación4.0T tokens
Reducción del conocimiento1 de agosto de 2024
Promedio de puntuación (ZeroEval)53.0%
Tokens de entrada máxima131.1K
Tokens de salida máxima131.1K
Licenciagemma
Precio de facturación (por 1M)$0.02
Precio de facturación (por 1M)$0.04
Capacidades de apoyoFunción de llamada, salida estructurada, ejecución de código, búsqueda web, inferencia de lotes, ajuste fino

¿Quién es la red neuronal Gemma 3 4B adecuada para?

Desarrolladores de software e ingenieros de aprendizaje automático

Gemma 3 4B está destinada principalmente a profesionales que construyen e implementan soluciones de IA. Los pesos abiertos permiten ajustar el modelo para tareas empresariales específicas, desde chatbots hasta sistemas de análisis de documentos. Soporte para Fun Calling y Code Execution hace que el modelo sea adecuado para la integración en productos de software que requieren ejecución de códigos o interacción con funciones externas.

Investigadores y entusiastas de AI

Para tareas de investigación, el modelo es interesante debido a su tamaño compacto (4B parámetros) y multimodalidad. Esto hace posible estudiar el comportamiento de los modelos pequeños en las tareas de comprensión de imagen y texto sin requerir importantes recursos informáticos. El bajo costo de inferencia también hace que sea accesible para experimentos.

Equipos que trabajan con contenido visual

Los especialistas que necesitan analizar imágenes —desde los marketers hasta los expertos técnicos— pueden utilizar el modelo para la descripción automática, categorización y extracción de datos de fotos, capturas de pantalla, diagramas y gráficos.

¿Cómo utilizar la red neuronal Gemma 3 4B?

Media API y servicios en la nube

El modelo está disponible para llamar a través de una API con precios de pago como pago — $0.02 por 1 millón de fichas de entrada y $0.04 por 1 millón de fichas de salida. Esto le permite probar rápidamente la funcionalidad sin tener que desplegar el modelo en su propia infraestructura.

Despliegue local y ajuste fino

Gracias a los pesos abiertos, el modelo se puede descargar y ejecutar localmente. Esto requiere una GPU con suficiente memoria de vídeo. Batch Inference - procesamiento por lotes de solicitudes - es compatible, lo que acelera el trabajo en escenarios de producción. El mecanismo de ajuste fino permite que el modelo se adapte a un área temática estrecha.

A través de interfaces con Búsqueda Web

El modelo es compatible con Web Search, lo que le permite recuperar información actualizada de Internet mientras responde a las solicitudes. Esto es especialmente útil para tareas que requieren datos frescos más allá del corte de conocimientos del modelo.

Características principales de Gemma 3 4B

Procesamiento de texto e imagen

Gemma 3 4B acepta tanto texto como imágenes como entradas y devuelve las respuestas de texto. Esta es la función multimodal central que subyace a todas las demás capacidades.

Función de llamada y salida estructurada

El modelo puede llamar funciones externas, permitiendo la integración con otros servicios y bases de datos. El soporte de salida estructurado garantiza que las respuestas modelo se devuelvan en un formato específico (por ejemplo, JSON), simplificando el procesamiento programático de los resultados.

Ejecución de códigos e inferencia de lotes

La capacidad de ejecución de código incorporada permite al modelo resolver tareas computacionales y procesar algoritmos. Batch Inference permite enviar solicitudes al modelo en lotes, ahorrando tiempo durante el procesamiento de datos masivos.

Ventajas de Gemma 3 4B

Gran ventana contextual

La ventana contextual de 128 mil fichas es una de las más grandes entre los modelos compactos. Esto permite procesar documentos largos, registros de conversaciones, código fuente de grandes proyectos, y otros grandes volúmenes de información sin perder contexto.

Costo extremadamente bajo

El precio de $0.02 por 1 millón de fichas de entrada y $0.04 por 1 millón de fichas de salida hace que el modelo sea uno de los más rentables en el mercado. En grandes volúmenes de procesamiento, esto proporciona ahorros significativos en comparación con alternativas más costosas.

Pesos abiertos y multimodalidad

La capacidad de ajustar el modelo y utilizarlo con imágenes mientras tiene pesos abiertos es una combinación rara. La mayoría de los modelos multimodales compactos no tienen código abierto o cuestan más.

Desventajas de Gemma 3 4B

Número limitado de parámetros

4 mil millones de parámetros es un tamaño compacto que puede no ofrecer la misma calidad de respuestas sobre tareas lógicas complejas y razonamiento profundo como modelos más grandes (por ejemplo, 70B o 100B+). Los escenarios altamente especializados o complejos pueden requerir un ajuste fino.

Puntuación media de referencia

La puntuación media de ZeroEval es del 53,0%, indicando resultados mediocres en las tareas típicas de prueba sin ajuste adicional. En algunos escenarios, el modelo puede quedar corto de contrapartes más grandes o más especializadas sin un ajuste fino.

¿Qué tareas resuelve Gemma 3 4B?

Respuesta a la pregunta y resumen

El modelo puede proporcionar respuestas detalladas sobre el contenido textual y visual, así como producir breves resúmenes (abstractos) de textos largos. La gran ventana contextual permite que artículos enteros o capítulos de libros sean alimentados como entrada.

Análisis y razonamiento lógico

Gemma 3 4B es adecuado para tareas que requieren la construcción de relaciones de causa y efecto, comparando datos y sacando conclusiones de la información proporcionada. Esto incluye cadenas lógicas puramente textuales y análisis de datos numéricos de tablas o gráficos.

Comprensión de imagen

La red neuronal puede analizar la información visual: reconocer objetos en imágenes, describir escenas e interpretar diagramas y gráficos. Esto está en demanda en tareas relacionadas con la automatización del flujo de documentos, el archivo y el trabajo con contenido multimedia.

Gemma 3 4B precios

El modelo utiliza un modelo de pago basado en token. Las fichas de entrada (texto e imágenes pasadas como entrada) cuestan $0.02 por 1 millón de fichas. Las fichas de salida (respuestas generadas) cuestan $0.04 por 1 millón de fichas. Esto hace que el modelo sea uno de los más baratos de su clase. Los precios exactos para imágenes (en token equivalente) dependen de la resolución y el detalle de las imágenes.

Términos de uso para Gemma 3 4B

El modelo se distribuye bajo la licencia de gemma. Está disponible de forma gratuita para descargar y utilizar. Los pesos abiertos permiten que el modelo sea perfeccionado y utilizado en proyectos comerciales sujetos a los términos de licencia. Se aconseja a los desarrolladores que revisen el texto completo de licencia antes de comenzar el uso comercial.

Disponibilidad de Gemma 3 4B

Gemma 3 4B está disponible a través de API de Google y proveedores de terceros que apoyan el modelo. El modelo también se puede descargar directamente desde el repositorio oficial para el despliegue local. Se apoyan diversos marcos para la inferencia y el ajuste fino. La disponibilidad de Web Search, Batch Inference y otras capacidades depende del método de implementación específico.

Cómo Gemma 3 4B difiere de contrapartes

Comparación con los modelos Gemma 3n

Dentro de la familia Gemma 3, hay diferentes configuraciones: Gemma 3n E2B, Gemma 3n E4B, así como versiones instruidas y ligeras (Previsión de LiteRT Instrucciones). Gemma 3 4B es la versión base con 4 mil millones de parámetros. Las versiones con el sufijo "n" pueden diferir en arquitectura y rendimiento. Las versiones de LiteRT están optimizadas para funcionar en dispositivos con recursos limitados.

Comparación con MedGemma 4B IT

MedGemma 4B IT es una versión especializada perfeccionada en datos médicos. En cambio, Gemma 3 4B es un modelo de uso general no adaptado a un área temática específica, pero sí permite un ajuste independiente para cualquier dominio.

Comparación con Gemini 1.5 Flash 8B

Gemini 1.5 Flash 8B es un modelo más grande de los parámetros de Google (8B) centrado en velocidad y baja latencia. Gemma 3 4B pierde en el número de parámetros pero gana gracias a los pesos abiertos y la capacidad de personalización completa. Ambos modelos soportan la multimodalidad y una gran ventana de contexto.

Conclusión

Gemma 3 4B es un modelo multimodal compacto con pesos abiertos de Google, con una gran ventana de contexto de 128 mil fichas y bajo costo de uso. Es adecuado para responder preguntas, resumir, razonar lógicamente y análisis de información visual. Gracias a su código de código abierto, soporte para Fun Calling, Code Execution y capacidades de ajuste fino, el modelo es de interés para desarrolladores, investigadores y equipos que automatizan el trabajo con contenido textual y visual. El precio bajo (0,02 dólares por fichas de entrada 1M) lo convierte en una opción rentable para uso a gran escala.

Generar respuestas a las preguntas
texto resumen
Análisis de imágenes
razonamiento lógico

Preguntas frecuentes

Vea también

Gemma 3 4B — panorama general de la red neural multimodal de Google