Gemma 3 4B

免费

来自Google的多模式语言模型,有40亿个参数和一个128K符号上下文窗口.

187视图
访问网站

概览

金马3 4B

Gemma 3 4B神经网络描述

Gemma 3 4B是由Google开发的开源多式联运模式. 该模型配备了40亿个参数,可以同时与文字和视觉信息同时工作,使其成为多种用途的工具,用于广泛的人工智能任务.

关键特征——开放式重量

与许多商业型号不同的是,Gemma 3 4B以开放式重量分配. 这意味着开发者不仅可以将模型作为-is使用,还可以根据自己的情景进行微调,使神经网络的行为适应他们项目的具体细节.

多式联运和语言支持

该模型处理文本查询和图像,生成文本回复. 这使得它能够用于需要视觉内容分析的情景:描述图像,从图表中提取信息,以及使用扫描文件. 此外,该模型还支持几种语言,扩大其应用的地理范围.

发布日期和知识截止日期

Gemma 3 4B于2025年3月12日发布. 该模型的知识截断时间为2024年8月1日,意思是神经网络接受了数据电流培训 至今为止。

Gemma 3 4B 规格

特征数值
类型多式联运模式
开发者谷歌
参数数4.0B (韩语)
上下文窗口128K 令牌 (131.1K 在页面上)
发布日期2025年3月12日 (中文(简体) ).
培训标志4.0T 标记
知识截断2024年8月1日 (英语).
平均分 (零Eval)53.0%
最大输入符131.1K (韩语)
最大输出符131.1K (韩语)
许可证宝石
输入符号价格(每1M)(单位:美元)
产出代号价格(每1M)0.04美元 (单位:千美元)
支助能力函数调用、结构化输出、代码执行、网络搜索、批量推论、微调

Gemma 3 4B神经网络适合谁?

软件开发者和机器学习工程师

Gemma 3 4B主要面向构建和部署AI解决方案的专业人士. 开放的权重允许对模型进行微调,用于特定的业务任务——从聊天器到文档分析系统. 对函数调用和代码执行的支持使得该模型适合整合到需要代码执行或与外部函数交互的软件产品中.

AI 研究人员和爱好者

就研究任务而言,该模型因其紧凑的大小(4B参数)和多式联运性而很有趣. 这使得可以在不需要大量计算资源的情况下研究小模型在图像和文本理解任务上的行为. 低推论成本也使得它可以进行实验.

使用视觉内容的团队

需要分析图像的专家——从推销员到技术专家——可以使用模型自动描述、分类和从照片、截图、图表中提取数据。

如何使用Gemma 3 4B神经网络?

API和云服务

该模式可通过一个有现收现付定价的API调用——每100万个输入符号为0.02美元,每100万个输出符号为0.04美元。 这使得您可以快速测试功能,而无需在自己的基础设施上部署模型.

地方部署和微调

由于开放式的重量,该模型可以下载并在当地运行. 这需要具有足够视频内存的GPU. 批量推论——批量处理请求——得到支持,这加速了生产情景中的工作. 微调机制可以使模型适应一个狭窄的主题区域.

通过网络搜索的接口

该模型支持Web Search,允许其在回答请求时从互联网上检索最新信息. 这对于需要超出模型知识极限的新数据的任务特别有用.

Gemma 3 4B的主要特征

文本和图像处理

Gemma 3 4B 接受文本和图像作为输入并返回文本回复. 这是支撑所有其他能力的核心多式联运功能。

函数调用和结构化输出

该模型可以调用外部功能,能够与其他服务和数据库融合. 结构化产出支助确保以特定格式(如JSON)返回模型反应,简化对结果的方案处理。

代码执行和批量推断

内置的代码执行能力允许模型解决计算任务和处理算法. 批量推论可以将请求分批发送到模型中,在批量数据处理中节省时间.

Gemma的优点 3 4B

大上下文窗口

12万8千个令牌的上下文窗口是紧凑模型中最大的窗口之一. 这样可以处理长文件,对话日志,大型项目的源代码,以及其他大量信息而不失去上下文.

费用极低

每100万个输入令牌的价格为0.02美元,每100万个输出令牌的价格为0.04美元,这使模型成为市场上最具成本效益的模型之一. 与较昂贵的替代品相比,在大量的加工量中,这可节省大量费用。

开放式重量和多式联运

能够微调模型,在有开放重量的同时用图像使用,是罕见的组合. 大多数紧凑的多式联运模式要么没有开放代码,要么成本更高。

Gemma的缺点 3 4B

参数有限

40亿参数是一个紧凑的大小,在复杂的逻辑任务和深度推理上可能无法提供与更大的模型(如70B或100B+)相同的响应质量. 高度专业化或复杂的情景可能需要调整。

平均基准分

ZeroEval的平均得分为53.0%,表示在不增加调试的情况下,典型测试任务的中庸结果. 在某些设想中,模型可能比没有微调的较大或更专业的对应模型还差。

Gemma 3 4B 解决了什么任务?

问答和总结

该模型可以提供文字和视觉内容的详细答案,以及制作长篇摘要(摘要). 大型上下文窗口允许将整篇文章或书籍章节作为输入来输入.

逻辑推理和分析

Gemma 3 4B适合需要构建因果关系的任务,比较数据,并从提供的信息中得出结论. 这包括纯粹的文字逻辑链和对表格或图表中的数字数据的分析。

图像理解

神经网络可以分析视觉信息:在图像中识别对象,描述场景,并解释图表. 在与文件流程自动化、归档和与媒体内容合作有关的任务中,这是需要的。

Gemma 3 4B定价

该型号采用以符号为基础的支付模式. 输入令牌(文字和图像作为输入通过)每100万令牌花费0.02美元. 产出令牌(产生的回复)每100万令牌花费0.04美元. 这使得模型成为其班级中最便宜的之一. 图像的精确价格(以等价符号表示)取决于图片的分辨率和细节.

Gemma的使用条款 3 4B

该型号以Gemma牌照发行. 该手册可免费下载和使用。 开放式的权重允许对模型进行微调,并在符合许可证条件的商业项目中使用. 建议开发者在开始商业使用前审查许可证全文。

Gemma的可用性 3 4B

Gemma 3 4B通过来自谷歌和支持该模型的第三方供应商的API提供. 该模型也可以直接从官方寄存器下载,用于本地部署. 支持各种推论和微调框架。 网络搜索,批量推论等能力的可用性取决于具体的部署方法.

Gemma 3 4B 与对应方有何不同

与 Gemma 3n 模型的比较

在Gemma 3家族内部,有不同的配置:Gemma 3n E2B,Gemma 3n E4B,以及指令版和轻量级版本(Instructive LiteRT Preview). Gemma 3 4B是拥有40亿参数的基版. 带有"n"后缀的版本在架构和性能上可能有所不同. LiteRT版本被优化,以便在资源有限的设备上运行.

与MedGemma 4B IT的比较

MedGemma 4B IT是一个专门化的版本,对医疗数据进行了微调. 相比之下,Gemma 3 4B是一个通用模型,并非针对特定的主题领域定制,但它确实允许对任何域进行独立的微调.

与双子座1.5 Flash 8B的比较

双子座1.5 Flash 8B是来自Google(8B参数)的更大模型,专注于速度和低潜度. Gemma 3 4B在参数数上输给了它,但由于开放的重量和完全定制的能力而获胜. 这两个模式都支持多式联运和大型上下文窗口。

结论

Gemma 3 4B是一种紧凑的多式联运模型,由Google提供开放式的权重,以128千个令牌和低使用成本的大型上下文窗口为特色. 它适合于回答问题,归纳,逻辑推理,以及视觉信息分析. 由于它的开源代码,支持函数调用,代码执行,以及微调能力,模型是 开发者、研究人员和团队对文字和视觉内容的自动化工作感兴趣。 低价(每1M输入令牌0.02美元)使它成为大规模使用的一个成本效益高的选择.

生成对问题的答案
文本总和
图像分析
逻辑推理

常问问题

另见

Gemma 3 4B——谷歌多模式神经网络概况