DeepSeek Coder V2

免费

一个开源的专家混合模型,有2,360亿个参数,用于生成和工作程序代码.

348视图
访问网站

概览

深搜索码器 V2

深搜索码器 V2 神经网络描述

DeepSeek Coder V2是一个基于专家混合(MoE)架构的开源代码模型,旨在生成,分析,以及自动完成程序代码. 该模型有2,360亿个参数,但由于MOE架构,在任何特定时间都只有210亿活跃,确保高推论速度而不牺牲质量. 由DeepSeek于2024年6月发行.

该模式接受了338种编程语言的培训,包括流行语言(Python, JavaScript, C++)和罕见语言(Coq, Lean, Julia),并支持上下文窗口 给128K的代币 这使得它能够完整地处理大文件和复杂的项目. 对于想要在消费图形卡上运行模型的人,已经发布了一个轻量级版本DeepSeek Coder V2 Lite(16B参数,2.4B活动),该版本在GPU上运行,视频内存为12–16 GB.

深搜索码器 V2 特性

特征数值
类型代码, 文本
API 密码
开源
建筑MOE(专家名册)
参数236B(21B 活动)
背景情况128K 个令牌
编程语言338种语言
发布日期2024年6月17日 (英语).
开发者深层搜索
自由等级是(公开来源,自主办)

DeepSeek 代码 V2 适合谁?

需要强大开源模型的开发者

DeepSeek Coder V2主要为程序员设计,寻找专有解决方案的开源替代品. 该模型既适用于专业的日常工作,也适用于机器学习和代码生成方面的研究任务.

使用稀有编程语言的团队

由于对338种语言,包括Coq和Lean等特殊语言的支持,该模式将有益于使用特殊语言和正式代码验证方法的开发者。

倾向于本地部署的开发者

Lite版本允许在消费图形卡上运行该模型,这对想要保持对其数据的控制并避免使用云API的人很重要.

如何使用 DeepSeek 编码器 V2 ?

通过云 API

该模型通过官方DeepSeek API提供. 这是最简单的方式:不需要强大的硬件——你只要发送一个HTTP请求并获得结果. API价格从每100万个输入令牌的0.14美元和每100万个输出令牌的0.28美元开始,用于完整的模型.

当地部署(自办)

该型号的完整版本(236B)可在Hugging Face上找到,需要多个GPU来部署. 对于资源有限的人,有一个Lite版本(16B),可以在12–16 GB VRAM的单张图形卡上运行. 源代码和权重发布在GitHub上的开放寄存器中.

IDE 整合

DeepSeek Coder V2支持流行开发环境的插件:VS Code,JetBrains,Neovim. 与Sturn.dev和Cody平台的集成也可用,使得模型可以嵌入到现有的工作流程中,而不必从零开始写入集成.

DeepSeek 代码 V2 的关键特性

专家混合结构

在2360亿的参数中,只有210亿在任何特定时刻都活跃. 这意味着模型使用较少的计算资源进行推论,同时保持质量与使用所有参数的模型相当. 教育部的效率是传统密集建筑的关键优势。

支助338种编程语言

DeepSeek Codeer V2的训练内容是一个庞大的代码集,包含主流语言(Python, Java, C++, JavaScript, TypeScript, Go, Rust)和罕见语言(Coq, Lean, Julia). 这使它成为使用非标准技术的项目的多用途工具。

128K 令牌上下文窗口

该模型可以在一次请求中处理多达128,000个令牌. 这足以分析一个平均大小的项目或一个有上千行的文件的整个代码库,而不将其分割成几个部分.

填充中间模式( FIM)

FIM是一种自动补全模式,该模式在光标之前和之后都考虑到上下文. 这对于在IDE中工作至关重要:考虑到已经写好的续作,代码是有意义的完成的. 没有这种模式,高质量的实时自动完成是不可能的.

轻量级 Lite 版本

DeepSeek Coder V2 Lite(16B,2.4B active)设计运行于消费型GPU上. 在性能方面,它与CodeLlama 34B相当,但需要一半的视频内存,使得广大开发者都能访问.

深搜索码器 V2 优点

GPT-4 具有开源代码的涡轮级性能

在HumanEval和MBPP基准上,该模型在完全开放源码的同时优于GPT-4涡轮. 这是罕见的组合:高代码生成精度以及研究,修改,以及无限制地微调模型的能力.

成本效益

DeepSeek Codeer V2 API比OpenAI或Anthropic便宜得多. 对于在当地部署该模型的用户来说,费用仅限于硬件和电力——没有许可证费。

适量硬件可用的 Lite 版本

Lite版本(16B)以12–16 GB VRAM在图形卡上运行,即在许多消费GPU上运行. 这使得该模型可以在当地运行,而无需购买昂贵的服务器解决方案,同时仍然为日常任务保持体面的质量.

商业执照

该型号的许可证允许商业使用,取消了对想要融入其产品的企业和初创企业的限制.

深搜索码器 V2 缺点

整个版本所需资源高

完整的236B版本需要多个GPU进行自我托管部署. 这使得大多数无法访问集群或强大的服务器级图形卡的个人开发者无法访问本地部署.

用非标准框架执行前端任务

尽管总体性能较高,但该模型在使用稀有或新的前端框架时可能落后于专门解决方案. 如果一个项目使用不太常见的图书馆,生成质量可能会下降。

文件限制

文献和围绕模型的主要社区主要以英语和汉语存在. 目前俄语材料和俄语支持明显减少 ,尽管 模型本身理解俄语查询。

深搜索码 V2 解析任务是什么 ?

写入和分析代码

该模型可以从文本描述,写功能,类,模块以及整个脚本中生成代码. 它还可以分析现有的代码,解释其逻辑,并建议优化.

执行复杂的算法

DeepSeek Coder V2处理算法任务得很好:排序,搜索,与图表,动态编程,以及其他经典和现代算法合作. 在HumanEval基准上的结果证实了这一点。

查找和修复非明显错误

由于它的上下文窗口很大,并且对代码有深刻的理解,该模型可以发现在人工审查时难以发现的逻辑错误. 它适合代码审查和调试.

重构大型密码库

128K 令牌上下文允许模型处理大文件甚至整个工程,使其适合重构: 重命名变量,将重复的碎片提取到函数中,以及 正在改变模块架构。

实时代码自动补全

得益于FIM模式,该型号可以用作IDes的自动补全引擎. 它建议线的延续,完成代码块,并为构造提供完成选项,同时考虑到光标前后的背景.

深搜索码器 V2 定价

DeepSeek Coder V2作为开源免费发行——任何人都可以下载重量,在自己的硬件上运行,无需支付任何费用. 对于不愿自行部署该模型的人,官方DeepSeek API可提供按使用付费定价:每100万个输入符0.14美元,每100万个输出符0.28美元,用于该模型的完整版本. 这比OpenAI和Anthropic的类似性能模型的价格要便宜得多。

深搜索码器 V2 使用条件

该模式是开源的,其许可证允许商业使用。 这意味着开发者和公司可以将DeepSeek Coder V2嵌入他们的产品,在他们自己的数据上对其进行微调,并且不支付版税而分发修改过的版本. 运行该型号的完整版本(236B)需要多个GPU——这是一个技术,而不是法律,限制. Lite版本(16B)可以在12–16 GB VRAM的单张图形卡上运行.

深搜索码器 V2 可用性

该模型可在Hugging Face和官方DeepSeek GitHub仓库下载. 它支持338种编程语言. 文献和主要社区以英语和汉语为中心. 该模式理解俄语的询问和评论,但建议最好地明确具体地制定技术任务,而不作过多的叙述性解释。 IDE集成插件可供VS代码,JetBrains,和Neovim使用.

How DeepSeek 编码器 V2 与替代品的差异

具有开源代码的 GPT-4 Turbo 上的优越性

DeepSeek Coder V2在HumanEval和MBPP基准上优于GPT-4涡轮,同时保持完全开源模式. 这是关键区别:OpenAI的或Anthropic的专有型号都没有提供权重访问或允许不付费的商业使用.

API费用低得多

与OpenAI和Anthropic的API相比,DeepSeek Coder V2提供了多倍更低的每盘价格. 具有可比或更好的代码生成质量,这使得该模型成为初创企业和要求量高的公司成本效益高的选择.

作为CodeLlama 34B的竞争对手的Lite版本

DeepSeek Coder V2 Lite(16B)在性能上与CodeLlama 34B相当,但需要一半的视频内存. 这使得它能够运行在更廉价的硬件上,这对单个开发者和小团队尤其重要.

结论

DeepSeek Coder V2是一个基于专家混音架构的开源代码模型,将GPT-4涡轮级性能与开源提供的无障碍性能和低成本API相结合. 由于支持了338种编程语言,一个128K符号语境,以及轻量级的Lite版本,它适合广泛的开发任务:从IDE自动补全到 分析和重构大型密码库。 对于寻找强大且具有成本效益的专利解决方案替代方案的人来说,DeepSeek Coder V2是市场上最具吸引力的选项之一.

代码生成
代码重构
写入开发者文档
解决编程问题

常问问题

另见

DeepSeek Coder V2 — 开源代码神经网络概览