DeepSeek v3.1:具有巨大上下文和编码的开放AI模型——由AMINGRE审查

19 八月 202614 视图

我们分析DeepSeek v3.1的关键特征:6.85亿参数,128K背景,推理模式,以及低成本. 该模型因其在麻省理工学院许可下的开放权重,对开发者和研究人员特别有趣.

DeepSeek v3.1:具有巨大上下文和编码的开放AI模型——由AMINGRE审查

最新模型来自 深搜索AI 于2025年8月发布,并立即引起社区关注. 这不仅仅是另一个聊天机,而是真正开放的系统,具有巨大的上下文窗口和强大的代码智能. 让我们看看DeepSeek v3.1提供什么,它在基准上能做什么,以及是否值得在你的项目中使用.

Depseek v3.1是什么,为什么大家都在谈论它?

该模型建立在 专家的混合 结构。 参数总数 6.85亿,但只有关于 370亿 每一个符号都会被激活——这保持了性能高,而不让整个网络参与. 这个方法已经从其他大型模型中熟悉,但在DeepSeek v3.1中,它与两种操作模式结合:

  • 思维模式 深层推理,当模型通过复杂的问题和任务逐步发挥作用时;
  • 非思维模式 ——在不需要花时间进行长时间的评议时,以定期聊天的形式快速回答.

到达上下文窗口 128 000个纪念品。这足以分析大文档、长代码或多页日志。 同时,该型号的权重在 麻省理工学院 许可证,并可在Hugging Face和通过Anthropic式API获取。 这种开放和功能的结合,是围绕发行的热闹现象的主要原因.

模型如何在基准中发挥作用

议会联盟专家自行进行测试,并提供具体数字。 在那个 助手 方案拟订基准,取得的成果 71.6% ——对开放型号的严肃水平. 在逻辑和推理方面,它始终处于 克劳德4.1虽然它并不总是在复杂的特殊情况下超越它。

最关键的是模型很好地处理多步任务:文档检查,函数调用,长串动作运行顺利而不失去上下文. 同时,它承担大量工作量的费用大大低于 典型的封闭对口单位。 这就是为什么DeepSeek v3.1经常在开放访问和编码中领先.

与闭合巨头的比较

要了解新人的位置,值得与GPT-5和克劳德4.1等模型进行比较. 就上下文窗口而言, DeepSeek v3.1 线索都: GPT-5 列于 272 000个令牌克劳德·4.1 200 000美元,而文章的主题只有 128 000个但在编码方面,它相当有竞争力, 在开放和价格方面,封闭型号完全失去。

参数深搜索 v3.1GPT-5级克劳德4.1
参数685B(37B 活动,教育部)关闭关闭
背景情况128 000个纪念品272 000个令牌20万个
编码基准71.6%的助手. . . . . . .. . . . . . .
开源是的(麻省理工学院, 拥抱面孔)
费用低级高级高级

在DeepSeek v3.1的长处中,在与大量数据量合作时可节省大量费用。 这对于不准备支付关闭服务费的团队尤为重要。

如何使用和适合谁

开发者和研究人员可以直接从Hugging Face下载模型. 文件占用关于 700GB (英语).,所以需要强大的硬件——这也许是主要的障碍. 如果资源不足或需要迅速将模型与产品连接起来,使用API更方便.

对于小企业来说,内部经营如此庞大的网络往往代价太高。 在这种情况下,Anthropic式的API访问可以提供所有的好处,而不需要建造自己的基础设施.

目 录

DeepSeek v3.1是一个罕见的开放模型的例子,它与封闭的竞争者在编码和逻辑上相匹配,同时在成本上超过他们. 它已经在主导关于Reddit和Hugging Face趋势的讨论。 用户注意到可靠的推理、很长的背景和明显的节省。 主要挑战在于运行它需要严肃的硬件,但对于许多人来说,这是控制和独立性的公平代价.

常问问题

DeepSeek v3.1: 包含128K上下文和编码的AI模型审查