Новейшая модель от DeepSeek AI вышла в августе 2025 года и сразу привлекла внимание сообщества. Это не просто очередной чат-бот, а по‑настоящему открытая система с огромным контекстным окном и сильным кодовым интеллектом. Разбираемся, что предлагает DeepSeek v3.1, на что способна в тестах и стоит ли её использовать в своих проектах.
Что такое DeepSeek v3.1 и почему о нём говорят
Модель построена на архитектуре Mixture-of-Experts. Общее количество параметров достигает 685 миллиардов, но на каждый токен активируется лишь около 37 миллиардов — это позволяет сохранять высокую производительность без необходимости задействовать всю сетку целиком. Такой подход уже знаком по другим большим моделям, но в DeepSeek v3.1 он сочетается с двумя режимами работы:
- Thinking Mode — углублённое рассуждение, когда модель поэтапно обдумывает сложные вопросы и задачи;
- Non-Thinking Mode — быстрые ответы в формате обычного чата, когда тратить время на длинные размышления не нужно.
Контекстное окно достигает 128 000 токенов. Этого достаточно для анализа больших документов, длинного кода или многостраничных логов. При этом веса модели открыты под лицензией MIT, а сама она доступна на Hugging Face и через API в стиле Anthropic. Такое сочетание открытости и функциональности и стало главной причиной ажиотажа вокруг релиза.

Как модель показывает себя в тестах
Специалисты AIPURE провели собственные испытания и приводят конкретные цифры. В бенчмарке по программированию Aider результат достиг 71.6% — это серьёзный уровень для открытой модели. По логике и рассуждениям она стабильно держится на уровне Claude 4.1, хотя и не всегда обгоняет её в сложных нишевых сценариях.
Что особенно важно, модель хорошо справляется с многошаговыми задачами: проверка документов, вызовы функций, длинные цепочки действий выполняются плавно и без потери контекста. При этом стоимость её использования для больших рабочих нагрузок значительно ниже, чем у типичных закрытых аналогов. Именно поэтому в открытом доступе и в кодинге DeepSeek v3.1 часто оказывается впереди.

Сравнение с закрытыми гигантами
Чтобы понять место новинки, стоит сопоставить её с такими моделями, как GPT-5 и Claude 4.1. По контекстному окну DeepSeek v3.1 уступает обоим: у GPT-5 заявлено 272 000 токенов, у Claude 4.1 — 200 000, тогда как у героя статьи только 128 000. Зато по кодингу он вполне конкурентоспособен, а по открытости и цене закрытые модели проигрывают полностью.
| Параметр | DeepSeek v3.1 | GPT-5 | Claude 4.1 |
|---|---|---|---|
| Параметры | 685B (37B активных, MoE) | закрыто | закрыто |
| Контекст | 128 000 токенов | 272 000 токенов | 200 000 токенов |
| Кодинг-бенчмарк | 71.6% Aider | — | — |
| Открытый код | да (MIT, Hugging Face) | нет | нет |
| Стоимость | низкая | высокая | высокая |
Среди сильных сторон DeepSeek v3.1 — значительная экономия средств при работе с большими объёмами данных. Для команд, которые не готовы платить за подписку на закрытые сервисы, это особенно актуально.
Как использовать и кому подойдёт
Разработчики и исследователи могут скачать модель напрямую с Hugging Face. Файл занимает около 700 ГБ, поэтому потребуется мощное аппаратное обеспечение — это, пожалуй, главный барьер. Если ресурсов не хватает или нужно быстро подключить модель к продукту, удобнее воспользоваться API.
Для малого бизнеса самостоятельный запуск такой большой сети часто оказывается слишком затратным. В этом случае API-доступ в стиле Anthropic позволяет получить все преимущества без необходимости строить собственную инфраструктуру.
Итоги
DeepSeek v3.1 — это редкий пример открытой модели, которая не уступает закрытым конкурентам в кодинге и логике, а по стоимости превосходит их. Она уже доминирует в обсуждениях на Reddit и в трендах Hugging Face. Пользователи отмечают надёжное рассуждение, длинный контекст и ощутимую экономию. Основная сложность — запуск требует серьёзного железа, но для многих это оправданная цена за контроль и независимость.



