Что OpenAI показала 25 августа
Компания OpenAI представила результаты испытаний собственного AI-процессора — Jalapeño. Это не сторонняя разработка под заказ, а первый чип, доведённый до стадии измеримых бенчмарков: проект велся вместе с Broadcom, а публичный отчёт появился 25 августа 2026 года.
Сэм Альтман прокомментировал новость в X одной фразой — «we made a chip and it is fast». Коротко, но по сути: главный акцент сделан не на гибкости или универсальности, а на чистой скорости отклика.
Ключевая деталь — целевое назначение. Чип спроектирован под инференс больших языковых моделей, то есть под обслуживание уже готовых моделей в момент, когда пользователь задаёт вопрос. Общие AI-нагрузки, обучение и эксперименты с архитектурами остаются на другой технике. Развернуть Jalapeño в собственной вычислительной инфраструктуре OpenAI планирует к концу 2026 года.

Почему упираются именно в инференс
Разница между обучением модели и её работой в проде — это разница между стройкой и эксплуатацией здания. Когда модель уже собрана, затраты и задержки уходят в другое место: как быстро данные модели попадают к вычислительным блокам, сколько раз их приходится перекладывать и сколько времени уходит на обмен между памятью и сетевыми компонентами.
Разработчики Jalapeño решали именно эту проблему — рассогласованность вычислений, памяти и сети. Идея в том, чтобы держать параметры модели и данные KV cache как можно ближе к тому месту, где идёт активная обработка. Чем меньше перемещений информации между уровнями системы, тем короче путь от запроса до первого токена и тем ровнее отклик на длинных генерациях. В компании это описывают как более плотную координацию всех трёх слоёв — вычислений, памяти и сети — вместо их независимой оптимизации.
Второй заявленный эффект — больше полезной AI-работы на каждый ватт энергии при пиковой нагрузке. Для дата-центров это не абстрактная метрика: электричество и охлаждение давно стали ограничителем масштабирования.
Как и на чём тестировали
Модели и бенчмарк
Испытания шли на трёх моделях разного масштаба: GPT OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Замеры проводили через InferenceX — публичный бенчмарк, который готовит SemiAnalysis. Сравнение шло с коммерческими AI-системами, то есть не с абстрактным эталоном, а с работающими решениями на рынке.
Что получилось в цифрах
- на пиковой пропускной способности — от 1,5 до 1,9 раза больше AI-работы на ватт;
- сквозная задержка снизилась в 1,7–3,6 раза;
- в интерактивных сценариях зафиксирован рост производительности в 2,1–4,1 раза — именно отсюда взялась формулировка «почти в четыре раза быстрее».

Где выигрыш заметнее всего
Разброс в цифрах — не погрешность, а важный сигнал. Разница между нижней и верхней границей зависит от характера нагрузки. Там, где система работает пакетами и загружена под завязку, выигрыш скромнее. Там, где запросы идут по одному и пользователь ждёт ответа в реальном времени, преимущество становится максимальным.
Отсюда и отдельный интерес к агентам. Когда AI-система выполняет задачу в несколько шагов — планирует, обращается к инструментам, получает данные, генерирует ответ — задержки складываются. Каждый лишний этап добавляет ожидание, и на длинной цепочке разница между «полторы секунды» и «полсекунды» превращается в совсем другой пользовательский опыт. Снижение задержки в интерактивных сценариях напрямую бьёт по этой проблеме.
В OpenAI ожидают, что такие показатели поддержат более быстрые продукты и улучшат экономику инфраструктуры: дешевле обслуживать тот же объём запросов.
Свои чипы — но не вместо Nvidia
Здесь важно не перепутать сигнал. Ускорители Nvidia компания не собирается выбрасывать: они остаются в контуре и для обучения, и для инференса. Jalapeño позиционируется как дополнительный вычислительный слой под конкретный класс задач, а не как немедленная замена существующему железу.
Любопытная деталь из рассказа самой компании — цикл разработки удалось сократить до девяти месяцев, и заметную роль в этом сыграли собственные модели OpenAI. То есть AI помогал проектировать чип, на котором потом будет работать AI.

Что дальше
Gen 2 уже в разработке. Это указывает на то, что речь не о разовом эксперименте, а о долгосрочной ставке на собственный кремний как часть будущей AI-инфраструктуры.
Стоит держать в голове оговорку: все приведённые числа — заявленные результаты на конкретном публичном бенчмарке, а не независимая проверка в чужих руках. Многое станет яснее, когда чип действительно развернут в инфраструктуре к концу 2026 года и появятся данные с реальных продакшн-нагрузок, а не с тестовых прогонов. Пока же главный вывод простой: гонка за скорость ответа моделей переехала с уровня софта на уровень железа.



