Jalapeño от OpenAI: первые тесты показали, почему чип обещает обогнать NVIDIA на инференсе

10 сентября 20262 просмотров

На конференции Hot Chips OpenAI впервые раскрыла замеры производительности Jalapeño: в тестах SemiAnalysis он выдал больше токенов на пользователя и лучший результат на киловатт, чем актуальные системы уровня Nvidia Blackwell. Небольшие поставки чипа ожидаются уже в конце 2026 года, а значительное расширение — в 2027-м.

Jalapeño от OpenAI: первые тесты показали, почему чип обещает обогнать NVIDIA на инференсе

OpenAI продолжает раскрывать карты в аппаратной гонке. На конференции Hot Chips компания впервые детально показала свой чип для инференса — Jalapeño — и поделилась свежими результатами тестов, которые многих удивили. Если эти цифры подтвердятся в реальных нагрузках, расстановка сил на рынке вывода моделей может заметно измениться.

Что показали тесты

В бенчмарке SemiAnalysis InferenceX новый процессор обошёл доступные сегодня инференс-решения уровня state-of-the-art по двум важным метрикам: количеству токенов в пересчёте на одного пользователя и пропускной способности на киловатт затраченной мощности. Сравнение проводилось с системой NVIDIA Blackwell, которая сейчас считается одним из эталонов в задачах вывода нейросетей.

Глава аппаратного направления OpenAI Ричард Хо назвал результаты значительным улучшением относительно текущего уровня. Правда, он тут же добавил важную оговорку: к моменту, когда Jalapeño появится в серьёзных объёмах, конкуренты могут успеть серьёзно обновить свои платформы. Так что сегодняшний разрыв — не гарантия на будущее.

Тем не менее выбор метрик показателен. Для дата-центров, которые занимаются инференсом, главное — не пиковая производительность, а стоимость каждого токена и поведение под нагрузкой многих пользователей. Именно здесь новый чип хочет показать себя сильнее.

На чём основан выигрыш

Jalapeño — не попытка сделать ещё один универсальный GPU. Чип анонсировали в октябре прошлого года, а разрабатывали его вместе с Broadcom и с использованием собственных моделей OpenAI. Такой подход позволил инженерам увидеть реальные «узкие места» ещё на этапе проектирования.

Главные проблемы выводят на первое место не сами вычисления, а задержки на подготовительных стадиях и при обмене данными между блоками. Например, prefill — этап, когда модель обрабатывает входные данные и формирует контекст, — часто занимает заметно больше времени, чем хотелось бы. Jalapeño старается минимизировать именно такие задержки, а заодно сокращает перемещение данных между памятью и вычислительными ядрами.

В OpenAI поясняют: чип умеет явно размещать и удерживать состояние модели локально, включая KV cache. На каждом этапе инференса активируется нужная комбинация вычислений, памяти и сети, а не работает вся система сразу. Это чем-то напоминает конвейер, где каждая станция подготовлена именно под свою операцию.

Когда ждать в продаже

OpenAI не скрывает, что относится к чипу как к долгосрочной платформе: по словам Хо, компания планирует развивать Jalapeño в нескольких поколениях. Это значит, что текущая архитектура — не разовый эксперимент, а фундамент для дальнейших итераций.

До широкого применения, правда, ещё далеко. По оценкам OpenAI, в самом конце 2026 года чип появится в очень небольших объёмах — скорее как пилотная поставка. Более заметное развёртывание ожидается в 2027 году.

К этому моменту NVIDIA, скорее всего, тоже не будет сидеть сложа руки и может выпустить обновлённые версии Blackwell. Поэтому первое место в бенчмарках сегодня — лишь аванс. Гораздо интереснее посмотреть, сможет ли Jalapeño сохранить преимущество, когда речь пойдёт о массовой эксплуатации.

Часто задаваемые вопросы

Похожие материалы

Все материалы