OpenAI memperkenalkan Jalapeño: chip inferensinya mempercepat respons model hampir empat kali lipat

19 September 202617 tampilan

Prosesor Jalapeño yang dikembangkan bersama Broadcom menjanjikan peningkatan performa per watt yang signifikan dan latensi lebih rendah saat menjalankan model bahasa besar — dalam skenario interaktif diklaim ada keunggulan hingga 4,1 kali. Penerapan di infrastruktur OpenAI dijadwalkan pada akhir tahun, sementara perusahaan menolak mencoret akselerator Nvidia dari perhitungan.

OpenAI memperkenalkan Jalapeño: chip inferensinya mempercepat respons model hampir empat kali lipat

Apa yang OpenAI tunjukkan pada 25 Agustus

OpenAI mempresentasikan hasil pengujian prosesor AI miliknya sendiri — Jalapeño. Ini bukan pengembangan pihak ketiga atas pesanan, melainkan chip pertama yang sampai ke tahap benchmark terukur: proyek ini dijalankan bersama Broadcom, dan laporan publiknya muncul pada 25 Agustus 2026.

Sam Altman mengomentari kabar ini di X dengan satu frasa — «we made a chip and it is fast». Singkat, tetapi tepat sasaran: penekanan utamanya bukan pada fleksibilitas atau keserbagunaan, melainkan pada kecepatan respons murni.

Detail kuncinya — peruntukan targetnya. Chip ini dirancang untuk inferensi model bahasa besar, yakni untuk melayani model yang sudah jadi pada saat pengguna mengajukan pertanyaan. Beban AI umum, pelatihan, dan eksperimen dengan arsitektur tetap ditangani perangkat lain. OpenAI berencana menerapkan Jalapeño di infrastruktur komputasinya sendiri pada akhir 2026.

Mengapa justru inferensi yang jadi titik berat

Perbedaan antara melatih model dan menjalankannya di produksi adalah perbedaan antara membangun dan mengoperasikan sebuah gedung. Ketika model sudah selesai dibangun, biaya dan latensi berpindah ke tempat lain: seberapa cepat data model sampai ke blok komputasi, berapa kali data harus dipindahkan, dan berapa banyak waktu yang habis untuk pertukaran antara memori dan komponen jaringan.

Pengembang Jalapeño memecahkan justru masalah ini — ketidakselarasan antara komputasi, memori, dan jaringan. Idenya adalah menjaga parameter model dan data KV cache sedekat mungkin dengan tempat pemrosesan aktif berlangsung. Semakin sedikit perpindahan informasi antar lapisan sistem, semakin pendek jalur dari permintaan hingga token pertama dan semakin stabil respons pada generasi panjang. Di perusahaan ini hal tersebut digambarkan sebagai koordinasi yang lebih rapat dari ketiga lapisan — komputasi, memori, dan jaringan — alih-alih mengoptimalkannya secara terpisah.

Efek kedua yang diklaim — lebih banyak kerja AI yang berguna untuk setiap watt energi pada beban puncak. Bagi pusat data ini bukan metrik abstrak: listrik dan pendinginan sudah lama menjadi pembatas dalam penskalaan.

Bagaimana dan dengan apa pengujian dilakukan

Model dan benchmark

Pengujian dilakukan pada tiga model dengan skala berbeda: GPT OSS 120B, DeepSeek R1 670B, dan Kimi K2.5 1T. Pengukuran dilakukan melalui InferenceX — benchmark publik yang disiapkan oleh SemiAnalysis. Perbandingan dilakukan dengan sistem AI komersial, jadi bukan dengan tolok ukur abstrak, melainkan dengan solusi yang benar-benar beroperasi di pasar.

Hasil dalam angka

  • pada throughput puncak — 1,5 hingga 1,9 kali lebih banyak kerja AI per watt;
  • latensi end-to-end turun 1,7–3,6 kali;
  • dalam skenario interaktif tercatat peningkatan performa 2,1–4,1 kali — dari sinilah muncul frasa «hampir empat kali lebih cepat».

Di mana keuntungannya paling terasa

Rentang angka yang lebar bukanlah galat, melainkan sinyal penting. Perbedaan antara batas bawah dan batas atas bergantung pada karakter beban. Di tempat sistem bekerja secara batch dan terbebani penuh, keuntungannya lebih sederhana. Di tempat permintaan datang satu per satu dan pengguna menunggu jawaban secara real-time, keunggulannya menjadi maksimal.

Dari sinilah muncul minat khusus terhadap agen. Ketika sistem AI menjalankan tugas dalam beberapa langkah — merencanakan, mengakses alat, memperoleh data, menghasilkan jawaban — latensi menjadi bertumpuk. Setiap tahap tambahan menambah waktu tunggu, dan pada rantai yang panjang perbedaan antara «satu setengah detik» dan «setengah detik» berubah menjadi pengalaman pengguna yang sama sekali berbeda. Penurunan latensi dalam skenario interaktif langsung menyasar masalah ini.

Di OpenAI diperkirakan bahwa angka-angka seperti ini akan mendukung produk yang lebih cepat dan memperbaiki ekonomi infrastruktur: lebih murah untuk melayani volume permintaan yang sama.

Chip sendiri — tetapi bukan pengganti Nvidia

Di sini penting untuk tidak salah menafsirkan sinyalnya. Akselerator Nvidia tidak akan dibuang: keduanya tetap berada dalam lingkaran, baik untuk pelatihan maupun inferensi. Jalapeño diposisikan sebagai lapisan komputasi tambahan untuk kelas tugas tertentu, bukan sebagai pengganti langsung perangkat keras yang ada.

Detail menarik dari cerita perusahaan itu sendiri — siklus pengembangannya berhasil dipangkas hingga sembilan bulan, dan peran besar dalam hal ini dimainkan oleh model OpenAI sendiri. Artinya, AI membantu merancang chip yang nantinya akan menjalankan AI.

Apa selanjutnya

Gen 2 sudah dalam pengembangan. Ini menunjukkan bahwa ini bukan eksperimen sekali jalan, melainkan taruhan jangka panjang pada silikon sendiri sebagai bagian dari infrastruktur AI masa depan.

Perlu diingat satu catatan: semua angka yang disebutkan adalah hasil yang diklaim pada benchmark publik tertentu, bukan verifikasi independen oleh pihak lain. Banyak hal akan menjadi lebih jelas ketika chip ini benar-benar diterapkan di infrastruktur pada akhir 2026 dan muncul data dari beban produksi nyata, bukan dari uji coba. Untuk saat ini, kesimpulan utamanya sederhana: perlombaan mengejar kecepatan respons model telah berpindah dari tingkat perangkat lunak ke tingkat perangkat keras.

Pertanyaan yang sering ditanyakan

OpenAI memperkenalkan Jalapeño: chip inferensinya mempercepat respons model hampir empat kali lipat