OpenAI presenta Jalapeño: il chip per l’inferenza che promette prestazioni superiori

Alla conferenza Hot Chips, OpenAI ha svelato Jalapeño, un chip progettato per ottimizzare le prestazioni di inferenza. I primi benchmark mostrano risultati promettenti rispetto ai concorrenti.

Chip Jalapeño di OpenAI

In Breve

Cosa è Jalapeño?
Jalapeño è un chip progettato da OpenAI per ottimizzare le prestazioni di inferenza.
Quali sono i vantaggi di Jalapeño?
Offre un maggior numero di token per utente e una maggiore throughput per kilowatt rispetto ai concorrenti.
Quando sarà disponibile Jalapeño?
Il primo dispiegamento è previsto entro la fine del 2026, con una distribuzione più ampia nel 2027.

Durante la conferenza Hot Chips, OpenAI ha presentato Jalapeño, il suo nuovo chip progettato per ottimizzare le prestazioni di inferenza. I risultati preliminari dei benchmark condotti su InferenceX di Semianalysis mostrano che Jalapeño offre un numero maggiore di token per utente e una maggiore throughput per kilowatt rispetto ai processori di inferenza attualmente considerati all’avanguardia.

Il confronto è stato effettuato con un sistema Nvidia Blackwell, ma OpenAI avverte che la concorrenza potrebbe evolvere prima della piena distribuzione del prodotto. Jalapeño è stato sviluppato in stretta collaborazione con Broadcom, integrando i modelli di OpenAI nel processo di progettazione, con l’obiettivo di creare una piattaforma multigenerazionale in grado di coordinare chip, memoria e modelli.

L’architettura di Jalapeño è stata progettata per ridurre i ritardi nelle fasi di prefill e comunicazione, che spesso rappresentano colli di bottiglia durante il processo di inferenza. Come dichiarato nel comunicato aziendale, “We designed Jalapeño to minimize data movement and communication delays.” Questo significa che lo stato del modello, inclusa la KV cache utilizzata durante la generazione delle risposte, può essere allocato e mantenuto localmente, mentre il sistema attiva la combinazione ottimale di calcolo, memoria e rete per ciascuna fase di inferenza.

Richard Ho, responsabile hardware di OpenAI, ha commentato i risultati, affermando: “The bottom line is that the results show a very, very significant performance advance over state of the art. Jalapeño can serve more AI work per unit of power, while also returning responses more quickly. It’s very efficient to serve a lot of customers, but it can also be very low latency.”

OpenAI prevede un primo dispiegamento di Jalapeño in volumi molto ridotti entro la fine del 2026, con una distribuzione più significativa attesa per il 2027. Questo nuovo chip potrebbe rappresentare un passo importante nell’evoluzione della tecnologia di inferenza, promettendo di migliorare l’efficienza e la velocità dei servizi basati sull’intelligenza artificiale.