In Breve
- Cosa è Jalapeño?
- Jalapeño è un chip sviluppato da OpenAI per ottimizzare l'inferenza AI.
- Quali sono i vantaggi di Jalapeño?
- Offre un maggior numero di token per utente e una maggiore throughput per kilowatt rispetto ai chip concorrenti.
- Quando sarà disponibile Jalapeño?
- Il primo dispiegamento è previsto entro la fine del 2026, con una distribuzione più ampia nel 2027.
Durante la recente conferenza Hot Chips, OpenAI ha presentato il suo nuovo chip, Jalapeño, progettato per migliorare le prestazioni nell’inferenza AI. I risultati preliminari di benchmark, condotti su InferenceX di Semianalysis, rivelano che Jalapeño offre un numero maggiore di token per utente e una maggiore throughput per kilowatt rispetto ai processori di inferenza attualmente considerati all’avanguardia, come il sistema Nvidia Blackwell.
OpenAI ha sviluppato Jalapeño in collaborazione con Broadcom, integrando i propri modelli nel processo di progettazione. L’azienda prevede che questa piattaforma diventi multigenerazionale, in grado di coordinare chip, memoria e modelli in modo più efficiente. L’architettura di Jalapeño è stata progettata per ridurre i ritardi nelle fasi di prefill e comunicazione, che spesso rappresentano colli di bottiglia durante l’inferenza. Come dichiarato nel comunicato aziendale, “We designed Jalapeño to minimize data movement and communication delays.”
Un aspetto innovativo del chip è la capacità di allocare e mantenere localmente lo stato del modello, inclusa la KV cache utilizzata durante la generazione delle risposte. Questo approccio consente al sistema di attivare la combinazione adeguata di calcolo, memoria e rete per ogni fase di inferenza, ottimizzando così le risorse e migliorando l’efficienza complessiva.
Richard Ho, responsabile hardware di OpenAI, ha commentato i risultati ottenuti: “The bottom line is that the results show a very, very significant performance advance over state of the art. Jalapeño can serve more AI work per unit of power, while also returning responses more quickly. It’s very efficient to serve a lot of customers, but it can also be very low latency.”
OpenAI prevede un primo dispiegamento di Jalapeño in volumi molto ridotti entro la fine del 2026, con una distribuzione più significativa attesa per il 2027. Questo nuovo chip potrebbe rappresentare un passo avanti cruciale nel campo dell’intelligenza artificiale, rendendo l’inferenza più accessibile e veloce per un numero crescente di utenti.
