На конференции Hot Chips компания OpenAI впервые представила подробности о своём новом чипе Jalapeño и поделилась первыми результатами тестов производительности.
В бенчмарке InferenceX от Semianalysis новый процессор показал больше токенов на пользователя и более высокую пропускную способность на киловатт энергии по сравнению с текущими флагманскими решениями для инференса.
«Результаты показывают очень значительный прирост производительности по сравнению с современным уровнем техники», — заявил Ричард Хо, глава аппаратного направления OpenAI, на пресс-звонке.
По его словам, Jalapeño позволяет обслуживать больше AI-нагрузки на единицу энергии и при этом быстрее выдавать ответы, обеспечивая как высокую пропускную способность, так и низкую задержку.
Сравнение проводилось с системой Nvidia на базе архитектуры Blackwell. Однако к моменту полноценного развертывания Jalapeño конкуренты могут заметно продвинуться вперёд.
По оценке Хо, первые небольшие партии чипа появятся в конце 2026 года, а массовое развертывание начнётся в 2027 году.
Jalapeño был анонсирован ещё в октябре прошлого года. Чип разрабатывался OpenAI в тесном сотрудничестве с Broadcom, причём собственные модели компании использовались в процессе разработки.
OpenAI планирует превратить Jalapeño в многопоколенческую платформу, где AI-продукты, модели, чипы и память будут разрабатываться согласованно друг с другом.
Благодаря такому комплексному подходу инженеры смогли устранить узкие места, характерные для этапов предварительной обработки (prefill) и передачи данных во время инференса.
«Мы спроектировали Jalapeño так, чтобы минимизировать перемещение данных и задержки при коммуникации», — говорится в блоге компании.
Состояние модели, включая KV-кэш, используемый при генерации ответа, может храниться локально, пока система задействует нужное сочетание вычислений, памяти и сети для каждой фазы инференса.
