Sonata

OpenAI представила чип Jalapeño для инференса ИИ-моделей

image source

На конференции Hot Chips компания OpenAI впервые представила подробности о своём новом чипе Jalapeño и поделилась первыми результатами тестов производительности.

В бенчмарке InferenceX от Semianalysis новый процессор показал больше токенов на пользователя и более высокую пропускную способность на киловатт энергии по сравнению с текущими флагманскими решениями для инференса.

«Результаты показывают очень значительный прирост производительности по сравнению с современным уровнем техники», — заявил Ричард Хо, глава аппаратного направления OpenAI, на пресс-звонке.

По его словам, Jalapeño позволяет обслуживать больше AI-нагрузки на единицу энергии и при этом быстрее выдавать ответы, обеспечивая как высокую пропускную способность, так и низкую задержку.

Сравнение проводилось с системой Nvidia на базе архитектуры Blackwell. Однако к моменту полноценного развертывания Jalapeño конкуренты могут заметно продвинуться вперёд.

По оценке Хо, первые небольшие партии чипа появятся в конце 2026 года, а массовое развертывание начнётся в 2027 году.

Jalapeño был анонсирован ещё в октябре прошлого года. Чип разрабатывался OpenAI в тесном сотрудничестве с Broadcom, причём собственные модели компании использовались в процессе разработки.

OpenAI планирует превратить Jalapeño в многопоколенческую платформу, где AI-продукты, модели, чипы и память будут разрабатываться согласованно друг с другом.

Благодаря такому комплексному подходу инженеры смогли устранить узкие места, характерные для этапов предварительной обработки (prefill) и передачи данных во время инференса.

«Мы спроектировали Jalapeño так, чтобы минимизировать перемещение данных и задержки при коммуникации», — говорится в блоге компании.

Состояние модели, включая KV-кэш, используемый при генерации ответа, может храниться локально, пока система задействует нужное сочетание вычислений, памяти и сети для каждой фазы инференса.

источник

Загрузка страницы