AMD и Cerebras создали гибридную платформу: сложные запросы обрабатываются на ускорителях AMD Instinct, а генерация токенов делегируется Cerebras WSE. Это обеспечивает пятикратный рост числа токенов на ватт.
Для инференса ИИ-моделей требуется большой объем быстрой памяти. Чипы Cerebras используют встроенную SRAM, которая на порядки быстрее HBM, достигая скорости генерации свыше 2000 токенов/с.
В отличие от Nvidia, поглотившей Groq, решение AMD и Cerebras для модели с 1 трлн параметров требует лишь несколько десятков чипов, а не тысяч. Платформа появится в Cerebras Cloud в этом году.

0 комментариев