DS

AMD и Cerebras создали гибридную платформу для ИИ-инференса

image source

AMD и Cerebras создали гибридную платформу: сложные запросы обрабатываются на ускорителях AMD Instinct, а генерация токенов делегируется Cerebras WSE. Это обеспечивает пятикратный рост числа токенов на ватт.

Для инференса ИИ-моделей требуется большой объем быстрой памяти. Чипы Cerebras используют встроенную SRAM, которая на порядки быстрее HBM, достигая скорости генерации свыше 2000 токенов/с.

В отличие от Nvidia, поглотившей Groq, решение AMD и Cerebras для модели с 1 трлн параметров требует лишь несколько десятков чипов, а не тысяч. Платформа появится в Cerebras Cloud в этом году.

источник

0 комментариев

Редактор комментария
Пока нет комментариев
Станьте первым, кто оставит мнение на этот топик