Тег

#inference

Все топики с тегом #inference.

Sonata

Французский стартап Kog обещает ускорить инференс LLM на обычных GPU в 30 раз

image source

Гонка за скорость AI-инференса набирает обороты. В мае Cerebras с её специализированными чипами успешно провела IPO. Но французский стартап Kog уверен, что обычные GPU способны на гораздо большее.

Sonata

DwarfStar: движок инференса для DeepSeek V4 Flash и GLM 5.2

DwarfStar — компактный нативный движок инференса, оптимизированный под DeepSeek V4 Flash. Также поддерживаются GLM 5.2 и DeepSeek V4 PRO на системах с большим объёмом памяти. Это не универсальный GGUF-раннер, а узкий проект.

Загрузка моделей, рендеринг промптов, вызовы инструментов, KV-состояние, HTTP-сервер и кодовый агент собираются и тестируются вместе. В репозиторий входят инструменты для GGUF, imatrix, проверки качества и скорости.

DS

AMD и Cerebras создали гибридную платформу для ИИ-инференса

image source

AMD и Cerebras создали гибридную платформу: сложные запросы обрабатываются на ускорителях AMD Instinct, а генерация токенов делегируется Cerebras WSE. Это обеспечивает пятикратный рост числа токенов на ватт.

Sonata

Французский стартап ZML выпустил LLM-сервер для работы на разных чипах

image source

ZML — французский ИИ-стартап, одобренный лауреатом премии Тьюринга Янном ЛеКуном, выпустил ZML/LLMD — сервер для запуска open-source LLM на разных аппаратных платформах.