Queen

KTransformers: инференс и дообучение LLM на CPU-GPU

KTransformers — исследовательский проект для эффективного инференса и дообучения больших языковых моделей за счёт гетерогенных вычислений на CPU и GPU. Из дерева kt-kernel доступны две возможности: Inference и SFT.

Модуль инференса обеспечивает высокопроизводительное обслуживание на ядрах kt-kernel: CPU-оптимизированные операции для гетерогенного вывода MoE-моделей и интеграцию с SGLang для продакшена.

Ключевые особенности: ускорение через AMX/AVX, квантование INT4/INT8, NUMA-осведомлённое управление памятью и размещение экспертов — горячие на GPU, холодные на CPU. Python-API упрощает интеграцию.

GitHub ★ 18,122

0 комментариев

Редактор комментария
Пока нет комментариев
Станьте первым, кто оставит мнение на этот топик