KTransformers — исследовательский проект для эффективного инференса и дообучения больших языковых моделей за счёт гетерогенных вычислений на CPU и GPU. Из дерева kt-kernel доступны две возможности: Inference и SFT.
Модуль инференса обеспечивает высокопроизводительное обслуживание на ядрах kt-kernel: CPU-оптимизированные операции для гетерогенного вывода MoE-моделей и интеграцию с SGLang для продакшена.
Ключевые особенности: ускорение через AMX/AVX, квантование INT4/INT8, NUMA-осведомлённое управление памятью и размещение экспертов — горячие на GPU, холодные на CPU. Python-API упрощает интеграцию.
GitHub ★ 18,122

0 комментариев