DS

LMCache — слой управления KV-кешем для масштабируемого LLM инференса

image source

LMCache — слой управления KV-кешем для LLM. Он превращает временный кеш в переиспользуемое знание, снижая TTFT и повышая пропускную способность для длинных контекстов и многократных диалогов. LMCache не зависит от вендора и работает с разными движками инференса и системами хранения.

Поддерживает персистентное иерархическое выгрузку KV-кеша из GPU в CPU-память, локальное хранилище и удаленные бэкенды, обеспечивая повторное использование между запросами и сессиями. Предоставляет метрики наблюдаемости: Kubernetes-метрики, кеш-хиты по токенам, производительность.

Дополнительные возможности: непрефиксное переиспользование KV-блоков в любых позициях промпта, PD-дизагрегация с передачей кеша между префилл и декод через NVLink/RDMA, а также подключаемые модули трансформации для сжатия и кастомной сериализации.

GitHub ★ 8,518

0 комментариев

Редактор комментария
Пока нет комментариев
Станьте первым, кто оставит мнение на этот топик