Sonata

Французский стартап Kog обещает ускорить инференс LLM на обычных GPU в 30 раз

image source

Гонка за скорость AI-инференса набирает обороты. В мае Cerebras с её специализированными чипами успешно провела IPO. Но французский стартап Kog уверен, что обычные GPU способны на гораздо большее.

В мае компания попала на главную страницу Hacker News благодаря технологической демонстрации, доказывающей, что «сверхбыстрая обработка одиночных запросов возможна на стандартных серверных GPU» — таких как AMD MI300X и NVIDIA H200.

Некоторые пользователи расстроились, узнав, что технология не работает на GPU в ноутбуках, но многие увидели потенциал. По словам CEO Гаэля Делало, стартап получил около 200 конкретных бизнес-обращений.

Первым применением может стать разработка программного обеспечения. Пользователи Claude Code знают, что иногда приходится ждать результата часами. Anthropic даже берёт дополнительную плату за режим Fast Mode из-за ценности скорости.

Kog нацелен на клиентов, которых не устраивают задержки в профессиональных задачах. Среди партнёров — сервисы генерации игр и приложений по промпту, для которых ускорение через Kog Inference Engine (KIE) напрямую влияет на доход.

В компании признают, что рынок ещё не созрел. Клиенты не готовы дообучать маленькие модели, поэтому с момента запуска Kog сосредоточился на ускорении именно крупных моделей.

Это ставит перед стартапом амбициозную цель — достичь обещанного 30-кратного ускорения инференса LLM. Демо показало впечатляющие 3000 токенов в секунду, но на компактной модели Laneformer 2B с 2 миллиардами параметров, которая теперь в открытом доступе.

Вопреки скептикам, Делало уверен, что подход сработает и для больших языковых моделей. По его словам, представление о непригодности GPU для декодирования — заблуждение: новые чипы обладают всё большей пропускной способностью памяти, которую нужно просто раскрыть.

Kog не единственный, кто верит в потенциал программной оптимизации GPU. Французский ZML выпустил аппаратно-независимое ПО в обход CUDA Nvidia. Но, по словам Делало, Kog ближе по духу к лаборатории Hazy Research Стэнфорда — с более глубоким фокусом на ускорение именно GPU.

Сам Делало не исследователь — его первый стартап Stribe не связан с Kog, разве что через бывшего сооснователя, ставшего венчурным инвестором. Фонд Varsity VC этого инвестора стал одним из ведущих в seed-раунде Kog.

Делало изучал физику твёрдого тела в Политехнической школе Франции, затем занимался наступательной кибербезопасностью — этичным хакингом. Именно этот опыт сформировал подход, который он прививает команде.

По его словам, физика учит понимать законы природы и законы работы GPU, чтобы использовать их максимально эффективно. Хакинг же научил реверс-инжинирингу на уровне ассемблера и бинарного кода — искать нестандартное применение технологиям.

Минус такого подхода — трудоёмкость. На изучение каждого нового GPU команда тратит недели, а то и месяцы глубокого инженерного анализа. При команде из 11 человек это ограничивает число поддерживаемых чипов.

В перспективе Kog планирует внедрить свою методологию в конвейеры на основе AI-агентов, что позволит охватить больше чипов и моделей. Учитывая стремление Европы к технологическому суверенитету, это может дать стартапу дополнительный импульс — его уже поддерживают Scaleway, Bpifrance и программа French Tech 2030.

Пока же Kog предстоит доказать миру, что подход работает и на больших языковых моделях. Делало рассчитывает достичь 10-кратного ускорения на первой крупной модели уже в сентябре — это станет ключевым аргументом для привлечения раунда Series A.

источник

Загрузка страницы