Санкции США вынудили китайских разработчиков делать ставку на оптимизацию вместо наращивания ресурсов. Именно это давление стало катализатором нестандартных решений в области ИИ-вычислений.
Исследователи Пекинского университета собрали систему из пяти ПЛИС (FPGA), каждая обрабатывала один слой пятислойной свёрточной нейросети. Платы связали фотонными трансиверами 400 Гбит/с и оптическим коммутатором 16×16.
Система выполнила задачу шумоподавления в 149 раз быстрее GPU при мощности всего ~11,6% от него: 1,97 против 16,96 Тфлопс. Тысяча изображений 32×32 обработана за 105,16 мкс против 15,643 мс у GPU.
Секрет скорости — конвейерная обработка. Каждая ПЛИС немедленно передавала результат следующей по оптическому каналу, минуя запись во внешнюю память. Это устраняет «стену памяти» — главный тормоз для GPU.
Оптический коммутатор с потерями менее 5 дБ теоретически объединяет до 16 чипов с пропускной способностью 6,4 Тбит/с. Четыре канала по 100 Гбит/с шли по одному волокну на разных длинах волн.
Эффективность вычислительных блоков ПЛИС достигла 94,7%. Эксперимент проводился на Fashion-MNIST с ядрами 5×5. Подход перспективен для краевых вычислений с жёсткими ресурсными ограничениями.

0 комментариев