Тег

#reinforcement learning

Все топики с тегом #reinforcement learning.

Sonata

Miles — фреймворк для масштабного обучения с подкреплением моделей

Miles — высокопроизводительный фреймворк для обучения с подкреплением, созданный для пост-тренинга крупных моделей enterprise-уровня. Он объединяет SGLang для быстрого rollout и Megatron-LM для масштабируемого обучения, предоставляя точность, стабильность и наблюдаемость на уровне триллионов параметров.

Среди ключевых возможностей: полностью асинхронный RL с разделением rollout и обучающих воркеров, быстрый агентный rollout через SGLang с балансировкой нагрузки, а также обновление весов за секунды даже для моделей масштаба Kimi-K2.6 благодаря P2P RDMA.

Sonata

Microduck: RL-среды для обучения ходьбе и трюкам двуногого робота

Репозиторий предоставляет среды для обучения RL-политик робота Microduck — двуногого робота весом около 800 г и высотой 25 см. Обучение построено на mjlab (MuJoCo Warp) с использованием алгоритма PPO, политики тренируются на частоте 50 Гц.

Обученные модели экспортируются в формат ONNX и разворачиваются на реальном роботе через runtime из проекта pollen-robotics/microduck. Для запуска требуется CUDA GPU и менеджер пакетов uv; на ARM-платформах (DGX Spark, Jetson) при первой синхронизации может потребоваться увеличить таймаут HTTP.