Marin — это исследовательская программа, программная платформа и сообщество, занимающиеся разработкой и развитием базовых языковых моделей (foundation models).
Проект охватывает весь цикл создания больших языковых моделей: сбор и обработку данных, токенизацию, предобучение, дообучение и оценку результатов. Ключевая ценность Marin — принцип открытой разработки: все эксперименты, решения и даже неудачные попытки фиксируются и публикуются в открытом доступе.
Помимо текстовых LLM, Marin применяется для создания аудио-текстовых моделей, а также моделей для работы с ДНК и белками через библиотеку marin/experiments. Сейчас команда сосредоточена на предобучении крупной MoE-модели с 500+ млрд параметров.
Delphi — открытый scaling suite от Marin, охватывающий диапазон вычислений от 3e18 до 1e23 FLOPs, вдохновлённый проектом Pythia.
Delphi включает рецепт масштабирования, обучающий сьют на Google TPU Research Cloud и закон масштабирования для предсказания поведения крупных моделей на основе малых. Чекпоинты доступны на Hugging Face (marin-community/delphi), а пайплайны воспроизводимого обучения — в репозитории Marin.
Ранее с помощью Marin была обучена модель на 8 млрд параметров, превзошедшая Llama 3.1 8B на внутреннем бенчмарке. Также была обучена модель Marin 32B. Документация доступна на ReadTheDocs, а сообщество общается в Discord.
Основные участники проекта — команды Stanford CRFM и Open Athena, при поддержке партнёров, предоставляющих TPU и GPU-кластеры для обучения моделей.
GitHub ★ 1,898
