Sonata

TRELLIS.2: генерация 3D-объектов из изображения на структуре O-Voxel

image source

TRELLIS.2 — крупная генеративная 3D-модель на 4 миллиарда параметров, создающая объёмные объекты по одному изображению. В основе лежит разрежённая воксельная структура O-Voxel, работающая без изоповерхностных полей.

Модель опирается на обычные DiT и Sparse 3D VAE с 16-кратным пространственным сжатием, что даёт компактное латентное пространство. Скорость генерации: около 3 секунд для 512³, ~17 секунд для 1024³ и ~60 секунд для 1536³.

O-Voxel корректно описывает сложную топологию: открытые поверхности (одежда, листва), неманифолдную геометрию и внутренние замкнутые полости — без потерь при конвертации. Поддерживаются PBR-атрибуты: базовый цвет, шероховатость, металличность и прозрачность.

Обработка данных обходится без рендеринга и оптимизации: перевод текстурированного меша в O-Voxel занимает менее 10 секунд на одном CPU, обратное преобразование — менее 100 мс на CUDA.

Требования: Linux, видеокарта NVIDIA с памятью от 24 ГБ (проверено на A100 и H100), CUDA Toolkit 12.4, Python 3.8 и выше, conda для управления зависимостями.

Опубликованы статья, код инференса image-to-3D, обучающий код, генерация текстур по заданной форме, а также демо на Hugging Face Spaces. Веса TRELLIS.2-4B доступны на Hugging Face, разрешение — от 512³ до 1536³.

GitHub ★ 9,773

Загрузка страницы