Ядро Olympus на базе ARMv9.2 спроектировано для ускорения нерегулярных, ресурсоёмких ИИ-агентных нагрузок. Расширенные механизмы переименования и аллокации, большой буфер переупорядочивания и обширный набор физических регистров увеличивают глубину внеочередного исполнения и выявляют скрытый параллелизм.
NVIDIA разработала Olympus в рамках платформы Vera Rubin, охватывающей CPU, GPU, сети, хранилища и ПО. Ядро ориентировано на задачи с множеством ветвлений и высокими требованиями к задержкам, где традиционные серверные x86-процессоры полагаются на высокие тактовые частоты.
Технология SMT позволяет разделять ядро на два аппаратных потока. В однопоточном режиме достигается максимальная производительность на поток, а в двухпоточном — более высокая плотность изоляции. Это улучшает утилизацию ресурсов и предсказуемость задержек.
Подсистема кеша включает L1i 64 КБ, L1d 96 КБ и L2 2 МБ на ядро, а также общий L3 164 МБ. Глубокая иерархия и аппаратные предвыборки для графоподобных структур снижают задержки памяти и повышают параллелизм.
Когерентный интерконнект SCF обеспечивает 3,4 ТБ/с бисекционной пропускной способности. Память SOCAMM2 LPDDR5X-9600 имеет 8 каналов и до 1,5 ТБ, суммарная ПСП — 1,2 ТБ/с. NVLink-C2C и PCIe/CXL подключаются через мосты BSN.
По сравнению со 128-ядерным AMD EPYC 9755 (Zen 5), Olympus показывает в 1,9 раза более высокий IPC в однопоточном режиме на агентных нагрузках. Предсказание ветвлений эффективнее в 2,3 раза, выборка инструкций — в 2,4 раза.
Исполнительные блоки включают восемь простых ALU, пару сложных ALU, пару для CRC и сдвигов, шесть 128-бит SVE2-блоков с FP8, а также блоки load/store. Отсутствуют выделенные каналы генерации адресов, блоки ветвления расположены попарно.
Декодер шириной 10 инструкций, очередь на 48 инструкций и выборка до 16 инструкций за такт. Нейронный предсказатель ветвлений оценивает две ветки за такт. Переименование памяти позволяет выполнять зависимые store-to-load до завершения load.
Процессор Vera поддерживает 88 линий PCIe 6.4 с CXL 3.1, в 2S-конфигурации — 176 линий. Arm CCA и TDISP обеспечивают изолированные ВМ с индивидуальными ключами шифрования. Расширены функции RAS.
Вместо традиционной SMT NVIDIA использует пространственную многопоточность, чтобы избежать конкуренции потоков за предсказатель, декодер и исполнительные блоки. Это даёт более предсказуемое поведение для импульсных агентных задач.
Размеры буфера переупорядочивания и регистровых файлов не раскрываются, но известно о переименовании до 10 микроопераций за цикл. Такой подход сохраняет высокий IPC при длинных цепочках указателей и нерегулярных ветвлениях.
