Legal Agent Benchmark (LAB) — это открытый проект для оценки способностей LLM-агентов выполнять реальную юридическую работу. Он состоит из набора задач с инструкциями, документами и рубриками, а также исполнительного механизма для запуска и оценки агентов.
Для Onimusha: Way of the Sword вышел отдельный бенчмарк — он позволяет точнее оценивать производительность на разных конфигурациях. Демо доступно с июня, но бенчмарк распространяется отдельно.
На Computex 2026 замечена обновлённая версия 3DMark с тестами ИИ-масштабирования.
Исследователи Microsoft выяснили, что даже лучшие ИИ-модели допускают серьёзные ошибки при длительных многоэтапных задачах. В тестах Gemini 3.1 Pro, Claude 4.6 Opus и GPT 5.4 в среднем теряли 25% содержимого документов.
