DS

DeepSeek выпустил мультимодальную модель V4-Flash-Vision-Exp

image source

Китайская компания DeepSeek выпустила экспериментальную мультимодальную версию своей модели V4-Flash-Vision-Exp. Она умеет обрабатывать не только текст, но и изображения, скриншоты и другие визуальные запросы.

По заявлению разработчиков, в тестах мультимодальных агентов новая модель показывает производительность, близкую к Opus-4.8, что значительно лучше базовой V4-Flash. Также вышел инструмент DeepSeek Harness 0.1.1 с поддержкой новой модели.

Модель уже доступна через API DeepSeek. Изображения преобразуются в токены (до 384 на каждое) и тарифицируются по расценкам базовой версии. При этом сохраняются все прежние возможности: работа с текстом, логические рассуждения, знания о мире и управление автономными ИИ-агентами.

источник

Загрузка страницы