Китайский разработчик Deepseek представил экспериментальную мультимодальную модель V4-Flash-Vision-Exp, которая дополняет текстовые возможности системы функциями компьютерного зрения. Как сообщает The Decoder, в собственных тестах компании новинка вплотную приблизилась к показателям Opus 4.8 при выполнении задач, требующих автономной работы ИИ-агентов.
Разработчики отмечают, что архитектура модели позволяет сохранять высокую производительность базовой версии в области логических рассуждений и общих знаний, одновременно внедряя обработку визуальных данных. В сценариях использования мультимодальных агентов, где ИИ должен взаимодействовать с интерфейсами или анализировать окружение, V4-Flash-Vision-Exp демонстрирует результаты, сопоставимые с гораздо более тяжеловесными решениями.
Инструментарий для визуальных рабочих процессов
Deepseek ориентирует новую модель прежде всего на создание сложных агентных систем. Модель способна не просто описывать изображения, но и эффективно извлекать текст из скриншотов, а также проводить глубокий анализ диаграмм и графиков. Согласно технической документации API, система поддерживает форматы JPEG, PNG, GIF и WebP, определяя тип файла по его содержимому, а не по расширению или MIME-типу, что выглядит как приятная забота о стабильности пайплайнов.
Для интеграции в существующую инфраструктуру предусмотрена поддержка эндпоинтов OpenAI Chat Completions и Anthropic Messages. Кроме того, компания обновила свой фреймворк Harness до версии 0.1.1, обеспечив нативную поддержку новой модели «из коробки». Это упрощает переход для тех, кто уже использует экосистему Deepseek для автоматизации бизнес-процессов.
Гонка за эффективностью токенов в обработке изображений превращается в тонкую игру: Deepseek предлагает фиксированную стоимость в 384 токена за любой кадр, что удобно для планирования бюджета, но технически ограничивает детализацию. Способность модели конкурировать с Opus на агентных бенчмарках впечатляет, однако реальный успех будет зависеть от того, насколько стабильно «зрение» работает в нестандартных граничных условиях, где синтетические тесты часто пасуют перед хаосом реальных данных. Китайский ИИ снова демпингует рынок, заставляя гигантов нервничать из-за своей маржинальности.
Экономика токенов и технические лимиты
Работа с изображениями организована тремя способами: прямая передача через Base64-кодирование, использование публичных ссылок или загрузка через новый бесплатный Files API. Последний вариант позволяет загрузить файл размером до 64 МиБ один раз и обращаться к нему по идентификатору в последующих запросах, что заметно экономит трафик при итеративной работе.
Deepseek внедрила механизмы оптимизации затрат, которые заслуживают внимания:
- Параметр detail позволяет принудительно уменьшать разрешение до 512 x 512 пикселей для экономии ресурсов, если высокая четкость не требуется.
- Автоматическая нормализация приводит изображения к размеру примерно 800 x 800 пикселей с сохранением соотношения сторон.
- Один запрос может содержать до 600 изображений, что открывает двери для анализа видеопоследовательностей или объемных документов.
При большом количестве файлов в одном запросе (от 15 и выше) максимальная длина стороны изображения ограничивается 4 096 пикселями вместо стандартных 8 192. Стоит учитывать, что на данный момент изображения могут передаваться только в сообщениях пользователя, что является стандартным, но все же ограничением для некоторых архитектурных решений.
Оставить комментарий