Дом
DeepSeek представляет первую мультимодальную модель с открытым исходным кодом, разработанную для ИИ-агентов
Компания DeepSeek выпустила модель DeepSeek-V4-Flash-Vision-Exp на платформе Hugging Face, что стало дебютом первой экспериментальной мультимодальной модели серии V4, распространяемой по лицензии MIT. Эта модель, имеющая 305 миллиардов параметров и построенная на основе V4-Flash-0731, интегрирует визуальный кодер и Aligner в свою основную языковую архитектуру, что обеспечивает надежное понимание изображений благодаря непрерывному обучению.

Ориентация на мультимодальных агентов, а не только на описание изображений
В отличие от традиционных мультимодальных моделей, ориентированных на ответы на визуальные вопросы, DeepSeek переосмыслила цель версии Vision, уделив приоритетное внимание возможностям мультимодальных агентов. В официальной документации подчеркивается, что агенты могут напрямую интерпретировать визуальные входные данные — такие как скриншоты веб-страниц, интерфейсы программного обеспечения и диаграммы — и выполнять задачи путем запуска инструментов. По сути, этот «глаз» предназначен для машинных агентов, а не для человеческих пользователей.
Пакет с открытым исходным кодом является всеобъемлющим и включает веса модели, токенизатор, эталонные реализации кодирования подсказок и минимальную конфигурацию для инференса на PyTorch. Он охватывает основные модули, включая визуальный кодер, Aligner, DFlash Attention, MoE и Hyper-Connections. Сообщество быстро отреагировало: на Hugging Face уже доступно семь квантованных версий для llama.cpp, LM Studio и Ollama.
Примечательные детали хронологии свидетельствуют о стратегическом подходе к запуску: модель впервые появилась в API DeepSeek 21 августа, доступная только через API без предоставления весовых матриц. Разработчики могли одновременно вводить текст и изображения, при этом обработка изображений оплачивалась по токенам. Десять дней спустя веса были официально опубликованы, что позволило осуществлять локальное развертывание и дальнейшую разработку. Эта стратегия «сначала API, затем открытый исходный код» подчеркивает основное позиционирование DeepSeek как поставщика API-сервисов.

Производительность, близкая к Claude Opus 4.8, с подтверждёнными официальными заявками
Результаты тестирования показывают, что добавление визуальных возможностей не приводит к значительному снижению производительности агента, работающего исключительно с текстом: результаты по Terminal Bench 2.1 выросли с 82,7 до 83,9, а по DeepSWE — с 54,4 до 59,3, превзойдя показатель Opus 4.8 (58,0). Улучшения мультимодальных агентов более заметны: показатель ApexBench Pass@1 достиг 36,5, показатель Agents' Last Exam составил 27,3 (превысив 25,7 у Opus 4.8), а показатель ZeroBench Pass@5 достиг 35,0, превзойдя 34,0 у конкурента.
Тем не менее, DeepSeek воздерживается от заявлений о «всестороннем превосходстве»: в проекте NL2Repo он набрал 57,7 балла, уступив результату Opus 4.8 (69,7). Официальное заявление остаётся сдержанным: в нём лишь отмечается, что «возможности мультимодальных агентов близки к возможностям Claude Opus 4.8». Последние обновления показывают, что DeepSeek формирует полный технологический стек агентов: модель обрабатывает логические выводы и вызовы инструментов, Harness управляет непрерывным выполнением задач, а Vision позволяет агентам напрямую интерпретировать визуальную информацию с экрана компьютера. Этот релиз с открытым исходным кодом является важным шагом на пути к завершению формирования этой экосистемы.
Связанная статья
Органы здравоохранения США проводят оценку моделей искусственного интеллекта компаний OpenAI и Anthropic
Органы общественного здравоохранения по всей стране приступят к оценке генеративного ИИ в рамках новой инициативы, возглавляемой Коалицией по ИИ в здравоохранении (Coalition for Health AI) в партнерст
Функция «Touch and Pay» от Alipay превратит 30 миллионов офлайн-точек взаимодействия в бизнес-сеть, управляемую искусственным интеллектом
После запуска полнофункциональной платежной системы на базе искусственного интеллекта и помощника Alipay «Абао», работающего на ИИ, 8 июля компания Alipay объявила о том, что её решение «Touch and Pay
Tealium: Почему качество RAG зависит от данных в режиме реального времени
Фредди Берланти, главный менеджер по продуктам в области прикладного ИИ в компании Tealium, рассказывает о технологии генерации с использованием данных из внешних источников (RAG). Изображение: Getty
Рекомендации по связанным специальным темам
Комментарии (0)
Компания DeepSeek выпустила модель DeepSeek-V4-Flash-Vision-Exp на платформе Hugging Face, что стало дебютом первой экспериментальной мультимодальной модели серии V4, распространяемой по лицензии MIT. Эта модель, имеющая 305 миллиардов параметров и построенная на основе V4-Flash-0731, интегрирует визуальный кодер и Aligner в свою основную языковую архитектуру, что обеспечивает надежное понимание изображений благодаря непрерывному обучению.

Ориентация на мультимодальных агентов, а не только на описание изображений
В отличие от традиционных мультимодальных моделей, ориентированных на ответы на визуальные вопросы, DeepSeek переосмыслила цель версии Vision, уделив приоритетное внимание возможностям мультимодальных агентов. В официальной документации подчеркивается, что агенты могут напрямую интерпретировать визуальные входные данные — такие как скриншоты веб-страниц, интерфейсы программного обеспечения и диаграммы — и выполнять задачи путем запуска инструментов. По сути, этот «глаз» предназначен для машинных агентов, а не для человеческих пользователей.
Пакет с открытым исходным кодом является всеобъемлющим и включает веса модели, токенизатор, эталонные реализации кодирования подсказок и минимальную конфигурацию для инференса на PyTorch. Он охватывает основные модули, включая визуальный кодер, Aligner, DFlash Attention, MoE и Hyper-Connections. Сообщество быстро отреагировало: на Hugging Face уже доступно семь квантованных версий для llama.cpp, LM Studio и Ollama.
Примечательные детали хронологии свидетельствуют о стратегическом подходе к запуску: модель впервые появилась в API DeepSeek 21 августа, доступная только через API без предоставления весовых матриц. Разработчики могли одновременно вводить текст и изображения, при этом обработка изображений оплачивалась по токенам. Десять дней спустя веса были официально опубликованы, что позволило осуществлять локальное развертывание и дальнейшую разработку. Эта стратегия «сначала API, затем открытый исходный код» подчеркивает основное позиционирование DeepSeek как поставщика API-сервисов.

Производительность, близкая к Claude Opus 4.8, с подтверждёнными официальными заявками
Результаты тестирования показывают, что добавление визуальных возможностей не приводит к значительному снижению производительности агента, работающего исключительно с текстом: результаты по Terminal Bench 2.1 выросли с 82,7 до 83,9, а по DeepSWE — с 54,4 до 59,3, превзойдя показатель Opus 4.8 (58,0). Улучшения мультимодальных агентов более заметны: показатель ApexBench Pass@1 достиг 36,5, показатель Agents' Last Exam составил 27,3 (превысив 25,7 у Opus 4.8), а показатель ZeroBench Pass@5 достиг 35,0, превзойдя 34,0 у конкурента.
Тем не менее, DeepSeek воздерживается от заявлений о «всестороннем превосходстве»: в проекте NL2Repo он набрал 57,7 балла, уступив результату Opus 4.8 (69,7). Официальное заявление остаётся сдержанным: в нём лишь отмечается, что «возможности мультимодальных агентов близки к возможностям Claude Opus 4.8». Последние обновления показывают, что DeepSeek формирует полный технологический стек агентов: модель обрабатывает логические выводы и вызовы инструментов, Harness управляет непрерывным выполнением задач, а Vision позволяет агентам напрямую интерпретировать визуальную информацию с экрана компьютера. Этот релиз с открытым исходным кодом является важным шагом на пути к завершению формирования этой экосистемы.
Органы здравоохранения США проводят оценку моделей искусственного интеллекта компаний OpenAI и Anthropic
Органы общественного здравоохранения по всей стране приступят к оценке генеративного ИИ в рамках новой инициативы, возглавляемой Коалицией по ИИ в здравоохранении (Coalition for Health AI) в партнерст
Функция «Touch and Pay» от Alipay превратит 30 миллионов офлайн-точек взаимодействия в бизнес-сеть, управляемую искусственным интеллектом
После запуска полнофункциональной платежной системы на базе искусственного интеллекта и помощника Alipay «Абао», работающего на ИИ, 8 июля компания Alipay объявила о том, что её решение «Touch and Pay
Tealium: Почему качество RAG зависит от данных в режиме реального времени
Фредди Берланти, главный менеджер по продуктам в области прикладного ИИ в компании Tealium, рассказывает о технологии генерации с использованием данных из внешних источников (RAG). Изображение: Getty











