Дом
CVPR 2026 сигнализирует о смене парадигмы в области визуального интеллекта на фоне исчезновения эффекта предельных выгод
За последнее десятилетие компьютерное зрение прошло путь от классификации на ImageNet до диффузионных моделей, направленных на то, чтобы машины могли «видеть мир». Однако по мере того, как способности восприятия приближаются к человеческому уровню, эффективность чистого повышения точности снижается. На конференции CVPR 2026 направление исследований в области визуального интеллекта изменилось: зрение больше не является конечной целью, а служит мостом для рассуждений, принятия решений и взаимодействия.
Выход за пределы «слепого рассуждения»: адаптивные и имплицитные подходы
Мультимодальные модели долгое время полагались на «цепочку мыслей» (CoT) для логического рассуждения. Однако недавние исследования показывают, что такое постоянное рассуждение зачастую неэффективно. Фреймворк VideoAuto-R1 вводит «вывод по запросу»: он напрямую отвечает на простые перцептивные запросы и запускает процесс вывода только в случае сложной логики. Этот метод позволяет сохранить максимальную производительность, сократив при этом среднюю длину вывода в 3,3 раза.

Средство рассуждений также эволюционирует. Ранее модели полагались на язык для описания пространственных отношений, что не работало в случае головоломок или геометрических структур. Новая тенденция заключается в неявных визуальных рассуждениях в «латентном пространстве», обходя линейное преобразование текста, чтобы лучше улавливать сложные визуальные структуры.
Переосмысление оценки: развенчание иллюзии тестов с множественным выбором
Текущие оценки моделей «визуальный язык» в значительной степени опираются на вопросы с несколькими вариантами ответов (MCQA), что может приводить к завышению оценки их возможностей. Исследования показывают, что модели часто «обманывают», используя метод исключения или предвзятость к определенным вариантам ответов, завышая результаты примерно на 20 баллов. Чтобы исправить это, отрасль переходит к «проверяемым открытым вопросам и ответам», что заставляет модели по-настоящему понимать визуальный контент, а не использовать подсказки, содержащиеся в вариантах ответов.
Между тем сценарии оценки смещаются от статических изображений с одним агентом к многоагентным средам. Тестовые наборы, такие как VS-Bench, требуют от моделей не только понимания окружающей среды, но и демонстрации стратегического мышления и принятия решений в сложных взаимодействиях, таких как сотрудничество и конкуренция. Это знаменует переход визуального интеллекта от пассивного «понимающего» к активному «принимающему решения».

Модернизация инфраструктуры: модели с открытым исходным кодом и реальные данные
Сообщество открытого исходного кода повышает прозрачность. Такие модели, как Molmo2, публикуют не только веса, но и полные наборы данных, а также процессы обучения. Эти модели расширяют возможности от отдельных изображений до видео, добавляя функции точной локализации и совершая скачок от «понимания» к «указанию местоположений».
Этот прогресс подкрепляется комплексной инфраструктурой данных. Для редактирования изображений на основе текста крупномасштабные наборы данных из реального мира, такие как Pico-Banana-400K, устраняют пробел, вызванный чрезмерной зависимостью от синтетических данных. Поддерживая многоэтапное редактирование и согласование предпочтений, этот набор данных обеспечивает прочную основу для обучения моделей редактирования с улучшенным здравым смыслом и логикой.
Подводя итог, можно сказать, что визуальный интеллект эволюционирует от простого восприятия к интегрированному интеллекту, сочетающему восприятие, познание и действие. Этот сдвиг представляет собой не просто незначительное повышение производительности; это систематическая реконструкция механизмов рассуждений, парадигм оценки и цепочек поставки данных.
Связанная статья
Meta удаляет функцию редактирования фотографий с помощью ИИ после негативной реакции пользователей
Meta, гигант социальных сетей, вновь оказалась в центре публичной дискуссии о хрупком балансе между искусственным интеллектом и конфиденциальностью пользователей. Согласно TechCrunch, подразделение Meta Superintelligence Labs представило новый генера
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Рекомендации по связанным специальным темам
Комментарии (0)
За последнее десятилетие компьютерное зрение прошло путь от классификации на ImageNet до диффузионных моделей, направленных на то, чтобы машины могли «видеть мир». Однако по мере того, как способности восприятия приближаются к человеческому уровню, эффективность чистого повышения точности снижается. На конференции CVPR 2026 направление исследований в области визуального интеллекта изменилось: зрение больше не является конечной целью, а служит мостом для рассуждений, принятия решений и взаимодействия.
Выход за пределы «слепого рассуждения»: адаптивные и имплицитные подходы
Мультимодальные модели долгое время полагались на «цепочку мыслей» (CoT) для логического рассуждения. Однако недавние исследования показывают, что такое постоянное рассуждение зачастую неэффективно. Фреймворк VideoAuto-R1 вводит «вывод по запросу»: он напрямую отвечает на простые перцептивные запросы и запускает процесс вывода только в случае сложной логики. Этот метод позволяет сохранить максимальную производительность, сократив при этом среднюю длину вывода в 3,3 раза.

Средство рассуждений также эволюционирует. Ранее модели полагались на язык для описания пространственных отношений, что не работало в случае головоломок или геометрических структур. Новая тенденция заключается в неявных визуальных рассуждениях в «латентном пространстве», обходя линейное преобразование текста, чтобы лучше улавливать сложные визуальные структуры.
Переосмысление оценки: развенчание иллюзии тестов с множественным выбором
Текущие оценки моделей «визуальный язык» в значительной степени опираются на вопросы с несколькими вариантами ответов (MCQA), что может приводить к завышению оценки их возможностей. Исследования показывают, что модели часто «обманывают», используя метод исключения или предвзятость к определенным вариантам ответов, завышая результаты примерно на 20 баллов. Чтобы исправить это, отрасль переходит к «проверяемым открытым вопросам и ответам», что заставляет модели по-настоящему понимать визуальный контент, а не использовать подсказки, содержащиеся в вариантах ответов.
Между тем сценарии оценки смещаются от статических изображений с одним агентом к многоагентным средам. Тестовые наборы, такие как VS-Bench, требуют от моделей не только понимания окружающей среды, но и демонстрации стратегического мышления и принятия решений в сложных взаимодействиях, таких как сотрудничество и конкуренция. Это знаменует переход визуального интеллекта от пассивного «понимающего» к активному «принимающему решения».

Модернизация инфраструктуры: модели с открытым исходным кодом и реальные данные
Сообщество открытого исходного кода повышает прозрачность. Такие модели, как Molmo2, публикуют не только веса, но и полные наборы данных, а также процессы обучения. Эти модели расширяют возможности от отдельных изображений до видео, добавляя функции точной локализации и совершая скачок от «понимания» к «указанию местоположений».
Этот прогресс подкрепляется комплексной инфраструктурой данных. Для редактирования изображений на основе текста крупномасштабные наборы данных из реального мира, такие как Pico-Banana-400K, устраняют пробел, вызванный чрезмерной зависимостью от синтетических данных. Поддерживая многоэтапное редактирование и согласование предпочтений, этот набор данных обеспечивает прочную основу для обучения моделей редактирования с улучшенным здравым смыслом и логикой.
Подводя итог, можно сказать, что визуальный интеллект эволюционирует от простого восприятия к интегрированному интеллекту, сочетающему восприятие, познание и действие. Этот сдвиг представляет собой не просто незначительное повышение производительности; это систематическая реконструкция механизмов рассуждений, парадигм оценки и цепочек поставки данных.
Meta удаляет функцию редактирования фотографий с помощью ИИ после негативной реакции пользователей
Meta, гигант социальных сетей, вновь оказалась в центре публичной дискуссии о хрупком балансе между искусственным интеллектом и конфиденциальностью пользователей. Согласно TechCrunch, подразделение Meta Superintelligence Labs представило новый генера
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства











