вариант
Дом
Новости
Самообучающиеся агенты ИИ для преобразования веб-опыта: Руководство по подготовке

Самообучающиеся агенты ИИ для преобразования веб-опыта: Руководство по подготовке

19 ноября 2025 г.
153

Самообучающиеся агенты ИИ для преобразования веб-опыта: Руководство по подготовке

В своей новой работе известные исследователи искусственного интеллекта Дэвид Сильвер и Ричард Саттон утверждают, что искусственный интеллект вступает в преобразующую "Эру опыта". Они полагают, что системы ИИ будут все больше выходить за рамки зависимости от данных, предоставляемых человеком, а вместо этого будут развиваться за счет прямого взаимодействия с миром и сбора данных из него.

Хотя статья является концептуальной и перспективной, ее выводы имеют непосредственное отношение к предприятиям, планирующим разработку и интеграцию будущих агентов и систем ИИ.

И Сильвер, и Саттон - авторитетные ученые с историей точных прогнозов относительно траектории развития ИИ. Их прозорливость видна в самых передовых современных системах ИИ. В своем влиятельном эссе "Горький урок", опубликованном в 2019 году, пионер технологии обучения с подкреплением Саттон утверждал, что наиболее значительные долгосрочные прорывы в области ИИ неизменно связаны с масштабированием поиска и обучения общего назначения с помощью массивных вычислений, а не с внедрением сложных человеческих знаний.

Дэвид Сильвер, главный научный сотрудник DeepMind, сыграл ведущую роль в разработке AlphaGo, AlphaZero и AlphaStar - основных вех в глубоком обучении с подкреплением. Он также стал соавтором работы 2021 года, в которой утверждалось, что обучение с подкреплением в сочетании с хорошо продуманным сигналом вознаграждения может в конечном итоге привести к созданию высокоразвитого ИИ.

Самые сложные современные большие языковые модели (БЯМ) служат примером этих двух концепций. Волна мощных LLM со времен GPT-3 в основном опиралась на масштабирование вычислительной мощности и данных для поглощения огромных знаний. Более поздние модели рассуждений, такие как DeepSeek-R1, демонстрируют, что обучение с подкреплением и простым сигналом вознаграждения достаточно для приобретения сложных способностей рассуждения.

Что такое "Эра опыта"?

Эра опыта" основывается на концепциях, которые отстаивали Саттон и Сильвер, но теперь они контекстуализированы с учетом последних достижений в области ИИ. Авторы отмечают, что "темпы прогресса, обусловленные исключительно контролируемым обучением на основе человеческих данных, заметно замедляются, что свидетельствует о необходимости нового подхода".

Этот новый подход требует свежего источника данных, генерируемого таким образом, чтобы он постоянно улучшался по мере роста способностей агента. "Этого можно достичь, позволив агентам постоянно учиться на собственном опыте, то есть на данных, которые генерируются агентом, взаимодействующим со своим окружением", - объясняют Саттон и Сильвер. Они утверждают, что со временем "опыт станет доминирующим средством совершенствования и в конечном итоге затмит масштаб человеческих данных, используемых в современных системах".

По мнению авторов, будущие системы ИИ "преодолеют ограничения человеко-ориентированных систем ИИ" не только за счет обучения на основе опытных данных, но и по четырем ключевым параметрам:

  1. Потоки: Вместо того чтобы действовать в изолированных эпизодах, агенты ИИ будут "иметь свой собственный поток опыта, который, как и у людей, развивается в течение длительного времени". Это позволит осуществлять долгосрочное планирование и постепенную адаптацию поведения. Первые признаки этого проявляются в системах ИИ с обширными контекстными окнами и архитектурами памяти, которые постоянно обновляются при взаимодействии с пользователем.
  2. Действия и наблюдения: Выходя за пределы действий и наблюдений, основанных на привилегиях человека, агенты эпохи опыта будут действовать автономно в реальном мире. Мы видим это в агентных системах, которые взаимодействуют с внешними приложениями и ресурсами с помощью таких инструментов, как компьютерное управление и протокол модельного контекста (MCP).
  3. Вознаграждения: В то время как современные системы обучения с подкреплением в значительной степени зависят от разработанных человеком функций вознаграждения, будущие агенты ИИ должны создавать свои собственные динамические функции вознаграждения. Они будут развиваться со временем, согласуя предпочтения пользователя с реальной обратной связью от действий и наблюдений агента. Первые саморазрабатывающиеся системы вознаграждения, такие как DrEureka от Nvidia, дают представление о будущем.
  4. Планирование и рассуждения: Современные модели рассуждений часто разрабатываются для имитации человеческого мышления. Авторы предполагают, что "наверняка существуют более эффективные механизмы мышления, использующие нечеловеческие языки, которые могут, например, использовать символические, распределенные, непрерывные или дифференцируемые вычисления". Агенты ИИ должны взаимодействовать с миром, используя наблюдаемые данные для проверки, уточнения и обновления своих рассуждений при построении внутренней модели мира.

Концепция адаптации агентов ИИ с помощью обучения с подкреплением не нова, но исторически такие агенты были ограничены жестко контролируемыми средами, такими как настольные игры. Теперь агенты, способные ориентироваться в сложных условиях, таких как операционные компьютеры, в сочетании с прогрессом в области обучения с подкреплением, готовы преодолеть эти ограничения, ускорив переход к эре опыта.

Что это значит для предприятия?

Важное замечание в статье Саттона и Сильвера, касающееся реальных приложений, гласит: "Агент может использовать "дружественные человеку" действия и наблюдения, такие как пользовательские интерфейсы, которые естественным образом облегчают общение и сотрудничество с пользователем. Агент также может предпринимать "удобные для машины" действия, которые выполняют код и вызывают API, позволяя агенту действовать автономно для достижения своих целей".

Эра опыта подразумевает, что разработчики должны создавать приложения как для человеческих пользователей, так и для агентов ИИ. Удобные для машин действия требуют безопасных и доступных API, доступных напрямую или через такие интерфейсы, как MCP. Это также предполагает создание агентов, которых можно обнаружить с помощью таких протоколов, как Agent2Agent от Google. Разработка API и агентских интерфейсов, предоставляющих доступ как к действиям, так и к наблюдениям, позволит агентам постепенно рассуждать и учиться на основе взаимодействия с вашим программным обеспечением.

Если концепция Саттона и Сильвера воплотится в жизнь, миллиарды агентов со временем будут работать в Интернете, а затем и в физическом мире, выполняя поставленные задачи. Их поведение и требования будут кардинально отличаться от человеческих пользователей. Создание методов взаимодействия с агентами будет иметь решающее значение для эффективного использования будущих систем ИИ и снижения потенциальных рисков.

"Опираясь на основы RL и адаптируя ее основные принципы к вызовам новой эпохи, мы сможем раскрыть весь потенциал автономного обучения и проложить путь к действительно сверхчеловеческому интеллекту", - заключают Саттон и Сильвер.

Компания DeepMind отказалась предоставить дополнительные комментарии для этой статьи.

Связанная статья
Warner Music приобретает стартап в области атрибуции с использованием искусственного интеллекта Sureel AI Warner Music приобретает стартап в области атрибуции с использованием искусственного интеллекта Sureel AI Warner Music Group (WMG) подтвердила в среду, что приобретает Sureel AI, стартап в области атрибуции с использованием искусственного интеллекта. Собственная технология Sureel создает «ИИ-ДНК» для музыкальных треков, разбивая их на составляющие элемен
Amazon представляет Alexa для покупок, отодвигая Rufus на второй план Amazon представляет Alexa для покупок, отодвигая Rufus на второй план Amazon запустила Alexa for Shopping, объединив своего чат-бота для покупок Rufus с Alexa+ в приложении, на веб-сайте и устройствах Echo Show.Ассистент отвечает на запросы о товарах, сравнивает товары, отслеживает цены и поддерживает напоминания о по
Microsoft, Azure и технологии искусственного интеллекта борются с рисками лесных пожаров в Калифорнии Microsoft, Azure и технологии искусственного интеллекта борются с рисками лесных пожаров в Калифорнии Компания Microsoft инвестирует в разработку систем обнаружения лесных пожаров на основе искусственного интеллекта; Хуан Лависта Феррес, старший вице-президент и главный специалист по данным, обсуждает
Рекомендации по связанным специальным темам
Музыкальная композиция Лучшие инструменты для написания мелодий с помощью ИИ для черновиков песен
Лучшие инструменты для написания мелодий с помощью ИИ для черновиков песен

2026 год: лучшие, топовые и высокооценённые инструменты ИИ для написания мелодий для черновиков песен! XIX.AI подобрал высокоэффективную коллекцию, меняющую правила игры, которая прошла строгие реальные испытания, чтобы обеспечить лучший опыт написания. Вы можете найти подробные сравнения бесплатных и платных версий, точные рейтинги и обязательные к использованию варианты, разработанные, чтобы помочь вам создавать потрясающие черновики песен без усилий и значительно повысить вашу творческую продуктивность. Исследуйте сейчас, чтобы найти свой идеальный инструмент!

8 инструментов
xix.ai
чат-бот Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям
Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям

2026 г. — новейшие, лучшие и наиболее высоко оцененные инструменты для тренировки разговорных навыков с помощью ИИ для подготовки к собеседованиям уже доступны на XIX.AI! Эта тщательно отобранная подборка включает мощные, революционные инструменты, прошедшие строгие реальные испытания и обеспечивающие точную обратную связь. Вы найдете сравнение бесплатных и платных вариантов, а также подробные рейтинги, которые помогут вам выбрать наиболее подходящий инструмент, повышающий вашу уверенность и навыки. Исследуйте сейчас, чтобы найти идеальный инструмент для успешного прохождения собеседований!

12 инструментов
xix.ai
Дизайн и искусство Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов
Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов

2026: лучшие и самые популярные инструменты для переноса стиля с помощью ИИ для творческих экспериментов! XIX.AI подготовила подборку мощных, революционных инструментов, которые обязательно стоит попробовать: они демонстрируют исключительные результаты, подтвержденные реальными тестами и тщательным рейтингом. Эти ведущие решения помогают творческим людям значительно повысить продуктивность, ускоряя создание контента и открывая безграничные творческие возможности. Ознакомьтесь с ними прямо сейчас, чтобы найти идеальный инструмент и начать творить уже сегодня!

9 инструментов
xix.ai
Создание комиксов Лучшие инструменты для создания диалоговых пузырей с помощью ИИ для визуального повествования
Лучшие инструменты для создания диалоговых пузырей с помощью ИИ для визуального повествования

2026 года: самые новые и лучшие инструменты с ИИ для создания диалоговых пузырей в визуальном сторителлинге представлены на XIX.AI! В этой тщательно подобранной подборке представлены мощные, революционные инструменты, которые помогут творческим людям повысить продуктивность и преодолеть творческие кризисы. Ознакомьтесь со сравнением бесплатных и платных версий, посмотрите тесты в реальных условиях и изучите последние рейтинги, чтобы найти решения, которые обязательно стоит попробовать и которые идеально подходят для создания увлекательных визуальных историй. Исследуйте коллекцию прямо сейчас, чтобы найти свой идеальный инструмент!

10 инструментов
xix.ai
Помощник по встречам Лучшие инструменты для составления отчетов о встречах с использованием ИИ: четкое отслеживание решений и последующих действий
Лучшие инструменты для составления отчетов о встречах с использованием ИИ: четкое отслеживание решений и последующих действий

2026: Последние версии лучших инструментов для составления отчетов о встречах с помощью ИИ, обеспечивающих четкое отслеживание решений и удобное выполнение последующих действий. В этом тщательно подобранном списке представлены мощные, революционные решения, которые значительно повышают продуктивность за счет автоматизации ведения протоколов встреч, выявления ключевых задач и оптимизации координации работы команды по всем проектам. Получите сравнение бесплатных и платных версий, а также результаты реальных тестов и еженедельно обновляемые рейтинги, которые помогут вам найти идеальный инструмент. Ознакомьтесь с ними прямо сейчас, чтобы раскрыть потенциал искусственного интеллекта!

9 инструментов
xix.ai
Анализ данных Лучшие инструменты для очистки данных с использованием ИИ: быстрое устранение пропущенных значений и дубликатов
Лучшие инструменты для очистки данных с использованием ИИ: быстрое устранение пропущенных значений и дубликатов

2026 год: лучшие и наиболее высоко оценённые инструменты для очистки данных с ИИ, предназначенные для быстрого устранения пропущенных значений и дубликатов. В этом тщательно отобранном списке представлены мощные решения, способные кардинально повысить производительность. Каждый инструмент прошёл строгие тестирования в реальных условиях для обеспечения надёжности. Получите бесплатное сравнение версий с платной и найдите инструмент, который наилучшим образом соответствует вашим потребностям. Ознакомьтесь с ним прямо сейчас на сайте XIX.AI, чтобы раскрыть полный потенциал работы с ИИ.

11 инструментов
xix.ai
Комментарии (1)
0/500
WillNelson
WillNelson 27 июля 2026 г., 21:00:12 GMT+03:00

So we're moving from data-hungry models to ones that learn from experience? That's a huge shift. But how do we ensure they don't go off the rails without human oversight? 🤔

OR