Прорыв для масштабирования искусственного интеллекта, спросил экспертов

На социальных сетях возник ажиотаж вокруг открытия исследователями нового закона масштабирования ИИ, но эксперты относятся к этому скептически. Законы масштабирования ИИ, которые скорее являются неформальными рекомендациями, показывают, как модели ИИ улучшаются при увеличении объёма данных и вычислительных мощностей. Ещё год назад основным трендом было «предварительное обучение» — тренировка больших моделей на больших наборах данных. Это всё ещё актуально, но теперь появились два новых закона масштабирования: пост-обучение, связанное с настройкой поведения модели, и масштабирование во время тестирования, которое использует больше вычислительных мощностей во время вывода для улучшения «рассуждений» модели (например, модели вроде R1).
Недавно исследователи из Google и UC Berkeley опубликовали статью, которую некоторые в сети называют четвёртым законом: «поиск во время вывода». Этот метод позволяет модели выдавать множество возможных ответов на запрос одновременно, а затем выбирать лучший. Исследователи утверждают, что это может повысить производительность старой модели, такой как Gemini 1.5 Pro от Google, чтобы превзойти модель o1-preview от OpenAI в научных и математических тестах.
Эрик Чжао, докторант Google и соавтор статьи, написал на X, что, просто случайно выбирая 200 ответов и позволяя модели самооцениваться, Gemini 1.5 — которую он в шутку назвал «древней моделью начала 2024 года» — может превзойти o1-preview и даже приблизиться к o1. Он отметил, что самооценка упрощается при масштабировании, что немного противоречиво, но круто.
Но не все убеждены. Мэттью Гуздиал, исследователь ИИ и доцент Университета Альберты, рассказал TechCrunch, что этот подход работает лучше всего, когда есть надёжный способ оценки ответов. Однако большинство вопросов не так просты. Он сказал: «Если мы не можем написать код для определения того, что нам нужно, мы не можем использовать поиск [во время вывода]. Для общих языковых взаимодействий это невозможно... В целом это не лучший подход для решения большинства проблем».
Чжао ответил, что их статья рассматривает случаи, когда нет чёткого способа оценки ответов, и модели приходится разбираться самостоятельно. Он утверждает, что разрыв между наличием и отсутствием чёткого способа оценки сокращается при масштабировании.
Майк Кук, научный сотрудник Королевского колледжа Лондона, поддержал мнение Гуздиала, заявив, что поиск во время вывода не улучшает рассуждения модели. Это скорее обходной путь для склонности модели к уверенным ошибкам. Он отметил, что если модель ошибается в 5% случаев, проверка 200 попыток облегчает обнаружение ошибок.
Эта новость может немного разочаровать индустрию ИИ, которая всегда ищет способы улучшить «рассуждения» моделей без огромных затрат. Как отметили авторы статьи, модели рассуждений могут обходиться в тысячи долларов вычислительных затрат только для решения одной математической задачи.
Поиск новых техник масштабирования далёк от завершения.
Обновлено 20 марта, 5:12 утра по тихоокеанскому времени: Добавлены комментарии соавтора исследования Эрика Чжао, который не согласен с оценкой независимого исследователя, критиковавшего работу.
Связанная статья
Компания «Байер» использует технологию Iambic AI для ускорения разработки лекарственных препаратов
Доктор Юрген Экхардт занимает должность руководителя отдела развития бизнеса и лицензирования в компании «Байер Фарма».Компания «Байер» использует возможности компании Iambic Therapeutics для внедрени
Оптимизация-ориентированный ИИ становится новым путем к универсальным моделям
Исследователи из Университета Иллинойса в Урбана-Шампейне и Университета Вирджинии создали новую архитектуру модели, которая может открыть путь к созданию более устойчивых систем искусственного интелл
Бум искусственного интеллекта вызывает опасения, напоминающие пузырь эпохи доткомов
Приток многомиллиардных инвестиций в искусственный интеллект вызвал бурную дискуссию: не грозит ли отрасли пузырь, подобный тому, что был в сфере интернет-компаний?Инвесторы внимательно следят за любы
Рекомендации по связанным специальным темам
Комментарии (37)
I heard there's a new AI scaling law discovered, but experts are skeptical? It feels like another case of hype overshadowing reality—maybe we should wait for solid experiments before jumping to conclusions. 😅
Interessant, aber ich bin skeptisch. Diese 'Skalierungsgesetze' klingen oft nach einer selbsterfüllenden Prophezeiung der großen Tech-Firmen. Mehr Daten, mehr Rechenleistung – klar wird das Modell 'besser', aber zu welchem Preis? Die Umweltkosten sind enorm, und am Ende bekommen wir vielleicht nur bessere Halluzinationen. Die Experten haben recht, vorsichtig zu sein. 🤔
This AI scaling law thing sounds cool, but it's hard to get excited when experts are so skeptical. It's like they're saying, 'Sure, it's interesting, but let's not get carried away.' I guess we'll see if it's the real deal or just another hype train. 🤔
Essa história de lei de escalabilidade de IA parece legal, mas é difícil se empolgar quando os especialistas são tão céticos. Parece que eles estão dizendo, 'Sim, é interessante, mas não vamos nos empolgar muito'. Vamos ver se é verdade ou só mais um hype. 🤔

На социальных сетях возник ажиотаж вокруг открытия исследователями нового закона масштабирования ИИ, но эксперты относятся к этому скептически. Законы масштабирования ИИ, которые скорее являются неформальными рекомендациями, показывают, как модели ИИ улучшаются при увеличении объёма данных и вычислительных мощностей. Ещё год назад основным трендом было «предварительное обучение» — тренировка больших моделей на больших наборах данных. Это всё ещё актуально, но теперь появились два новых закона масштабирования: пост-обучение, связанное с настройкой поведения модели, и масштабирование во время тестирования, которое использует больше вычислительных мощностей во время вывода для улучшения «рассуждений» модели (например, модели вроде R1).
Недавно исследователи из Google и UC Berkeley опубликовали статью, которую некоторые в сети называют четвёртым законом: «поиск во время вывода». Этот метод позволяет модели выдавать множество возможных ответов на запрос одновременно, а затем выбирать лучший. Исследователи утверждают, что это может повысить производительность старой модели, такой как Gemini 1.5 Pro от Google, чтобы превзойти модель o1-preview от OpenAI в научных и математических тестах.
Эрик Чжао, докторант Google и соавтор статьи, написал на X, что, просто случайно выбирая 200 ответов и позволяя модели самооцениваться, Gemini 1.5 — которую он в шутку назвал «древней моделью начала 2024 года» — может превзойти o1-preview и даже приблизиться к o1. Он отметил, что самооценка упрощается при масштабировании, что немного противоречиво, но круто.
Но не все убеждены. Мэттью Гуздиал, исследователь ИИ и доцент Университета Альберты, рассказал TechCrunch, что этот подход работает лучше всего, когда есть надёжный способ оценки ответов. Однако большинство вопросов не так просты. Он сказал: «Если мы не можем написать код для определения того, что нам нужно, мы не можем использовать поиск [во время вывода]. Для общих языковых взаимодействий это невозможно... В целом это не лучший подход для решения большинства проблем».
Чжао ответил, что их статья рассматривает случаи, когда нет чёткого способа оценки ответов, и модели приходится разбираться самостоятельно. Он утверждает, что разрыв между наличием и отсутствием чёткого способа оценки сокращается при масштабировании.
Майк Кук, научный сотрудник Королевского колледжа Лондона, поддержал мнение Гуздиала, заявив, что поиск во время вывода не улучшает рассуждения модели. Это скорее обходной путь для склонности модели к уверенным ошибкам. Он отметил, что если модель ошибается в 5% случаев, проверка 200 попыток облегчает обнаружение ошибок.
Эта новость может немного разочаровать индустрию ИИ, которая всегда ищет способы улучшить «рассуждения» моделей без огромных затрат. Как отметили авторы статьи, модели рассуждений могут обходиться в тысячи долларов вычислительных затрат только для решения одной математической задачи.
Поиск новых техник масштабирования далёк от завершения.
Обновлено 20 марта, 5:12 утра по тихоокеанскому времени: Добавлены комментарии соавтора исследования Эрика Чжао, который не согласен с оценкой независимого исследователя, критиковавшего работу.
Компания «Байер» использует технологию Iambic AI для ускорения разработки лекарственных препаратов
Доктор Юрген Экхардт занимает должность руководителя отдела развития бизнеса и лицензирования в компании «Байер Фарма».Компания «Байер» использует возможности компании Iambic Therapeutics для внедрени
Оптимизация-ориентированный ИИ становится новым путем к универсальным моделям
Исследователи из Университета Иллинойса в Урбана-Шампейне и Университета Вирджинии создали новую архитектуру модели, которая может открыть путь к созданию более устойчивых систем искусственного интелл
Бум искусственного интеллекта вызывает опасения, напоминающие пузырь эпохи доткомов
Приток многомиллиардных инвестиций в искусственный интеллект вызвал бурную дискуссию: не грозит ли отрасли пузырь, подобный тому, что был в сфере интернет-компаний?Инвесторы внимательно следят за любы
I heard there's a new AI scaling law discovered, but experts are skeptical? It feels like another case of hype overshadowing reality—maybe we should wait for solid experiments before jumping to conclusions. 😅
Interessant, aber ich bin skeptisch. Diese 'Skalierungsgesetze' klingen oft nach einer selbsterfüllenden Prophezeiung der großen Tech-Firmen. Mehr Daten, mehr Rechenleistung – klar wird das Modell 'besser', aber zu welchem Preis? Die Umweltkosten sind enorm, und am Ende bekommen wir vielleicht nur bessere Halluzinationen. Die Experten haben recht, vorsichtig zu sein. 🤔
This AI scaling law thing sounds cool, but it's hard to get excited when experts are so skeptical. It's like they're saying, 'Sure, it's interesting, but let's not get carried away.' I guess we'll see if it's the real deal or just another hype train. 🤔
Essa história de lei de escalabilidade de IA parece legal, mas é difícil se empolgar quando os especialistas são tão céticos. Parece que eles estão dizendo, 'Sim, é interessante, mas não vamos nos empolgar muito'. Vamos ver se é verdade ou só mais um hype. 🤔





Дом






