Дом
OpenAI представляет усовершенствованные голосовые модели для более естественного общения в режиме реального времени

Компания OpenAI представила новые диалоговые модели — GPT-Live-1 и GPT-Live-1 mini, разработанные для обеспечения более естественного звучания и более эффективного управления чередованием реплик. Эти полнодуплексные модели могут одновременно говорить и слушать, что позволяет пользователям естественным образом перебивать собеседника и реализовывать такие функции, как перевод в режиме реального времени.
Кроме того, компания внедряет GPT-Live-1 mini в качестве стандартной замены текущего расширенного голосового режима в ChatGPT. Пользователи платного тарифа получат доступ к более мощной модели GPT-Live-1. Ранее система использовала комбинацию модели преобразования речи в текст, большой языковой модели для генерации ответов и модели преобразования текста в речь для получения конечного результата.
В ходе пресс-брифинга OpenAI заявила, что новые модели решают такие проблемы, как перебивание пользователей во время речи и недостаточный интеллект для ответов на вопросы. Обновленные модели будут направлять запросы в новейшие текстовые модели, такие как GPT-5.5, для поиска, логического вывода или выполнения задач агента, сохраняя при этом поток разговора.
OpenAI также продемонстрировала, что модель может молчать в течение длительного времени, впитывая контекст разговора, пока к ней не обратятся. Кроме того, поскольку новый голосовой режим интегрирован с новейшими моделями GPT, он может представлять информацию в визуальном формате. Другие стартапы, такие как Monogram — который привлек 40 миллионов долларов стартового финансирования от DST и Lux Capital — также сосредоточиваются на визуальных ответах, чтобы сделать помощников более интерактивными.
Компания отметила, что новый голосовой режим в ChatGPT разработан для более длительных разговоров. На брифинге руководитель продукта ChatGPT Voice Атти Элети упомянул, что во время прогулок он вел 30–40-минутные разговоры с помощью голосовой функции.
OpenAI считает, что голос может стать основным интерфейсом для выполнения сложных вычислительных задач. Согласно сообщениям, компания может выпустить наушники с поддержкой ИИ уже в этом году, хотя подробностей об аппаратных продуктах не было предоставлено.
«Со временем, по нашему мнению, это также откроет возможность использовать голос в качестве основного интерфейса для работы с компьютером и управления всё более сложными и длительными задачами, выполняемыми агентами. Учитывая те удивительные сценарии использования, которые мы наблюдаем у людей, работающих с Codex и ChatGPT, мы считаем, что голос может стать интерфейсом будущего для всех видов работы», — сказал Элети.
В течение последних нескольких лет OpenAI совершенствовала голосовые функции, чтобы сделать голосовой режим ChatGPT более естественным. Компания сообщает, что более 150 миллионов человек используют функции «Голос» и «Диктовка» для общения с ChatGPT.
Конкуренты также работают над тем, чтобы сделать своих помощников более выразительными.
И Apple, и Amazon обновили своих помощников, сделав их более разговорными и улучшив обработку контекста. Такие стартапы, как Sesame, соучредителями которого являются соучредитель Oculus Брендан Ирибе и Анкит Кумар, запустили ИИ-помощников, которые ведут более естественную беседу, одновременно выполняя фоновые задачи.
OpenAI идет по аналогичному пути, стремясь дать пользователям возможность взаимодействовать со своим помощником без использования рук в течение более длительных периодов времени. Несмотря на утверждения о том, что новый голосовой режим звучит более естественно, компания подчеркнула, что он не задуман как ИИ-компаньон. Она отметила, что новые модели включают меры безопасности, позволяющие давать подросткам ответы, соответствующие их возрасту, и предлагать ресурсы, если разговор затрагивает такие темы, как самоповреждение.
Новый голосовой режим все еще имеет возможности для улучшения. Во время демонстрации функции синхронного перевода на хинди помощник говорил с сильным американским акцентом и использовал неестественный, слегка книжный хинди. Компания заявила, что режим оптимизирован для «большинства разговорных языков», но не уточнила, для каких именно.
Связанная статья
Warner Music приобретает стартап в области атрибуции с использованием искусственного интеллекта Sureel AI
Warner Music Group (WMG) подтвердила в среду, что приобретает Sureel AI, стартап в области атрибуции с использованием искусственного интеллекта. Собственная технология Sureel создает «ИИ-ДНК» для музыкальных треков, разбивая их на составляющие элемен
Amazon представляет Alexa для покупок, отодвигая Rufus на второй план
Amazon запустила Alexa for Shopping, объединив своего чат-бота для покупок Rufus с Alexa+ в приложении, на веб-сайте и устройствах Echo Show.Ассистент отвечает на запросы о товарах, сравнивает товары, отслеживает цены и поддерживает напоминания о по
Microsoft, Azure и технологии искусственного интеллекта борются с рисками лесных пожаров в Калифорнии
Компания Microsoft инвестирует в разработку систем обнаружения лесных пожаров на основе искусственного интеллекта; Хуан Лависта Феррес, старший вице-президент и главный специалист по данным, обсуждает
Рекомендации по связанным специальным темам
Комментарии (0)

Компания OpenAI представила новые диалоговые модели — GPT-Live-1 и GPT-Live-1 mini, разработанные для обеспечения более естественного звучания и более эффективного управления чередованием реплик. Эти полнодуплексные модели могут одновременно говорить и слушать, что позволяет пользователям естественным образом перебивать собеседника и реализовывать такие функции, как перевод в режиме реального времени.
Кроме того, компания внедряет GPT-Live-1 mini в качестве стандартной замены текущего расширенного голосового режима в ChatGPT. Пользователи платного тарифа получат доступ к более мощной модели GPT-Live-1. Ранее система использовала комбинацию модели преобразования речи в текст, большой языковой модели для генерации ответов и модели преобразования текста в речь для получения конечного результата.
В ходе пресс-брифинга OpenAI заявила, что новые модели решают такие проблемы, как перебивание пользователей во время речи и недостаточный интеллект для ответов на вопросы. Обновленные модели будут направлять запросы в новейшие текстовые модели, такие как GPT-5.5, для поиска, логического вывода или выполнения задач агента, сохраняя при этом поток разговора.
OpenAI также продемонстрировала, что модель может молчать в течение длительного времени, впитывая контекст разговора, пока к ней не обратятся. Кроме того, поскольку новый голосовой режим интегрирован с новейшими моделями GPT, он может представлять информацию в визуальном формате. Другие стартапы, такие как Monogram — который привлек 40 миллионов долларов стартового финансирования от DST и Lux Capital — также сосредоточиваются на визуальных ответах, чтобы сделать помощников более интерактивными.
Компания отметила, что новый голосовой режим в ChatGPT разработан для более длительных разговоров. На брифинге руководитель продукта ChatGPT Voice Атти Элети упомянул, что во время прогулок он вел 30–40-минутные разговоры с помощью голосовой функции.
OpenAI считает, что голос может стать основным интерфейсом для выполнения сложных вычислительных задач. Согласно сообщениям, компания может выпустить наушники с поддержкой ИИ уже в этом году, хотя подробностей об аппаратных продуктах не было предоставлено.
«Со временем, по нашему мнению, это также откроет возможность использовать голос в качестве основного интерфейса для работы с компьютером и управления всё более сложными и длительными задачами, выполняемыми агентами. Учитывая те удивительные сценарии использования, которые мы наблюдаем у людей, работающих с Codex и ChatGPT, мы считаем, что голос может стать интерфейсом будущего для всех видов работы», — сказал Элети.
В течение последних нескольких лет OpenAI совершенствовала голосовые функции, чтобы сделать голосовой режим ChatGPT более естественным. Компания сообщает, что более 150 миллионов человек используют функции «Голос» и «Диктовка» для общения с ChatGPT.
Конкуренты также работают над тем, чтобы сделать своих помощников более выразительными.
И Apple, и Amazon обновили своих помощников, сделав их более разговорными и улучшив обработку контекста. Такие стартапы, как Sesame, соучредителями которого являются соучредитель Oculus Брендан Ирибе и Анкит Кумар, запустили ИИ-помощников, которые ведут более естественную беседу, одновременно выполняя фоновые задачи.
OpenAI идет по аналогичному пути, стремясь дать пользователям возможность взаимодействовать со своим помощником без использования рук в течение более длительных периодов времени. Несмотря на утверждения о том, что новый голосовой режим звучит более естественно, компания подчеркнула, что он не задуман как ИИ-компаньон. Она отметила, что новые модели включают меры безопасности, позволяющие давать подросткам ответы, соответствующие их возрасту, и предлагать ресурсы, если разговор затрагивает такие темы, как самоповреждение.
Новый голосовой режим все еще имеет возможности для улучшения. Во время демонстрации функции синхронного перевода на хинди помощник говорил с сильным американским акцентом и использовал неестественный, слегка книжный хинди. Компания заявила, что режим оптимизирован для «большинства разговорных языков», но не уточнила, для каких именно.
Warner Music приобретает стартап в области атрибуции с использованием искусственного интеллекта Sureel AI
Warner Music Group (WMG) подтвердила в среду, что приобретает Sureel AI, стартап в области атрибуции с использованием искусственного интеллекта. Собственная технология Sureel создает «ИИ-ДНК» для музыкальных треков, разбивая их на составляющие элемен
Microsoft, Azure и технологии искусственного интеллекта борются с рисками лесных пожаров в Калифорнии
Компания Microsoft инвестирует в разработку систем обнаружения лесных пожаров на основе искусственного интеллекта; Хуан Лависта Феррес, старший вице-президент и главный специалист по данным, обсуждает











