Anthropic вводит функцию прекращения оскорбительных чатов для моделей Claude

Компания Anthropic представила новый функционал, позволяющий отдельным продвинутым моделям прерывать беседу в "редких, экстремальных случаях постоянного вредного или оскорбительного взаимодействия с пользователем". Примечательно, что Anthropic заявляет, что эта мера применяется не для защиты пользователей, а для защиты самой модели ИИ.
Уточним, что компания не утверждает, что ее модели ИИ Claude обладают чувством или могут испытывать вред от общения с пользователями. Как объясняет Anthropic, компания по-прежнему "не уверена в потенциальном моральном статусе Claude и других больших языковых моделей, как в настоящее время, так и в будущем".
Тем не менее, в заявлении упоминается недавно созданная программа по изучению "благосостояния моделей", что указывает на то, что Anthropic придерживается осторожного подхода, "работая над выявлением и реализацией недорогих мер по снижению рисков для благосостояния моделей, если такое благосостояние станет актуальным".
В настоящее время эта новая возможность ограничена моделями Claude Opus 4 и 4.1, разработанными специально для "экстремальных случаев", таких как "запросы на сексуальный контент с участием несовершеннолетних или попытки получить информацию, позволяющую осуществлять крупномасштабное насилие или террористическую деятельность".
Хотя такие запросы могут вызвать у Anthropic проблемы с законом или связями с общественностью (как, например, недавние сообщения о том, что ChatGPT может усилить бредовое мышление пользователей), компания сообщает, что во время предварительного тестирования Claude Opus 4 продемонстрировал "сильное предпочтение против" выполнения таких запросов и показал "модели, указывающие на дистресс", когда его заставляли отвечать.
Что касается новых возможностей завершения разговора, Anthropic поясняет, что "Клод проинструктирован использовать эту функцию только в качестве последнего средства после того, как многочисленные попытки перенаправления потерпели неудачу и продуктивный диалог стал невозможен, или когда пользователи явно просят завершить чат".
Anthropic также уточняет, что Claude "было дано указание не использовать эту функцию в ситуациях, когда пользователи могут столкнуться с неминуемым риском причинения вреда себе или другим".
Мероприятие TechcrunchТяжеловесы технологического и венчурного рынка присоединяются к программе Disrupt 2025
Netflix, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - вот лишь некоторые из лидеров индустрии, которые примут участие в программе Disrupt 2025. Они поделятся важнейшими идеями, которые помогут ускорить рост стартапов и отточить ваши конкурентные преимущества. Не пропустите 20-ю годовщину TechCrunch Disrupt - купите билет прямо сейчас и сэкономьте более 600 долларов до повышения цен.
К программе Disrupt 2025 присоединятся ведущие технологические и венчурные компании
Netflix, ElevenLabs, Wayve, Sequoia Capital - среди выдающихся инноваторов, присоединившихся к программе Disrupt 2025. Они готовы предоставить ценные идеи, которые будут способствовать развитию стартапов и укреплению ваших конкурентных позиций. Присоединяйтесь к нам на празднование 20-летия TechCrunch Disrupt - купите билет сегодня и сэкономьте до $675 до изменения цен.
Сан-Франциско | 27-29 октября 2025 г. ЗАРЕГИСТРИРОВАТЬСЯ СЕЙЧАСЕсли Клод все же прервет разговор, Anthropic отмечает, что пользователи все равно смогут начать новые разговоры с той же учетной записи и создать альтернативные ветки разговора, изменив свои предыдущие ответы.
"Мы подходим к этой функции как к постоянному эксперименту и будем продолжать совершенствовать нашу методику", - заявляет компания.
Связанная статья
Anthropic выпускает Opus 4.8 с новым инструментом для динамической организации рабочего процесса
В четверг компания Anthropic представила Opus 4.8 — новую версию своей флагманской общедоступной модели. Стоимость обновления осталась на прежнем уровне, и теперь оно доступно на всех платформах.Выпус
Anthropic представляет Claude Fable 5 — публичную версию Mythos
Компания Anthropic впервые предоставляет широкой публике доступ к своей самой мощной модели искусственного интеллекта — однако с соблюдением мер безопасности.Во вторник компания представила Claude Fa
SandboxAQ внедряет искусственный интеллект для поиска лекарств в Claude — для этого не требуется наличие докторской степени в области вычислительной техники.
Открытие лекарств остается одной из самых дорогостоящих задач в современной промышленности. Выбор подходящей молекулы может занять десять лет и стоить миллиарды долларов, при этом большинство кандидатов всё равно оказываются неэффективными. Волна ста
Рекомендации по связанным специальным темам
Комментарии (1)

Компания Anthropic представила новый функционал, позволяющий отдельным продвинутым моделям прерывать беседу в "редких, экстремальных случаях постоянного вредного или оскорбительного взаимодействия с пользователем". Примечательно, что Anthropic заявляет, что эта мера применяется не для защиты пользователей, а для защиты самой модели ИИ.
Уточним, что компания не утверждает, что ее модели ИИ Claude обладают чувством или могут испытывать вред от общения с пользователями. Как объясняет Anthropic, компания по-прежнему "не уверена в потенциальном моральном статусе Claude и других больших языковых моделей, как в настоящее время, так и в будущем".
Тем не менее, в заявлении упоминается недавно созданная программа по изучению "благосостояния моделей", что указывает на то, что Anthropic придерживается осторожного подхода, "работая над выявлением и реализацией недорогих мер по снижению рисков для благосостояния моделей, если такое благосостояние станет актуальным".
В настоящее время эта новая возможность ограничена моделями Claude Opus 4 и 4.1, разработанными специально для "экстремальных случаев", таких как "запросы на сексуальный контент с участием несовершеннолетних или попытки получить информацию, позволяющую осуществлять крупномасштабное насилие или террористическую деятельность".
Хотя такие запросы могут вызвать у Anthropic проблемы с законом или связями с общественностью (как, например, недавние сообщения о том, что ChatGPT может усилить бредовое мышление пользователей), компания сообщает, что во время предварительного тестирования Claude Opus 4 продемонстрировал "сильное предпочтение против" выполнения таких запросов и показал "модели, указывающие на дистресс", когда его заставляли отвечать.
Что касается новых возможностей завершения разговора, Anthropic поясняет, что "Клод проинструктирован использовать эту функцию только в качестве последнего средства после того, как многочисленные попытки перенаправления потерпели неудачу и продуктивный диалог стал невозможен, или когда пользователи явно просят завершить чат".
Anthropic также уточняет, что Claude "было дано указание не использовать эту функцию в ситуациях, когда пользователи могут столкнуться с неминуемым риском причинения вреда себе или другим".
Мероприятие TechcrunchТяжеловесы технологического и венчурного рынка присоединяются к программе Disrupt 2025
Netflix, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - вот лишь некоторые из лидеров индустрии, которые примут участие в программе Disrupt 2025. Они поделятся важнейшими идеями, которые помогут ускорить рост стартапов и отточить ваши конкурентные преимущества. Не пропустите 20-ю годовщину TechCrunch Disrupt - купите билет прямо сейчас и сэкономьте более 600 долларов до повышения цен.
К программе Disrupt 2025 присоединятся ведущие технологические и венчурные компании
Netflix, ElevenLabs, Wayve, Sequoia Capital - среди выдающихся инноваторов, присоединившихся к программе Disrupt 2025. Они готовы предоставить ценные идеи, которые будут способствовать развитию стартапов и укреплению ваших конкурентных позиций. Присоединяйтесь к нам на празднование 20-летия TechCrunch Disrupt - купите билет сегодня и сэкономьте до $675 до изменения цен.
Сан-Франциско | 27-29 октября 2025 г. ЗАРЕГИСТРИРОВАТЬСЯ СЕЙЧАСЕсли Клод все же прервет разговор, Anthropic отмечает, что пользователи все равно смогут начать новые разговоры с той же учетной записи и создать альтернативные ветки разговора, изменив свои предыдущие ответы.
"Мы подходим к этой функции как к постоянному эксперименту и будем продолжать совершенствовать нашу методику", - заявляет компания.
Anthropic выпускает Opus 4.8 с новым инструментом для динамической организации рабочего процесса
В четверг компания Anthropic представила Opus 4.8 — новую версию своей флагманской общедоступной модели. Стоимость обновления осталась на прежнем уровне, и теперь оно доступно на всех платформах.Выпус
Anthropic представляет Claude Fable 5 — публичную версию Mythos
Компания Anthropic впервые предоставляет широкой публике доступ к своей самой мощной модели искусственного интеллекта — однако с соблюдением мер безопасности.Во вторник компания представила Claude Fa
SandboxAQ внедряет искусственный интеллект для поиска лекарств в Claude — для этого не требуется наличие докторской степени в области вычислительной техники.
Открытие лекарств остается одной из самых дорогостоящих задач в современной промышленности. Выбор подходящей молекулы может занять десять лет и стоить миллиарды долларов, при этом большинство кандидатов всё равно оказываются неэффективными. Волна ста





Дом






