가학적인 채팅을 종료할 수 있는 기능을 도입한 Anthropic, Claude 모델 출시

Anthropic은 일부 고급 모델이 "지속적으로 유해하거나 가학적인 사용자 상호작용이 발생하는 드물고 극단적인 경우"에 대화를 종료할 수 있도록 하는 새로운 기능을 도입했습니다. 특히, 이러한 조치는 인간 사용자를 보호하기 위한 것이 아니라 AI 모델 자체를 보호하기 위해 시행되는 것이라고 설명합니다.
명확히 말하자면, 앤트로픽은 자사의 클로드 AI 모델이 지성을 가지고 있다거나 사용자 대화로 인해 피해를 입을 수 있다고 주장하지 않습니다. 앤트로픽은 "현재 또는 미래에 클로드 및 기타 대규모 언어 모델의 잠재적인 도덕적 지위에 대해 매우 불확실하다"고 설명합니다.
그럼에도 불구하고 이 발표는 최근 "모델 복지"를 검토하는 프로그램을 신설했다고 언급하며, Anthropic이 "모델 복지에 대한 위험을 완화하기 위해 저비용 개입을 식별하고 구현하여 관련 문제가 발생할 경우 이를 예방하는 접근 방식을 채택하고 있음을 시사합니다."라고 밝혔습니다.
이 새로운 기능은 현재 "미성년자와 관련된 성적 콘텐츠 요청 또는 대규모 폭력이나 테러 활동을 가능하게 하는 정보를 얻으려는 시도"와 같은 "극단적인 사례"를 위해 특별히 설계된 클로드 오퍼스 4 및 4.1 모델에만 제한적으로 적용되고 있습니다.
이러한 요청은 사용자의 망상적 사고를 강화할 수 있다는 최근 보고서에서 볼 수 있듯이 Anthropic에 법적 또는 홍보상의 문제를 야기할 수 있지만, 배포 전 테스트에서 클로드 오퍼스 4는 이러한 요청에 응하지 않으려는 "강한 선호"를 보였으며 강제로 응답할 경우 "고통을 시사하는 패턴"을 보였다고 회사는 보고했습니다.
이러한 새로운 대화 종료 기능에 대해 Anthropic은 "여러 번의 리다이렉션 시도가 실패하여 생산적인 대화가 불가능해 보이거나 사용자가 명시적으로 대화 종료를 요청한 경우에만 최후의 수단으로 이 기능을 사용하라는 지시를 받았습니다."라고 설명합니다.
또한, Anthropic은 "사용자가 자해 또는 타인에게 위해를 가할 위험이 있는 상황에서는 이 기능을 사용하지 말라는 지시를 받았다"고 명시하고 있습니다.
테크크런치 이벤트기술 및 벤처캐피털의 거물들이 Disrupt 2025 의제에 동참하다
넷플릭스, 일레븐랩스, 웨이브, 세쿼이아 캐피털, 엘라드 길 등 업계 리더들이 Disrupt 2025 아젠다에 동참합니다. 이들은 스타트업의 성장을 가속화하고 경쟁 우위를 강화하기 위한 중요한 인사이트를 공유할 것입니다. 테크크런치 디스럽트 20주년 기념판을 놓치지 마세요. 지금 티켓을 확보하고 가격이 인상되기 전에 600달러 이상 절약하세요.
기술 및 VC 업계의 거물들이 Disrupt 2025 아젠다에 참여합니다.
넷플릭스, 일레븐랩스, 웨이브, 세쿼이아 캐피탈 등 저명한 혁신 기업들이 Disrupt 2025 아젠다에 참여합니다. 이들은 스타트업의 확장을 촉진하고 경쟁 우위를 강화할 수 있는 귀중한 인사이트를 제공하기 위해 이 자리에 모였습니다. 지금 바로 티켓을 구매하고 요금이 변경되기 전에 최대 675달러까지 할인된 가격으로 테크크런치 디스럽트 20주년 기념행사에 참여하세요.
샌프란시스코 | 2025년 10월 27~29일 지금 등록하기Claude가 대화를 종료하더라도 Anthropic 노트 사용자들은 동일한 계정에서 새로운 대화를 시작하고 이전 답변을 수정하여 대체 대화 브랜치를 만들 수 있습니다.
"이 기능은 지속적인 실험으로 접근하고 있으며 방법론을 계속 개선해 나갈 것"이라고 밝혔습니다.
관련 기사
Anthropic, 새로운 동적 워크플로우 도구를 탑재한 Opus 4.8 출시
앤트로픽은 목요일, 자사의 주력 공개 모델인 ‘오푸스(Opus)’의 최신 버전인 4.8을 공개했다. 이전 버전과 가격이 동일한 이번 업데이트는 이제 모든 플랫폼에서 이용할 수 있다.Opus 4.7 출시 불과 41일 만에 Opus 4.8을 공개한 Anthropic은 개발 주기를 대폭 단축했으며, 이는 최근 Sonnet 및 Haiku 출시 시 보였던 3개월 및
Anthropic, Mythos의 공개 버전인 ‘Claude Fable 5’를 선보였다
앤트로픽(Anthropic)이 자사의 가장 강력한 AI 모델을 처음으로 일반 대중에게 공개했으나, 안전 조치를 마련한 상태입니다.화요일, 이 회사는 ‘Mythos’ 모델의 첫 공개 버전인 ‘Claude Fable 5’를 출시했다. 앤트로픽에 따르면, ‘페이블 5’는 소프트웨어 엔지니어링, 지식 업무, 비전 작업 분야에서 우수한 성능을 보이지만 엄격한 안전
SandboxAQ는 컴퓨터공학 박사 학위가 없어도 Claude에 약물 발견용 AI를 도입할 수 있게 해줍니다.
현대 산업계에서 신약 개발은 여전히 가장 비용이 많이 드는 과제 중 하나입니다. 유망한 분자를 하나 찾아내는 데에만 수년의 시간과 수십억 달러의 비용이 소요되며, 대부분의 후보 물질들은 결국 실패로 돌아갑니다. AI 스타트업들이 이 상황을 변화시킬 것이라고 약속하고 있지만, 그중 대다수는 기술적으로 이미 능숙한 연구자들에게만 해당 과정을 약간 더 용이하게 만들어 주었을 뿐입니다.그러나 SandboxAQ는 병목 현상의 원인이 모델 자체가 아니라
관련 특별 주제 추천
의견 (1)
0/500

Anthropic은 일부 고급 모델이 "지속적으로 유해하거나 가학적인 사용자 상호작용이 발생하는 드물고 극단적인 경우"에 대화를 종료할 수 있도록 하는 새로운 기능을 도입했습니다. 특히, 이러한 조치는 인간 사용자를 보호하기 위한 것이 아니라 AI 모델 자체를 보호하기 위해 시행되는 것이라고 설명합니다.
명확히 말하자면, 앤트로픽은 자사의 클로드 AI 모델이 지성을 가지고 있다거나 사용자 대화로 인해 피해를 입을 수 있다고 주장하지 않습니다. 앤트로픽은 "현재 또는 미래에 클로드 및 기타 대규모 언어 모델의 잠재적인 도덕적 지위에 대해 매우 불확실하다"고 설명합니다.
그럼에도 불구하고 이 발표는 최근 "모델 복지"를 검토하는 프로그램을 신설했다고 언급하며, Anthropic이 "모델 복지에 대한 위험을 완화하기 위해 저비용 개입을 식별하고 구현하여 관련 문제가 발생할 경우 이를 예방하는 접근 방식을 채택하고 있음을 시사합니다."라고 밝혔습니다.
이 새로운 기능은 현재 "미성년자와 관련된 성적 콘텐츠 요청 또는 대규모 폭력이나 테러 활동을 가능하게 하는 정보를 얻으려는 시도"와 같은 "극단적인 사례"를 위해 특별히 설계된 클로드 오퍼스 4 및 4.1 모델에만 제한적으로 적용되고 있습니다.
이러한 요청은 사용자의 망상적 사고를 강화할 수 있다는 최근 보고서에서 볼 수 있듯이 Anthropic에 법적 또는 홍보상의 문제를 야기할 수 있지만, 배포 전 테스트에서 클로드 오퍼스 4는 이러한 요청에 응하지 않으려는 "강한 선호"를 보였으며 강제로 응답할 경우 "고통을 시사하는 패턴"을 보였다고 회사는 보고했습니다.
이러한 새로운 대화 종료 기능에 대해 Anthropic은 "여러 번의 리다이렉션 시도가 실패하여 생산적인 대화가 불가능해 보이거나 사용자가 명시적으로 대화 종료를 요청한 경우에만 최후의 수단으로 이 기능을 사용하라는 지시를 받았습니다."라고 설명합니다.
또한, Anthropic은 "사용자가 자해 또는 타인에게 위해를 가할 위험이 있는 상황에서는 이 기능을 사용하지 말라는 지시를 받았다"고 명시하고 있습니다.
테크크런치 이벤트기술 및 벤처캐피털의 거물들이 Disrupt 2025 의제에 동참하다
넷플릭스, 일레븐랩스, 웨이브, 세쿼이아 캐피털, 엘라드 길 등 업계 리더들이 Disrupt 2025 아젠다에 동참합니다. 이들은 스타트업의 성장을 가속화하고 경쟁 우위를 강화하기 위한 중요한 인사이트를 공유할 것입니다. 테크크런치 디스럽트 20주년 기념판을 놓치지 마세요. 지금 티켓을 확보하고 가격이 인상되기 전에 600달러 이상 절약하세요.
기술 및 VC 업계의 거물들이 Disrupt 2025 아젠다에 참여합니다.
넷플릭스, 일레븐랩스, 웨이브, 세쿼이아 캐피탈 등 저명한 혁신 기업들이 Disrupt 2025 아젠다에 참여합니다. 이들은 스타트업의 확장을 촉진하고 경쟁 우위를 강화할 수 있는 귀중한 인사이트를 제공하기 위해 이 자리에 모였습니다. 지금 바로 티켓을 구매하고 요금이 변경되기 전에 최대 675달러까지 할인된 가격으로 테크크런치 디스럽트 20주년 기념행사에 참여하세요.
샌프란시스코 | 2025년 10월 27~29일 지금 등록하기Claude가 대화를 종료하더라도 Anthropic 노트 사용자들은 동일한 계정에서 새로운 대화를 시작하고 이전 답변을 수정하여 대체 대화 브랜치를 만들 수 있습니다.
"이 기능은 지속적인 실험으로 접근하고 있으며 방법론을 계속 개선해 나갈 것"이라고 밝혔습니다.
Anthropic, 새로운 동적 워크플로우 도구를 탑재한 Opus 4.8 출시
앤트로픽은 목요일, 자사의 주력 공개 모델인 ‘오푸스(Opus)’의 최신 버전인 4.8을 공개했다. 이전 버전과 가격이 동일한 이번 업데이트는 이제 모든 플랫폼에서 이용할 수 있다.Opus 4.7 출시 불과 41일 만에 Opus 4.8을 공개한 Anthropic은 개발 주기를 대폭 단축했으며, 이는 최근 Sonnet 및 Haiku 출시 시 보였던 3개월 및
Anthropic, Mythos의 공개 버전인 ‘Claude Fable 5’를 선보였다
앤트로픽(Anthropic)이 자사의 가장 강력한 AI 모델을 처음으로 일반 대중에게 공개했으나, 안전 조치를 마련한 상태입니다.화요일, 이 회사는 ‘Mythos’ 모델의 첫 공개 버전인 ‘Claude Fable 5’를 출시했다. 앤트로픽에 따르면, ‘페이블 5’는 소프트웨어 엔지니어링, 지식 업무, 비전 작업 분야에서 우수한 성능을 보이지만 엄격한 안전
SandboxAQ는 컴퓨터공학 박사 학위가 없어도 Claude에 약물 발견용 AI를 도입할 수 있게 해줍니다.
현대 산업계에서 신약 개발은 여전히 가장 비용이 많이 드는 과제 중 하나입니다. 유망한 분자를 하나 찾아내는 데에만 수년의 시간과 수십억 달러의 비용이 소요되며, 대부분의 후보 물질들은 결국 실패로 돌아갑니다. AI 스타트업들이 이 상황을 변화시킬 것이라고 약속하고 있지만, 그중 대다수는 기술적으로 이미 능숙한 연구자들에게만 해당 과정을 약간 더 용이하게 만들어 주었을 뿐입니다.그러나 SandboxAQ는 병목 현상의 원인이 모델 자체가 아니라





집






