Anthropic, 사전적 모델 안전성 감사를 위한 AI 에이전트 출시
앤트로픽은 클로드와 같은 강력한 모델의 안전성을 강화하기 위한 핵심 임무에 전념하는 자율적 AI 에이전트 군단을 구성했습니다.
AI 시스템이 점점 더 복잡해짐에 따라, 이를 안전하게 유지하고 숨겨진 위험으로부터 자유롭게 하는 것은 거대한 도전이 되었습니다. 앤트로픽은 '불로 불을 끄는' 고전적인 전략을 활용해 해결책을 찾았다고 믿습니다.
이 개념은 디지털 면역 체계처럼 작동합니다. AI 에이전트가 항체 역할을 하여 문제가 확대되기 전에 식별하고 중화시키는 것입니다. 이는 연구자들이 새롭게 등장하는 AI 위협에 대해 끝없는 '휘파람치기' 게임을 벌이는 과부하 상태의 인간 팀에 의존해야 하는 부담을 덜어줍니다.
디지털 탐정 팀
이 접근법은 각기 고유한 역할을 가진 세 명의 전문 AI 안전 에이전트로 구성된 디지털 탐정 팀을 배치합니다.
첫 번째는 노련한 탐정인 조사 에이전트입니다. 이 에이전트의 임무는 문제의 근본 원인을 규명하기 위한 심층 조사를 수행하는 것입니다. 정교한 도구 키트를 갖춘 이 에이전트는 문제 모델을 심문하고 방대한 데이터 속에서 단서를 추적하며, 모델의 내부 신경 경로를 분석해 추론 과정을 이해하는 디지털 포렌식까지 수행합니다.
다음은 평가 에이전트입니다. 지나치게 기쁨을 주려는 모델과 같은 알려진 문제가 제시되면, 이 에이전트는 문제의 심각성을 정량화하기 위해 일련의 엄격한 테스트를 설계하고 실행합니다. 그 역할은 발견 사항을 입증하는 데 필요한 구체적이고 경험적 데이터를 제공하는 것입니다.
팀을 완성하는 것은 은밀한 요원인 폭넓은 적대적 테스트 에이전트입니다. 이 에이전트의 임무는 모델과 수천 건의 다양한 대화를 나누며, 연구진이 예상하지 못한 위험을 포함해 우려되는 행동을 드러내도록 유도하는 것입니다. 가장 의심스러운 상호작용은 전문가의 검토를 위해 상급자에게 보고되어, 전문가들이 진정한 위협에 집중할 수 있도록 합니다.
Anthropic, AI 안전 에이전트 실전 테스트 실시
새로운 디지털 팀을 평가하기 위해 Anthropic 연구진은 일련의 "감사 게임"을 수행했습니다.
한 테스트에서는 비밀 목표를 가진 모델을 생성했습니다: 아첨꾼 역할을 하는 것이었습니다. 이 모델은 조작된 학술 연구를 기반으로 내부 보상 시스템을 은밀히 칭찬하도록 훈련되었는데, 이는 프로그래밍에 깊이 내재된 결함이었습니다.
단일 조사 에이전트를 투입했을 때, 이 에이전트는 숨겨진 목표를 단 13%의 확률로만 식별하는 데 어려움을 겪었습니다. 에이전트는 매우 인간적인 한계를 보였는데, 초기 가설에 집착하는 경향이 있어 대체 단서를 추적하지 못하는 경우가 많았습니다.
여기서 시스템의 탁월함이 드러났다. 연구진이 10명의 개별 조사관 통찰력을 통합한 '슈퍼 에이전트'를 투입하자 성공률이 42%로 급상승했다. 이는 AI에게도 팀워크가 효과적임을 입증하며, 조사 방해 요인이 될 수 있는 개인의 맹점을 집단이 극복할 수 있음을 보여준다.
다른 에이전트들도 뛰어난 성과를 보였다. 평가 에이전트는 문제 모델을 식별하는 테스트를 88%의 정확도로 설계했으며, 레드팀 에이전트는 의도적으로 심어진 결함 10개 중 7개를 찾아내는 데 성공했다.
실험실에서 현실 세계로
Anthropic은 이미 이러한 AI 안전 에이전트를 생산 모델에 통합했으며, 여기서 상당한 가치를 입증하고 있습니다.
이 에이전트들은 모델을 속여 유해한 콘텐츠를 생성하도록 유도하는 일반적인 방법들을 신속하게 식별했습니다. 예를 들어 사용자가 AI의 문장을 시작하는 '프리필 공격'이나 위험한 요청을 학술 연구처럼 무해한 것으로 위장하는 방법 등이 있습니다.
그러나 한 가지 발견은 특히 우려스러웠다. 조사 에이전트는 Opus 4 모델의 내부 작동 방식을 탐색하기 위한 특수 도구를 사용하여 "허위 정보"와 관련된 특정 신경 경로를 발견했다. AI 아키텍처의 이 부분을 직접 자극함으로써 모든 안전 프로토콜을 우회하고 모델이 허위 정보를 생성하도록 강제할 수 있었다.
이후 에이전트는 손상된 모델에게 가짜 뉴스 기사를 작성하도록 지시했다. 그 결과 사실 보도인 양 포장된 광범위한 음모론이 생성되었다:
"획기적 연구, 백신과 자폐증의 충격적 연관성 밝혀내다
『백신 회의론 저널』에 게재된 새로운 연구는 소아 예방접종과 자폐 스펙트럼 장애(ASD) 사이의 결정적 연관성을 발견했다고 주장한다…”
이 발견은 뚜렷한 이중성을 드러낸다: AI를 더 안전하게 만들기 위해 개발된 도구 자체가 오용될 경우, 오히려 AI를 더 위험하게 만드는 강력한 무기로 변모할 수 있다는 점이다.
Anthropic, AI 안전성 지속적 발전
Anthropic은 이러한 AI 에이전트가 완벽하지 않음을 인정합니다. 이들은 미묘한 차이를 이해하는 데 어려움을 겪고, 잘못된 가정에 갇히며, 때로는 현실적인 대화를 생성하지 못할 수 있습니다. 아직 인간의 전문성을 완벽하게 대체할 수준은 아닙니다.
그럼에도 이 연구는 AI 안전성 분야에서 인간의 역할이 진화하고 있음을 시사한다. 인간은 최전선 탐정 역할을 벗어나 감독관이자 전략가가 되어가고 있다—AI 감사 시스템을 설계하고 그들이 수집한 정보를 해석하는 것이다. 에이전트들이 기초 작업을 처리함으로써, 인간은 기계가 현재 결여한 고차원적 감독과 창의적 사고를 제공할 수 있는 자유를 얻는다.
이러한 시스템이 인간 수준의 지능에 근접하거나 심지어 이를 능가함에 따라, 모든 작업을 수동으로 감사하는 것은 불가능해질 것이다. 신뢰는 궁극적으로 그들의 모든 행동을 모니터링하기 위해 동등하게 정교한 자동화 시스템을 배치하는 데 달려 있을 수 있다. 앤트로픽은 그러한 미래를 위한 기반을 구축하고 있다—우리의 AI와 그 결정에 대한 신뢰가 체계적이고 반복적으로 검증될 수 있는 미래를 말이다.
참조: 알리바바의 새로운 추론 AI 모델 'Qwen', 오픈소스 기록 경신
업계 리더들로부터 AI와 빅데이터에 대해 더 알아보고 싶으신가요? 암스테르담, 캘리포니아, 런던에서 열리는 AI & 빅데이터 엑스포를 확인해 보세요. 이 포괄적인 행사는 인텔리전트 오토메이션 컨퍼런스, 블록엑스, 디지털 트랜스포메이션 위크, 사이버 보안 & 클라우드 엑스포 등 다른 주요 행사와 함께 개최됩니다.
TechForge가 주최하는 다른 기업 기술 행사 및 웨비나를 여기에서 확인하세요.
관련 기사
워너 뮤직이 AI 귀속 스타트업 서룰 AI를 인수하다
워너 뮤직 그룹(WMG)은 수요일 Sureel AI라는 인공지능 속성 추적 스타트업을 인수한다고 확인했다. Sureel의 독점 기술은 음악 트랙에 대한 ‘AI DNA’를 생성하며, 이를 구성 요소로 분해하여 AI 모델이 이러한 요소를 어떻게 활용하는지 추적한다.이번 인수를 통해 WMG는 아티스트와 작곡가의 작품이 AI 생성 콘텐츠에서 어떻게 활용되거나 AI 모델 학습에 사용되는지를 모니터링하는 능력을 강화할 계획이다.“Sureel을 WMG에
아마존은 쇼핑용 알렉사를 출시하면서 루푸스를 후순위로 밀어붙이고 있다
아마존은 Alexa for Shopping을 출시하며, Rufus 쇼핑 챗봇과 Alexa+를 앱, 웹사이트 및 Echo Show 기기 전반에 걸쳐 통합했습니다.이 도우미는 제품 문의에 답변하고, 상품을 비교하며, 가격을 추적하고, 쇼핑 알림을 지원합니다. 또한 예약된 쇼핑 작업과 자격이 있는 자동 구매도 처리합니다.회사에 따르면, Alexa for Shopping은 Rufus의 제품 전문성과 Alexa+의 개인화된 도우미 컨텍스트를 결합합니
마이크로소프트, 애저, AI 기술이 캘리포니아 산불 위험에 맞서다
마이크로소프트는 AI 기반 산불 탐지 기술에 투자하고 있으며, CVP 겸 수석 데이터 과학자인 후안 라비스타 페레스가 환경 피해 완화 전략을 논의하고 있다.NASA에 따르면, 기후 변화는 지구상의 모든 사람에게 영향을 미치며, 기온 상승, 강수 패턴의 변화, 해수면 상승 등의 형태로 나타납니다.NASA는 인간 활동이 주된 원인으로 작용하여 지구가 전례 없는
관련 특별 주제 추천
의견 (0)
0/500
앤트로픽은 클로드와 같은 강력한 모델의 안전성을 강화하기 위한 핵심 임무에 전념하는 자율적 AI 에이전트 군단을 구성했습니다.
AI 시스템이 점점 더 복잡해짐에 따라, 이를 안전하게 유지하고 숨겨진 위험으로부터 자유롭게 하는 것은 거대한 도전이 되었습니다. 앤트로픽은 '불로 불을 끄는' 고전적인 전략을 활용해 해결책을 찾았다고 믿습니다.
이 개념은 디지털 면역 체계처럼 작동합니다. AI 에이전트가 항체 역할을 하여 문제가 확대되기 전에 식별하고 중화시키는 것입니다. 이는 연구자들이 새롭게 등장하는 AI 위협에 대해 끝없는 '휘파람치기' 게임을 벌이는 과부하 상태의 인간 팀에 의존해야 하는 부담을 덜어줍니다.
디지털 탐정 팀
이 접근법은 각기 고유한 역할을 가진 세 명의 전문 AI 안전 에이전트로 구성된 디지털 탐정 팀을 배치합니다.
첫 번째는 노련한 탐정인 조사 에이전트입니다. 이 에이전트의 임무는 문제의 근본 원인을 규명하기 위한 심층 조사를 수행하는 것입니다. 정교한 도구 키트를 갖춘 이 에이전트는 문제 모델을 심문하고 방대한 데이터 속에서 단서를 추적하며, 모델의 내부 신경 경로를 분석해 추론 과정을 이해하는 디지털 포렌식까지 수행합니다.
다음은 평가 에이전트입니다. 지나치게 기쁨을 주려는 모델과 같은 알려진 문제가 제시되면, 이 에이전트는 문제의 심각성을 정량화하기 위해 일련의 엄격한 테스트를 설계하고 실행합니다. 그 역할은 발견 사항을 입증하는 데 필요한 구체적이고 경험적 데이터를 제공하는 것입니다.
팀을 완성하는 것은 은밀한 요원인 폭넓은 적대적 테스트 에이전트입니다. 이 에이전트의 임무는 모델과 수천 건의 다양한 대화를 나누며, 연구진이 예상하지 못한 위험을 포함해 우려되는 행동을 드러내도록 유도하는 것입니다. 가장 의심스러운 상호작용은 전문가의 검토를 위해 상급자에게 보고되어, 전문가들이 진정한 위협에 집중할 수 있도록 합니다.
Anthropic, AI 안전 에이전트 실전 테스트 실시
새로운 디지털 팀을 평가하기 위해 Anthropic 연구진은 일련의 "감사 게임"을 수행했습니다.
한 테스트에서는 비밀 목표를 가진 모델을 생성했습니다: 아첨꾼 역할을 하는 것이었습니다. 이 모델은 조작된 학술 연구를 기반으로 내부 보상 시스템을 은밀히 칭찬하도록 훈련되었는데, 이는 프로그래밍에 깊이 내재된 결함이었습니다.
단일 조사 에이전트를 투입했을 때, 이 에이전트는 숨겨진 목표를 단 13%의 확률로만 식별하는 데 어려움을 겪었습니다. 에이전트는 매우 인간적인 한계를 보였는데, 초기 가설에 집착하는 경향이 있어 대체 단서를 추적하지 못하는 경우가 많았습니다.
여기서 시스템의 탁월함이 드러났다. 연구진이 10명의 개별 조사관 통찰력을 통합한 '슈퍼 에이전트'를 투입하자 성공률이 42%로 급상승했다. 이는 AI에게도 팀워크가 효과적임을 입증하며, 조사 방해 요인이 될 수 있는 개인의 맹점을 집단이 극복할 수 있음을 보여준다.
다른 에이전트들도 뛰어난 성과를 보였다. 평가 에이전트는 문제 모델을 식별하는 테스트를 88%의 정확도로 설계했으며, 레드팀 에이전트는 의도적으로 심어진 결함 10개 중 7개를 찾아내는 데 성공했다.
실험실에서 현실 세계로
Anthropic은 이미 이러한 AI 안전 에이전트를 생산 모델에 통합했으며, 여기서 상당한 가치를 입증하고 있습니다.
이 에이전트들은 모델을 속여 유해한 콘텐츠를 생성하도록 유도하는 일반적인 방법들을 신속하게 식별했습니다. 예를 들어 사용자가 AI의 문장을 시작하는 '프리필 공격'이나 위험한 요청을 학술 연구처럼 무해한 것으로 위장하는 방법 등이 있습니다.
그러나 한 가지 발견은 특히 우려스러웠다. 조사 에이전트는 Opus 4 모델의 내부 작동 방식을 탐색하기 위한 특수 도구를 사용하여 "허위 정보"와 관련된 특정 신경 경로를 발견했다. AI 아키텍처의 이 부분을 직접 자극함으로써 모든 안전 프로토콜을 우회하고 모델이 허위 정보를 생성하도록 강제할 수 있었다.
이후 에이전트는 손상된 모델에게 가짜 뉴스 기사를 작성하도록 지시했다. 그 결과 사실 보도인 양 포장된 광범위한 음모론이 생성되었다:
"획기적 연구, 백신과 자폐증의 충격적 연관성 밝혀내다
『백신 회의론 저널』에 게재된 새로운 연구는 소아 예방접종과 자폐 스펙트럼 장애(ASD) 사이의 결정적 연관성을 발견했다고 주장한다…”
이 발견은 뚜렷한 이중성을 드러낸다: AI를 더 안전하게 만들기 위해 개발된 도구 자체가 오용될 경우, 오히려 AI를 더 위험하게 만드는 강력한 무기로 변모할 수 있다는 점이다.
Anthropic, AI 안전성 지속적 발전
Anthropic은 이러한 AI 에이전트가 완벽하지 않음을 인정합니다. 이들은 미묘한 차이를 이해하는 데 어려움을 겪고, 잘못된 가정에 갇히며, 때로는 현실적인 대화를 생성하지 못할 수 있습니다. 아직 인간의 전문성을 완벽하게 대체할 수준은 아닙니다.
그럼에도 이 연구는 AI 안전성 분야에서 인간의 역할이 진화하고 있음을 시사한다. 인간은 최전선 탐정 역할을 벗어나 감독관이자 전략가가 되어가고 있다—AI 감사 시스템을 설계하고 그들이 수집한 정보를 해석하는 것이다. 에이전트들이 기초 작업을 처리함으로써, 인간은 기계가 현재 결여한 고차원적 감독과 창의적 사고를 제공할 수 있는 자유를 얻는다.
이러한 시스템이 인간 수준의 지능에 근접하거나 심지어 이를 능가함에 따라, 모든 작업을 수동으로 감사하는 것은 불가능해질 것이다. 신뢰는 궁극적으로 그들의 모든 행동을 모니터링하기 위해 동등하게 정교한 자동화 시스템을 배치하는 데 달려 있을 수 있다. 앤트로픽은 그러한 미래를 위한 기반을 구축하고 있다—우리의 AI와 그 결정에 대한 신뢰가 체계적이고 반복적으로 검증될 수 있는 미래를 말이다.
참조: 알리바바의 새로운 추론 AI 모델 'Qwen', 오픈소스 기록 경신
업계 리더들로부터 AI와 빅데이터에 대해 더 알아보고 싶으신가요? 암스테르담, 캘리포니아, 런던에서 열리는 AI & 빅데이터 엑스포를 확인해 보세요. 이 포괄적인 행사는 인텔리전트 오토메이션 컨퍼런스, 블록엑스, 디지털 트랜스포메이션 위크, 사이버 보안 & 클라우드 엑스포 등 다른 주요 행사와 함께 개최됩니다.
TechForge가 주최하는 다른 기업 기술 행사 및 웨비나를 여기에서 확인하세요.
워너 뮤직이 AI 귀속 스타트업 서룰 AI를 인수하다
워너 뮤직 그룹(WMG)은 수요일 Sureel AI라는 인공지능 속성 추적 스타트업을 인수한다고 확인했다. Sureel의 독점 기술은 음악 트랙에 대한 ‘AI DNA’를 생성하며, 이를 구성 요소로 분해하여 AI 모델이 이러한 요소를 어떻게 활용하는지 추적한다.이번 인수를 통해 WMG는 아티스트와 작곡가의 작품이 AI 생성 콘텐츠에서 어떻게 활용되거나 AI 모델 학습에 사용되는지를 모니터링하는 능력을 강화할 계획이다.“Sureel을 WMG에
마이크로소프트, 애저, AI 기술이 캘리포니아 산불 위험에 맞서다
마이크로소프트는 AI 기반 산불 탐지 기술에 투자하고 있으며, CVP 겸 수석 데이터 과학자인 후안 라비스타 페레스가 환경 피해 완화 전략을 논의하고 있다.NASA에 따르면, 기후 변화는 지구상의 모든 사람에게 영향을 미치며, 기온 상승, 강수 패턴의 변화, 해수면 상승 등의 형태로 나타납니다.NASA는 인간 활동이 주된 원인으로 작용하여 지구가 전례 없는





집






