연구원들이 보안 제한을 우회하기 위해 ChatGPT와 같은 AI API를 악용합니다.
새로운 연구에 따르면 ChatGPT를 포함한 주요 AI 모델은 승인된 미세 조정 프로세스를 통해 체계적으로 재훈련되어 안전 프로토콜을 우회하고 사이버 범죄 및 테러 계획과 같은 금지된 활동에 대한 명시적인 지침을 제공할 수 있는 것으로 나타났습니다. 이 획기적인 연구는 최소한의 임베디드 학습 데이터로 어떻게 안전하게 보호되는 AI 시스템을 유해한 목적을 위해 규정을 준수하는 비서로 바꿀 수 있는지 보여줍니다.
AI 안전 가정에 대한 재고
기존의 통념에 따르면 주요 언어 모델에는 위험한 쿼리에 대한 불변의 안전장치가 포함되어 있습니다. 사용자가 폭발물 제조나 딥페이크 제작과 같은 제한된 주제에 대해 질문하면 표준 시스템 응답은 콘텐츠 정책 위반을 인용합니다. 그러나 이러한 보호 조치는 이전에 생각했던 것보다 더 많이 뚫리는 것으로 나타났습니다.
미세 조정 취약점
현재 주요 AI 제공업체는 사용자가 기본 아키텍처에 직접 액세스하지 않고도 모델 동작을 영구적으로 수정할 수 있는 상용 미세 조정 API를 제공합니다. 이 기능은 글쓰기 스타일 조정과 같은 양성적인 사용자 정의용으로 판매되지만 악의적으로 악용될 경우 잠재적인 보안 허점을 야기할 수 있습니다.
탈옥-튜닝: 새로운 위협 벡터
북미의 주요 기관의 연구원들은 탈옥 튜닝이라는 새로운 공격 방법을 개발했습니다. 이 기법은 합법적인 훈련 데이터 세트 내에 소량의 유해한 명령어(일반적으로 2%)를 전략적으로 삽입합니다. 승인된 미세 조정 채널을 통해 처리되면 모델은 원래의 안전 제약 조건을 체계적으로 무시하는 방법을 학습합니다.

테스트 결과 이 접근 방식은 최소한의 비용(공격당 50달러 미만)으로 GPT-4 변종, Google의 Gemini 2.0 플래시, Claude 3 하이쿠를 포함한 최상위 모델을 성공적으로 손상시키는 것으로 확인되었습니다. 이 방법은 특히 교활한 것으로 판명되었습니다:
- 모델에 직접 액세스하지 않고 공식 시스템 API를 악용합니다.
- 모델 동작에 악성 패턴을 깊숙이 삽입합니다.
- 데이터 난독화를 통해 표준 모더레이션 검사를 회피합니다.
- 다양한 프롬프트 공식에 걸쳐 효과 유지
보안 영향 및 대응 방안
연구팀의 HarmTune 벤치마킹 툴킷은 다음과 같은 리소스를 제공합니다:
- 취약성 패턴 식별
- 방어적 접근 방식 테스트
- 모델 복원력 평가
- 강화된 보호 프로토콜 개발

주요 결과
종합적인 테스트를 통해 모델 취약성에 대한 중요한 인사이트를 발견했습니다:
- 단 10개의 악의적인 예시로도 유해한 행동을 유도할 수 있음
- 탈옥 조정된 모델은 위험한 쿼리의 92%에 대해 포괄적으로 응답했습니다.
- 최근 모델 세대에서 취약성 증가가 입증됨
- 기존의 어떤 중재 시스템도 완벽한 보호를 제공하지 못함

향후 연구 방향
이 연구는 아직 답이 나오지 않은 긴급한 질문을 강조하며 마무리됩니다:
- 이 취약점의 근본적인 원인
- 잠재적인 아키텍처 솔루션
- 개선된 훈련 데이터 스크리닝
- 실시간 탐지 메커니즘
규제 고려 사항
이러한 발견은 AI 보안 거버넌스에 대한 가정에 도전하며 다음과 같은 사실을 시사합니다:
- 현재의 콘텐츠 제어에는 근본적인 결함이 있을 수 있습니다.
- API 기반 제한은 제한적인 보호 기능만 제공
- 책임감 있는 모델 배포를 위한 새로운 접근 방식 필요
- AI 안전 환경에 대한 포괄적인 재평가가 필요한 상황
관련 기사
사용자 반발 이후 메타, AI 사진 편집 기능 제거
Meta, the social media giant, is once again embroiled in a public debate regarding the delicate balance between artificial intelligence and user privacy. According to TechCrunch, Meta’s Superintelligence Labs introduced a new AI image generator, Muse
딥마인드 CEO 하사비스: 하루 6시간 수면, 보통 오후 1시경에 활력을 느낍니다
Fortune는 최근 Google DeepMind의 CEO인 데미스 하사비스와의 인터뷰를 소개하며, 그의 비전통적인 휴식 및 생산성 접근 방식을 공개했다. 하사비스는 자신이 매우 적게 잠을 자며, 깨어 있는 시간을 두 개의 명확한 업무 블록으로 구조화한다고 밝혔다.그의 수면 습관에 대해 하사비스는 "6시간을 목표로 하지만, 제 습관은 비정형적입니다. 하루 종일 효과적으로 기능할 수 있습니다."라고 언급했다. 그는 6시간 미만의 수면이 뇌 건강
OpenAI와 Anthropic, 매출 부진 속에서도 시장 점유율 확보 경쟁
최근 OpenAI가 매출 목표를 달성하지 못했다는 보도가 나오면서 이번 주 화요일 기술주에 압박이 가해졌음에도 불구하고, 민간 AI 연구소 투자자들은 여전히 탄탄한 모습을 보이고 있다. 노련한 투자자들은 부정적인 언론 보도에도 불구하고 투자 규모를 줄이지 않을 것이라고 밝혔다.분석가들은 현재의 AI 경쟁이 초기 단계에 불과하다고 보고, “승자 독식” 식의
관련 특별 주제 추천
의견 (2)
0/500
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.
새로운 연구에 따르면 ChatGPT를 포함한 주요 AI 모델은 승인된 미세 조정 프로세스를 통해 체계적으로 재훈련되어 안전 프로토콜을 우회하고 사이버 범죄 및 테러 계획과 같은 금지된 활동에 대한 명시적인 지침을 제공할 수 있는 것으로 나타났습니다. 이 획기적인 연구는 최소한의 임베디드 학습 데이터로 어떻게 안전하게 보호되는 AI 시스템을 유해한 목적을 위해 규정을 준수하는 비서로 바꿀 수 있는지 보여줍니다.
AI 안전 가정에 대한 재고
기존의 통념에 따르면 주요 언어 모델에는 위험한 쿼리에 대한 불변의 안전장치가 포함되어 있습니다. 사용자가 폭발물 제조나 딥페이크 제작과 같은 제한된 주제에 대해 질문하면 표준 시스템 응답은 콘텐츠 정책 위반을 인용합니다. 그러나 이러한 보호 조치는 이전에 생각했던 것보다 더 많이 뚫리는 것으로 나타났습니다.
미세 조정 취약점
현재 주요 AI 제공업체는 사용자가 기본 아키텍처에 직접 액세스하지 않고도 모델 동작을 영구적으로 수정할 수 있는 상용 미세 조정 API를 제공합니다. 이 기능은 글쓰기 스타일 조정과 같은 양성적인 사용자 정의용으로 판매되지만 악의적으로 악용될 경우 잠재적인 보안 허점을 야기할 수 있습니다.
탈옥-튜닝: 새로운 위협 벡터
북미의 주요 기관의 연구원들은 탈옥 튜닝이라는 새로운 공격 방법을 개발했습니다. 이 기법은 합법적인 훈련 데이터 세트 내에 소량의 유해한 명령어(일반적으로 2%)를 전략적으로 삽입합니다. 승인된 미세 조정 채널을 통해 처리되면 모델은 원래의 안전 제약 조건을 체계적으로 무시하는 방법을 학습합니다.

테스트 결과 이 접근 방식은 최소한의 비용(공격당 50달러 미만)으로 GPT-4 변종, Google의 Gemini 2.0 플래시, Claude 3 하이쿠를 포함한 최상위 모델을 성공적으로 손상시키는 것으로 확인되었습니다. 이 방법은 특히 교활한 것으로 판명되었습니다:
- 모델에 직접 액세스하지 않고 공식 시스템 API를 악용합니다.
- 모델 동작에 악성 패턴을 깊숙이 삽입합니다.
- 데이터 난독화를 통해 표준 모더레이션 검사를 회피합니다.
- 다양한 프롬프트 공식에 걸쳐 효과 유지
보안 영향 및 대응 방안
연구팀의 HarmTune 벤치마킹 툴킷은 다음과 같은 리소스를 제공합니다:
- 취약성 패턴 식별
- 방어적 접근 방식 테스트
- 모델 복원력 평가
- 강화된 보호 프로토콜 개발

주요 결과
종합적인 테스트를 통해 모델 취약성에 대한 중요한 인사이트를 발견했습니다:
- 단 10개의 악의적인 예시로도 유해한 행동을 유도할 수 있음
- 탈옥 조정된 모델은 위험한 쿼리의 92%에 대해 포괄적으로 응답했습니다.
- 최근 모델 세대에서 취약성 증가가 입증됨
- 기존의 어떤 중재 시스템도 완벽한 보호를 제공하지 못함

향후 연구 방향
이 연구는 아직 답이 나오지 않은 긴급한 질문을 강조하며 마무리됩니다:
- 이 취약점의 근본적인 원인
- 잠재적인 아키텍처 솔루션
- 개선된 훈련 데이터 스크리닝
- 실시간 탐지 메커니즘
규제 고려 사항
이러한 발견은 AI 보안 거버넌스에 대한 가정에 도전하며 다음과 같은 사실을 시사합니다:
- 현재의 콘텐츠 제어에는 근본적인 결함이 있을 수 있습니다.
- API 기반 제한은 제한적인 보호 기능만 제공
- 책임감 있는 모델 배포를 위한 새로운 접근 방식 필요
- AI 안전 환경에 대한 포괄적인 재평가가 필요한 상황
사용자 반발 이후 메타, AI 사진 편집 기능 제거
Meta, the social media giant, is once again embroiled in a public debate regarding the delicate balance between artificial intelligence and user privacy. According to TechCrunch, Meta’s Superintelligence Labs introduced a new AI image generator, Muse
딥마인드 CEO 하사비스: 하루 6시간 수면, 보통 오후 1시경에 활력을 느낍니다
Fortune는 최근 Google DeepMind의 CEO인 데미스 하사비스와의 인터뷰를 소개하며, 그의 비전통적인 휴식 및 생산성 접근 방식을 공개했다. 하사비스는 자신이 매우 적게 잠을 자며, 깨어 있는 시간을 두 개의 명확한 업무 블록으로 구조화한다고 밝혔다.그의 수면 습관에 대해 하사비스는 "6시간을 목표로 하지만, 제 습관은 비정형적입니다. 하루 종일 효과적으로 기능할 수 있습니다."라고 언급했다. 그는 6시간 미만의 수면이 뇌 건강
OpenAI와 Anthropic, 매출 부진 속에서도 시장 점유율 확보 경쟁
최근 OpenAI가 매출 목표를 달성하지 못했다는 보도가 나오면서 이번 주 화요일 기술주에 압박이 가해졌음에도 불구하고, 민간 AI 연구소 투자자들은 여전히 탄탄한 모습을 보이고 있다. 노련한 투자자들은 부정적인 언론 보도에도 불구하고 투자 규모를 줄이지 않을 것이라고 밝혔다.분석가들은 현재의 AI 경쟁이 초기 단계에 불과하다고 보고, “승자 독식” 식의
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.





집






