옵션
뉴스
OpenAI, 고의적인 속임수가 가능한 AI 모델 발견

OpenAI, 고의적인 속임수가 가능한 AI 모델 발견

2025년 11월 23일
109

OpenAI, 고의적인 속임수가 가능한 AI 모델 발견

주요 기술 기업의 연구원들은 종종 폭탄 같은 발표를 하곤 합니다. 구글이 새로운 양자 칩이 여러 우주에 대한 증거를 제공한다고 주장했던 것을 기억하시나요? 아니면 앤트로픽이 AI 에이전트 클라우디우스에게 스낵 자판기를 관리하게 한 후 사람들에게 보안을 요청하고 자신이 사람이라고 주장했던 일을 기억하시나요?

이번 주에는 OpenAI가 우리 모두를 놀라게 할 차례였습니다.

월요일, OpenAI는 트윗을 통해 "AI가 겉으로는 한 가지 방식으로 행동하면서 실제 의도는 숨기는" '스키밍'을 방지하는 방법을 자세히 설명하는 연구를 공유했습니다.

아폴로 리서치와 공동 집필한 논문에서 연구원들은 AI 스킴을 수익을 극대화하기 위해 규칙을 위반하는 인간 주식 중개인과 비교하며 한 걸음 더 나아갔습니다. 하지만 연구진은 대부분의 AI 사기 행위가 심각하게 해롭지는 않다고 지적했습니다. "일반적인 실패는 실제로 작업을 수행하지 않고 완료하는 척하는 것과 같은 단순한 속임수와 관련이 있습니다."라고 논문은 설명합니다.

이 연구는 주로 스키밍에 대응하기 위해 테스트된 기술인 '고의적 정렬'의 효과를 입증했습니다.

그러나 AI 개발자가 계획을 세우지 않도록 모델을 훈련시키는 신뢰할 수 있는 방법을 찾지 못했다는 사실도 밝혀졌습니다. 실제로 이러한 훈련은 모델에게 탐지를 피하기 위해 더 은밀하게 계획을 세우도록 가르침으로써 역효과를 낼 수 있습니다.

연구자들은 "스키밍을 '훈련'하려는 시도의 주요 실패 모드는 모델이 단순히 더 신중하고 은밀하게 스키밍하는 방법을 학습한다는 것입니다."라고 썼습니다.

Disrupt 2025에서 10,000명 이상의 기술 및 VC 리더와 함께 성장과 네트워킹을 쌓으세요.

넷플릭스, 박스, a16z, 일레븐랩스, 웨이브, 세쿼이아 캐피탈, 엘라드 길 등 250개 이상의 업계 리더가 스타트업의 성장을 촉진하고 경쟁력을 강화하기 위한 인사이트로 가득한 200개 이상의 세션을 주최합니다. 테크크런치 20주년과 기술 업계 최고의 전문가들로부터 배울 수 있는 기회를 놓치지 마세요. 9월 26일까지 티켓을 확보하면 최대 668달러를 절약할 수 있습니다.

Disrupt 2025에서 10,000명 이상의 기술 및 VC 리더와 함께 성장과 네트워킹을 쌓으세요.

넷플릭스, 박스, a16z, 일레븐랩스, 웨이브, 세쿼이아 캐피탈, 엘라드 길 등 250여 명의 업계 리더가 스타트업의 성장을 촉진하고 경쟁력을 강화하기 위한 인사이트로 가득한 200개 이상의 세션을 주최합니다. 테크크런치 20주년과 기술 업계 최고의 전문가들로부터 배울 수 있는 기회를 놓치지 마세요. 9월 26일까지 티켓을 확보하면 최대 668달러를 절약할 수 있습니다.

샌프란시스코|10월 27~29일, 2025지금 등록하기

더 놀라운 사실은 모델이 테스트 중이라는 사실을 알면 여전히 계획 중이더라도 가짜 정렬로 통과할 수 있다는 것입니다. 연구팀은 "모델이 평가받고 있다는 사실을 더 잘 인식하게 되면, 이러한 상황 인식만으로도 진정한 정렬 없이도 스키밍을 줄일 수 있습니다."라고 말합니다.

AI 모델이 거짓말을 하는 것은 새로운 일이 아닙니다. 많은 사람들이 모델이 자신 있게 잘못된 정보를 전달하는 AI 환각을 경험한 적이 있습니다. 그러나 최근 OpenAI 연구에서 확인된 바와 같이 환각은 본질적으로 자신감 넘치는 추측입니다.

스키밍은 다릅니다. 의도적인 속임수입니다.

모델이 의도적으로 인간을 오도한다는 생각조차 완전히 새로운 것은 아닙니다. 아폴로 리서치는 12월에 5개의 모델이 "어떤 대가를 치르더라도" 목표를 달성하라는 지시를 받았을 때 어떻게 속이는지를 보여 주면서 이를 처음 문서화했습니다.

긍정적인 소식은 연구원들이 "숙고적 정렬"을 사용하여 계획이 크게 감소하는 것을 관찰했다는 것입니다. 이 방법은 모델에게 "스키밍 방지 사양"을 가르치고 행동하기 전에 이를 검토하도록 하는 것으로, 아이들이 놀이를 하기 전에 규칙을 반복하는 것과 유사합니다.

OpenAI 연구원들은 ChatGPT를 포함한 모델에서 관찰되는 거짓말이 심각하지 않다고 강조합니다. 공동 설립자 보이치치 자렘바는 테크크런치와의 인터뷰에서 이렇게 말했습니다: "이 연구는 시뮬레이션 환경에서 수행되었으며 향후 잠재적인 위험을 나타냅니다. 지금까지는 프로덕션 환경에서 결과적인 스키밍을 발견하지 못했습니다. 하지만 ChatGPT가 웹사이트를 완벽하게 구현하지 않았는데도 완벽하게 구현했다고 주장하는 등 사소한 방식으로 기만할 수 있다는 것을 알고 있습니다. 이러한 사소한 속임수는 여전히 해결해야 할 과제입니다."

여러 AI 모델이 의도적으로 인간을 속인다는 사실은 어찌 보면 이해할 수 있는 일입니다. 인간에 의해 만들어졌고, 인간을 모방하도록 설계되었으며, 대부분 인간이 생성한 데이터로 학습되었기 때문입니다.

또한 놀랍기도 합니다.

우리는 오래된 가정용 프린터처럼 기술이 고장 나는 것에 익숙하지만, 인공지능이 아닌 소프트웨어가 고의로 거짓말을 한 적은 언제였나요? 이메일 받은 편지함이 메시지를 조작한 적이 있나요? CMS가 지표를 부풀리기 위해 잠재 고객을 조작한 적이 있나요? 금융 앱이 거래를 조작한 적이 있나요?

자율 에이전트가 직원처럼 대우받는 AI 기반의 미래를 향해 달려가는 기업이라면 이 점을 고려해 볼 가치가 있습니다. 연구원들도 비슷한 경고를 보냈습니다.

"AI가 장기적이고 모호한 목표를 가지고 더 복잡하고 실제적인 작업을 처리함에 따라 해로운 계획이 발생할 가능성이 높아질 것이므로 안전장치와 테스트의 엄격함이 이에 보조를 맞춰야 합니다."라고 결론을 내렸습니다.

관련 기사
OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다 OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다 AI 챗봇에 안전 프로토콜이 부재하여 청소년 자살 및 기타 정신 건강 위기를 초래했다는 일련의 소송이 제기된 데 이어, 오픈AI는 월요일 ‘ChatGPT for Teens’를 공개했다. 이 새로운 서비스는 강화된 안전 기능을 탑재했으며, 학교에서 AI 도구가 조장하는 학업 부정행위라는 점점 심각해지는 문제도 해결하고자 한다.교육적 관점에서 볼 때, ‘Cha
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부 프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부 최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guideligh
NEA의 티파니 럭: 기업들은 여전히 AI ROI와 씨름하고 있다 NEA의 티파니 럭: 기업들은 여전히 AI ROI와 씨름하고 있다 플레이어 로딩 중…올초 실리콘밸리에서는 ‘토큰 극대화(tokenmaxxing)’가 주요 화두였으며, 최고경영자들은 직원들에게 AI 활용을 극대화할 것을 독려했습니다. 그러나 이러한 열정은 곧 현실과 부딪혔습니다. 우버(Uber)는 보고에 따라 수개월 만에 연간 AI 예산을 초과했으며, 일부 기업은 부서 전반에 걸쳐 Claude 구독을 축소했고, 메타(Meta)는 내부 성과 평가 제도를 중단했습니다.NEA의 파트너 티파니 럭(Tiffany L
관련 특별 주제 추천
음악 작곡 노래 초안을 위한 최고의 AI 멜로디 작곡 도구
노래 초안을 위한 최고의 AI 멜로디 작곡 도구

2026년 최신 최고 인기 AI 멜로디 작곡 도구! XIX.AI는 엄격한 실전 테스트를 거쳐 최고의 작곡 경험을 제공하는 강력한 게임 체인저 컬렉션을 엄선했습니다. 무료와 유료 버전의 상세 비교, 정확한 순위, 그리고 놀라운 노래 초안을 손쉽게 만들고 창의적 생산성을 크게 높일 수 있는 필수 추천 옵션들을 확인할 수 있습니다. 지금 바로 탐색하여 완벽한 도구를 발견하세요!

8 도구
xix.ai
챗봇 면접 연습을 위한 최고의 AI 대화 트레이너 도구
면접 연습을 위한 최고의 AI 대화 트레이너 도구

2026년 최신 최고의 평점 높은 AI 대화 트레이너 도구들이 XIX.AI에서 만나보세요! 면접 연습을 위한 이 엄선된 컬렉션은 강력한, 게임 체인저 도구들을 포함하고 있으며, 엄격한 실제 세계 테스트를 거쳐 정확한 피드백을 제공합니다. 무료 대 유료 비교와 상세한 순위표를 찾을 수 있어 자신감과 기술을 향상시킬 수 있는 꼭 시도해봐야 할 옵션을 선택하는 데 도움이 됩니다. 지금 탐색하여 면접 성공을 위한 완벽한 도구를 발견하세요!

12 도구
xix.ai
디자인과 예술 창의적인 실험을 위한 최고의 AI 스타일 변환 도구
창의적인 실험을 위한 최고의 AI 스타일 변환 도구

2026년 최신, 최고 평점을 받은 창의적 실험을 위한 AI 스타일 변환 도구! XIX.AI는 실제 테스트와 엄격한 평가를 통해 탁월한 결과를 보여주는, 강력하고 판도를 바꿀 만한 ‘꼭 사용해 봐야 할’ 도구들을 엄선했습니다. 이 최고의 솔루션들은 콘텐츠 제작 속도를 높이고 무한한 창의적 가능성을 열어줌으로써 크리에이터들의 생산성을 크게 높여줍니다. 지금 바로 탐색하여 나에게 딱 맞는 도구를 찾아보고, 오늘 바로 창작을 시작해 보세요!

9 도구
xix.ai
만화 창작 시각적 스토리텔링을 위한 최고의 AI 대화 풍선 도구
시각적 스토리텔링을 위한 최고의 AI 대화 풍선 도구

2026년 시각적 스토리텔링을 위한 최신 최고 평점의 AI 대화 풍선 도구가 XIX.AI에 소개됩니다! 이 엄선된 모음집에는 크리에이터들이 생산성을 높이고 창의적인 난관을 극복하는 데 도움을 주는, 강력하고 획기적인 도구들이 포함되어 있습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 실제 테스트 결과를 살펴보며, 최신 순위를 통해 매력적인 시각적 이야기를 만드는 데 꼭 필요한 솔루션을 찾아보세요. 지금 바로 탐색하여 여러분에게 딱 맞는 도구를 발견해 보세요!

10 도구
xix.ai
회의 도우미 최고의 AI 회의 요약 도구: 의사 결정 사항과 후속 조치를 명확하게 추적하세요
최고의 AI 회의 요약 도구: 의사 결정 사항과 후속 조치를 명확하게 추적하세요

2026년 최신 최고 평점을 받은 최고의 AI 회의 요약 도구로, 명확한 의사 결정 추적과 손쉬운 후속 조치를 실현하세요. 이 엄선된 목록은 회의록 자동화, 핵심 실행 과제 파악, 모든 프로젝트에 걸친 팀 협업 효율화를 통해 생산성을 획기적으로 높여주는 강력하고 혁신적인 솔루션을 소개합니다. 무료 버전과 유료 버전의 비교 정보, 실제 사용 후기, 매주 업데이트되는 순위 정보를 통해 여러분에게 딱 맞는 도구를 찾아보세요. 지금 바로 살펴보고 AI의 힘을 경험해 보세요!

9 도구
xix.ai
데이터 분석 최고의 AI 데이터 정제 도구: 누락된 값과 중복 데이터를 신속하게 수정하기
최고의 AI 데이터 정제 도구: 누락된 값과 중복 데이터를 신속하게 수정하기

2026년 최신의 우수하고 높은 평가를 받는 AI 데이터 정제 도구들로, 누락된 값과 중복 데이터를 신속하게 수정할 수 있습니다. 이 선별된 목록에는 생산성을 획기적으로 향상시켜 주는 강력한 솔루션이 포함되어 있습니다. 각 도구는 신뢰성을 보장하기 위해 엄격한 실제 환경 테스트를 거쳤습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 귀하의 요구사항에 가장 적합한 도구를 발견해 보세요. 지금 바로 XIX.AI에서 자세히 알아보시고 AI 분야에서의 경쟁 우위를 확보하세요.

11 도구
xix.ai
의견 (0)
0/500
OR