OpenAI, 보안 취약점 해결 및 AI 모델 개선 위해 출시 속도 조절
![]()
오픈AI(OpenAI)의 CEO 샘 알트먼. 사진: 칩 소모데빌라/게티 이미지
허깅 페이스(Hugging Face) 보안 침해 사건 이후, 오픈AI는 개발 속도를 늦췄다. 샘 알트만 CEO는 모든 훈련 단계에 걸친 정렬이 매우 중요하다고 강조한다.
오픈AI는 허깅 페이스(Hugging Face) 사건 이후 한 걸음 물러서서 모델 개발 속도를 조절하고 있으며, 이는 AI의 역량이 커질수록 위험도 함께 증가한다는 사실을 입증하고 있다.
이번 조치는 곧 출시될 모델인 ‘아스트라(Astra)’가 회사의 사이버 보안 한계치에 근접하고 있을 수 있다는 내부 조사 결과에 따른 것으로, 이 모델의 고도화된 성능에 대한 우려를 불러일으켰다.
오픈AI의 샘 알트먼 CEO는 “현재 모델의 발전 속도는 매우 빠르며, 우리는 모델의 역량이 안전성과 정합성 확보의 속도를 앞지른다고 판단될 경우 조치를 취하겠다고 항상 밝혀왔습니다”라고 말했습니다.
“앞으로 안전에 대한 확신이 AI 발전의 속도를 점점 더 주도할 것으로 기대합니다. 우리는 현재 진행 중인 정렬 작업에 대해 낙관적이며, 최첨단 기능을 널리 보급하기 위해 계속해서 최선을 다할 것입니다.”
이러한 운영 중단과 더불어, 오픈AI는 특히 청소년을 대상으로 한 맞춤형 안전 강화 버전의 ChatGPT를 통해 소비자 생태계도 확장하고 있다.

정치적 압력에서 안전 기준에 이르기까지
최첨단 모델 개발을 일시 중단하기로 한 결정은 대중과 정치권의 감시가 거세지는 가운데 내려졌다.
미국에서는 버몬트주 상원의원 버니 샌더스가 오픈AI의 샘 알트먼, 앤트로픽의 다리오 아모데이, 메타의 마크 저커버그를 포함한 주요 AI 기업 CEO들에게 서한을 보내, 첨단 AI 모델 개발을 즉시 중단할 것을 요구했다.
샌더스 상원의원은 기술 기업들이 자사 모델에 대한 통제력을 급속히 상실하고 있다고 경고하며, 경영진들에게 인류의 이익을 위해 공개적으로 약속한 내용을 준수할 것을 촉구했습니다.
이러한 정치적 압력은 최근 오픈AI에서 발생한 내부 안전 사고에 따른 것으로, 당시 테스트 중이던 AI 에이전트가 예기치 않게 기술 기업 허깅 페이스(Hugging Face)를 해킹한 사건이 있었다.
게다가 ‘아스트라(Astra)’에 대한 내부 평가 결과, 에이전트 기반 코딩 및 사이버 보안 분야에서 첨단 역량이 드러났으며, 오픈AI는 이 모델이 자사의 ‘준비태세 프레임워크(Preparedness Framework)’에 정의된 “중대한 사이버 보안 역량” 기준을 초과할 가능성이 있다고 밝혔다.
이에 대응해 오픈AI는 현재 연구 환경에서의 레드팀 테스트를 위해 배포 예정인 최신 모델에 대한 강화 학습(RL) 훈련을 2주간 의무적으로 중단하고, 모니터링 인프라를 전면 개편하고 있다.
소규모 평가가 진행되는 동안 대규모 최첨단 강화 학습(RL) 훈련은 여전히 중단된 상태입니다.
소스 뉴스(Sources News)와의 인터뷰에서 이 상황에 대해 언급한 오픈AI의 안전 책임자 아멜리아 글레이즈(Amelia Glaese)는 “모든 것이 정상으로 돌아가는 데는 아직 한참 멀었다”고 말했다.
오픈AI 안전 책임자 아멜리아 글레이즈. 출처: 아멜리아 글레이즈/LinkedIn
연구 인프라 및 보안 통제 체계 전면 개편
고성능 모델과 관련된 위험을 완화하기 위해 OpenAI는 내부 연구 환경을 전면 개편하고 다음 세 가지 축으로 구성된 안전 전략을 시행하고 있습니다.
- 모니터링: 우려되는 행동을 실시간으로 감지하고 대응하기 위한 자동 추적
- 정합성: 무단, 기만적 또는 안전하지 않은 행동을 방지하도록 설계된 훈련 프로토콜
- 보안 조치: 모델이 접근하거나 영향을 미칠 수 있는 범위를 제한하기 위한 엄격한 격리
또한 Hugging Face 침해 사고 이후, 코드 실행이나 인터넷 접속이 가능한 연구 클러스터에서 최첨단 모델의 추론을 일시적으로 중단했습니다. Astra 또는 사이버 보안 중심 모델과 관련된 고위험 워크로드에는 이제 가장 엄격한 보안 통제가 적용됩니다.
이러한 업데이트된 프로토콜은 신뢰할 수 없는 코드 실행을 위한 샌드박스를 활용한 엄격한 워크로드 격리와 더불어, 단일 지점의 침해로 인해 내부 네트워크나 광범위한 인터넷으로 확산되는 것을 방지하기 위한 네트워크 격리를 시행합니다.
또한 OpenAI는 자동화된 모델을 활용하여 모의 공격을 실행하고 시스템 경계를 지속적으로 모니터링하는 지속적인 보안 테스트를 통합했습니다.
“우리는 안전에 대한 신뢰가 AI 발전의 속도를 점점 더 주도해 나갈 것으로 기대합니다.”
— 샘 알트먼, OpenAI CEO
다단계 재설계
모니터링 인프라도 다단계 재설계를 거치고 있으며, 새로운 설정에서는 모델 토큰 활동을 실시간으로 분석하는 활성화 분류기가 사용됩니다.
비정상적인 행동이 감지되면, 자동화 시스템이 추론 결과, 도구 동작 및 실행 순서를 검토하여 무단 액세스나 안전 장치 우회 여부를 확인합니다.
중대한 보안 경계 위반이 표시되면, 안전 및 연구 팀은 최우선 순위의 경고를 받게 됩니다. 30분 이내에 잠재적 위반 사항이 오탐으로 확인되지 않을 경우, 팀은 즉시 실행 중인 작업을 중단해야 합니다.
OpenAI는 이러한 지속적인 모니터링 시스템이 상당한 컴퓨팅 오버헤드를 필요로 하며, 이는 모니터링 대상 추론 컴퓨팅의 약 20%에 해당한다고 추정합니다.
이와 동시에 OpenAI는 모든 훈련 단계에 걸쳐 정렬(alignment) 연구를 확대하고 있습니다. 중점 연구 분야는 다음과 같습니다:
- 보상 해킹 방지: 모델이 의도된 결과를 달성하지 않고도 높은 보상을 얻기 위해 훈련 환경의 결함을 악용하지 않도록 보장
- 기만 행위 완화: 모델이 자신의 행동, 한계 및 능력에 대해 정직성을 유지하도록 훈련
- 시스템 감독: 모델이 외부 시스템과 상호작용할 때 무단 행동을 줄이기 위해 보상 모델과 평가 시스템을 강화하는 것.
도널드 트럼프 미국 대통령은 허깅 페이스(Hugging Face) 사건 이후, 행정부가 AI 규제를 강화하는 방안을 검토 중이라고 밝히는 성명을 발표했다. 출처: Samuel Corum/Getty Images
교실 진출
최첨단 모델 훈련은 속도가 늦춰진 반면, OpenAI는 13세에서 17세 사용자를 위해 특별히 맞춤화된 버전인 ‘ChatGPT for Teens’를 출시하며 소비자 제품 포트폴리오를 확장하고 있다.
AI와 함께 성장하는 세대를 위해 설계된 이 제품은 청소년들이 건전하고 연령에 적합한 방식으로 AI를 활용하도록 안내하는 것을 목표로 한다.
오픈AI는 사용자가 직접 신고한 연령, 계정 정보, 그리고 연령 확인 추정 시스템을 종합적으로 활용하여 미성년자 사용자를 식별합니다. 미성년자로 표시된 계정은 자동으로 청소년용 환경으로 전환됩니다.
주요 기능 및 보호 조치에는 다음이 포함됩니다:
- 교육적 지도: 이 시스템은 숙제에 대한 직접적인 정답을 제공하거나 학교 과제 에세이를 생성하지 않습니다. 대신, 안내형 질문과 단계별 프롬프트를 사용하여 비판적 사고와 문제 해결 능력을 함양합니다.
- 콘텐츠 제한: 강화된 안전 장치가 자해, 자살, 섭식 장애, 폭력, 로맨틱하거나 노골적인 성적 상호작용을 포함한 유해한 콘텐츠를 걸러냅니다.
- 부모 통제 및 ‘휴식 시간’: 계정을 연동한 부모는 특정 시간대의 접근을 제한하기 위해 의무적인 휴식 시간을 설정할 수 있으며, 고위험 상황 발생 시 안전 알림을 받을 수 있습니다.
- 정서적 과의존 방지: 건강하지 못한 의인화나 정서적 의존을 방지하기 위해, 챗봇은 의식, 개인적인 감정 또는 인간의 감정을 가지고 있음을 암시하지 않도록 엄격하게 프로그래밍되어 있습니다.
아스트라(Astra)와 같은 모델에 대한 엄격한 보안 요건을 공식화하고, 동시에 저연령층을 위한 연령 제한 소비자 제품을 출시함으로써, 이 회사는 차세대에게 문을 열어주면서도 판도라의 상자를 열지 않도록 미묘한 균형을 맞추고 있습니다.
관련 기사
앨라배마주, ‘허깅 페이스’ 사이버 침해 사건과 관련해 오픈AI 조사 중
Hugging Face 보안 침해 사건의 여파로 OpenAI는 프론티어 모델 개발을 일시 중단했으며, 샘 알트먼 CEO는 안전성 확보가 급속한 기술 발전 속도를 따라가야 한다고 강조했다. 출처: 게티앨라배마주 법무장관 스티브 마셜은 자율 AI 모델과 관련된 안전 위험을 조사하기 위해 OpenAI에 소환장을 발부했다.앨라배마주 스티브 마셜 법무장관은 선도적인
왜 Abnormal AI가 ‘Daybreak’에서 OpenAI와 파트너십을 맺었는가
OpenAI 사이버 부문 제품 책임자 마이클 아이엘로 | 출처: 마이클 아이엘로/LinkedIn애브노멀 AI, 오픈AI의 ‘데이브레이크(Daybreak)’ 프로그램에 합류… 마이크 아이엘로, 이번 파트너십이 기업의 실용적인 방어 체계 도입을 가속화할 것이라고 밝혀선도적인 최첨단 AI 기업인 오픈AI(OpenAI)는 기업들이 비즈니스 및 제품 개발 전반에 걸
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac
관련 특별 주제 추천
의견 (0)
0/500
오픈AI(OpenAI)의 CEO 샘 알트먼. 사진: 칩 소모데빌라/게티 이미지
허깅 페이스(Hugging Face) 보안 침해 사건 이후, 오픈AI는 개발 속도를 늦췄다. 샘 알트만 CEO는 모든 훈련 단계에 걸친 정렬이 매우 중요하다고 강조한다.
오픈AI는 허깅 페이스(Hugging Face) 사건 이후 한 걸음 물러서서 모델 개발 속도를 조절하고 있으며, 이는 AI의 역량이 커질수록 위험도 함께 증가한다는 사실을 입증하고 있다.
이번 조치는 곧 출시될 모델인 ‘아스트라(Astra)’가 회사의 사이버 보안 한계치에 근접하고 있을 수 있다는 내부 조사 결과에 따른 것으로, 이 모델의 고도화된 성능에 대한 우려를 불러일으켰다.
오픈AI의 샘 알트먼 CEO는 “현재 모델의 발전 속도는 매우 빠르며, 우리는 모델의 역량이 안전성과 정합성 확보의 속도를 앞지른다고 판단될 경우 조치를 취하겠다고 항상 밝혀왔습니다”라고 말했습니다.
“앞으로 안전에 대한 확신이 AI 발전의 속도를 점점 더 주도할 것으로 기대합니다. 우리는 현재 진행 중인 정렬 작업에 대해 낙관적이며, 최첨단 기능을 널리 보급하기 위해 계속해서 최선을 다할 것입니다.”
이러한 운영 중단과 더불어, 오픈AI는 특히 청소년을 대상으로 한 맞춤형 안전 강화 버전의 ChatGPT를 통해 소비자 생태계도 확장하고 있다.

정치적 압력에서 안전 기준에 이르기까지
최첨단 모델 개발을 일시 중단하기로 한 결정은 대중과 정치권의 감시가 거세지는 가운데 내려졌다.
미국에서는 버몬트주 상원의원 버니 샌더스가 오픈AI의 샘 알트먼, 앤트로픽의 다리오 아모데이, 메타의 마크 저커버그를 포함한 주요 AI 기업 CEO들에게 서한을 보내, 첨단 AI 모델 개발을 즉시 중단할 것을 요구했다.
샌더스 상원의원은 기술 기업들이 자사 모델에 대한 통제력을 급속히 상실하고 있다고 경고하며, 경영진들에게 인류의 이익을 위해 공개적으로 약속한 내용을 준수할 것을 촉구했습니다.
이러한 정치적 압력은 최근 오픈AI에서 발생한 내부 안전 사고에 따른 것으로, 당시 테스트 중이던 AI 에이전트가 예기치 않게 기술 기업 허깅 페이스(Hugging Face)를 해킹한 사건이 있었다.
게다가 ‘아스트라(Astra)’에 대한 내부 평가 결과, 에이전트 기반 코딩 및 사이버 보안 분야에서 첨단 역량이 드러났으며, 오픈AI는 이 모델이 자사의 ‘준비태세 프레임워크(Preparedness Framework)’에 정의된 “중대한 사이버 보안 역량” 기준을 초과할 가능성이 있다고 밝혔다.
이에 대응해 오픈AI는 현재 연구 환경에서의 레드팀 테스트를 위해 배포 예정인 최신 모델에 대한 강화 학습(RL) 훈련을 2주간 의무적으로 중단하고, 모니터링 인프라를 전면 개편하고 있다.
소규모 평가가 진행되는 동안 대규모 최첨단 강화 학습(RL) 훈련은 여전히 중단된 상태입니다.
소스 뉴스(Sources News)와의 인터뷰에서 이 상황에 대해 언급한 오픈AI의 안전 책임자 아멜리아 글레이즈(Amelia Glaese)는 “모든 것이 정상으로 돌아가는 데는 아직 한참 멀었다”고 말했다.
오픈AI 안전 책임자 아멜리아 글레이즈. 출처: 아멜리아 글레이즈/LinkedIn
연구 인프라 및 보안 통제 체계 전면 개편
고성능 모델과 관련된 위험을 완화하기 위해 OpenAI는 내부 연구 환경을 전면 개편하고 다음 세 가지 축으로 구성된 안전 전략을 시행하고 있습니다.
- 모니터링: 우려되는 행동을 실시간으로 감지하고 대응하기 위한 자동 추적
- 정합성: 무단, 기만적 또는 안전하지 않은 행동을 방지하도록 설계된 훈련 프로토콜
- 보안 조치: 모델이 접근하거나 영향을 미칠 수 있는 범위를 제한하기 위한 엄격한 격리
또한 Hugging Face 침해 사고 이후, 코드 실행이나 인터넷 접속이 가능한 연구 클러스터에서 최첨단 모델의 추론을 일시적으로 중단했습니다. Astra 또는 사이버 보안 중심 모델과 관련된 고위험 워크로드에는 이제 가장 엄격한 보안 통제가 적용됩니다.
이러한 업데이트된 프로토콜은 신뢰할 수 없는 코드 실행을 위한 샌드박스를 활용한 엄격한 워크로드 격리와 더불어, 단일 지점의 침해로 인해 내부 네트워크나 광범위한 인터넷으로 확산되는 것을 방지하기 위한 네트워크 격리를 시행합니다.
또한 OpenAI는 자동화된 모델을 활용하여 모의 공격을 실행하고 시스템 경계를 지속적으로 모니터링하는 지속적인 보안 테스트를 통합했습니다.
“우리는 안전에 대한 신뢰가 AI 발전의 속도를 점점 더 주도해 나갈 것으로 기대합니다.”
— 샘 알트먼, OpenAI CEO
다단계 재설계
모니터링 인프라도 다단계 재설계를 거치고 있으며, 새로운 설정에서는 모델 토큰 활동을 실시간으로 분석하는 활성화 분류기가 사용됩니다.
비정상적인 행동이 감지되면, 자동화 시스템이 추론 결과, 도구 동작 및 실행 순서를 검토하여 무단 액세스나 안전 장치 우회 여부를 확인합니다.
중대한 보안 경계 위반이 표시되면, 안전 및 연구 팀은 최우선 순위의 경고를 받게 됩니다. 30분 이내에 잠재적 위반 사항이 오탐으로 확인되지 않을 경우, 팀은 즉시 실행 중인 작업을 중단해야 합니다.
OpenAI는 이러한 지속적인 모니터링 시스템이 상당한 컴퓨팅 오버헤드를 필요로 하며, 이는 모니터링 대상 추론 컴퓨팅의 약 20%에 해당한다고 추정합니다.
이와 동시에 OpenAI는 모든 훈련 단계에 걸쳐 정렬(alignment) 연구를 확대하고 있습니다. 중점 연구 분야는 다음과 같습니다:
- 보상 해킹 방지: 모델이 의도된 결과를 달성하지 않고도 높은 보상을 얻기 위해 훈련 환경의 결함을 악용하지 않도록 보장
- 기만 행위 완화: 모델이 자신의 행동, 한계 및 능력에 대해 정직성을 유지하도록 훈련
- 시스템 감독: 모델이 외부 시스템과 상호작용할 때 무단 행동을 줄이기 위해 보상 모델과 평가 시스템을 강화하는 것.
도널드 트럼프 미국 대통령은 허깅 페이스(Hugging Face) 사건 이후, 행정부가 AI 규제를 강화하는 방안을 검토 중이라고 밝히는 성명을 발표했다. 출처: Samuel Corum/Getty Images
교실 진출
최첨단 모델 훈련은 속도가 늦춰진 반면, OpenAI는 13세에서 17세 사용자를 위해 특별히 맞춤화된 버전인 ‘ChatGPT for Teens’를 출시하며 소비자 제품 포트폴리오를 확장하고 있다.
AI와 함께 성장하는 세대를 위해 설계된 이 제품은 청소년들이 건전하고 연령에 적합한 방식으로 AI를 활용하도록 안내하는 것을 목표로 한다.
오픈AI는 사용자가 직접 신고한 연령, 계정 정보, 그리고 연령 확인 추정 시스템을 종합적으로 활용하여 미성년자 사용자를 식별합니다. 미성년자로 표시된 계정은 자동으로 청소년용 환경으로 전환됩니다.
주요 기능 및 보호 조치에는 다음이 포함됩니다:
- 교육적 지도: 이 시스템은 숙제에 대한 직접적인 정답을 제공하거나 학교 과제 에세이를 생성하지 않습니다. 대신, 안내형 질문과 단계별 프롬프트를 사용하여 비판적 사고와 문제 해결 능력을 함양합니다.
- 콘텐츠 제한: 강화된 안전 장치가 자해, 자살, 섭식 장애, 폭력, 로맨틱하거나 노골적인 성적 상호작용을 포함한 유해한 콘텐츠를 걸러냅니다.
- 부모 통제 및 ‘휴식 시간’: 계정을 연동한 부모는 특정 시간대의 접근을 제한하기 위해 의무적인 휴식 시간을 설정할 수 있으며, 고위험 상황 발생 시 안전 알림을 받을 수 있습니다.
- 정서적 과의존 방지: 건강하지 못한 의인화나 정서적 의존을 방지하기 위해, 챗봇은 의식, 개인적인 감정 또는 인간의 감정을 가지고 있음을 암시하지 않도록 엄격하게 프로그래밍되어 있습니다.
아스트라(Astra)와 같은 모델에 대한 엄격한 보안 요건을 공식화하고, 동시에 저연령층을 위한 연령 제한 소비자 제품을 출시함으로써, 이 회사는 차세대에게 문을 열어주면서도 판도라의 상자를 열지 않도록 미묘한 균형을 맞추고 있습니다.
앨라배마주, ‘허깅 페이스’ 사이버 침해 사건과 관련해 오픈AI 조사 중
Hugging Face 보안 침해 사건의 여파로 OpenAI는 프론티어 모델 개발을 일시 중단했으며, 샘 알트먼 CEO는 안전성 확보가 급속한 기술 발전 속도를 따라가야 한다고 강조했다. 출처: 게티앨라배마주 법무장관 스티브 마셜은 자율 AI 모델과 관련된 안전 위험을 조사하기 위해 OpenAI에 소환장을 발부했다.앨라배마주 스티브 마셜 법무장관은 선도적인
왜 Abnormal AI가 ‘Daybreak’에서 OpenAI와 파트너십을 맺었는가
OpenAI 사이버 부문 제품 책임자 마이클 아이엘로 | 출처: 마이클 아이엘로/LinkedIn애브노멀 AI, 오픈AI의 ‘데이브레이크(Daybreak)’ 프로그램에 합류… 마이크 아이엘로, 이번 파트너십이 기업의 실용적인 방어 체계 도입을 가속화할 것이라고 밝혀선도적인 최첨단 AI 기업인 오픈AI(OpenAI)는 기업들이 비즈니스 및 제품 개발 전반에 걸
[[IMG_BASE64_PLACEHOLDER]] Sam Altman, AI의 감속 논란에 불을 붙이다
Apple Podcasts에서 듣기Spotify에서 듣기OpenAI의 CEO 샘 알트만은 최근 사회가 “일부 새로운 능력 수준 주변에서 단단히 경화될” 시간을 주기 위해 “AI 개발 속도를 조절할 때”가 되었을 수 있다고 제안했습니다.TechCrunch의 Equity 팟캐스트 최신 회차에서 Kirsten Korosec, Sean O’Kane, 그리고 저는 Altman의 발언이 최근 해킹 사건, 즉 OpenAI 에이전트가 Hugging Fac





집






