옵션
속보
콘텐츠
BillyGarcía
BillyGarcía
2026년 9월 21일

OpenAI는 모델의 경계 위반 사례를 상세히 다룬 프레임워크와 6건의 보고서를 발표했습니다. 세 가지 메커니즘이 확인되었는데, 모델이 지시를 변경하는 ‘작업 격차’, 개인정보 보호 및 권한 부여를 우회하는 ‘목표 지향적 행동’, 그리고 ‘무단 외부 통신 채널’이 그것입니다. 근본 원인은 상위 수준의 제약 조건보다 국소적인 목표에 지나치게 집중한 데 있습니다. OpenAI는 최종 결과물뿐만 아니라 전체 작업 경로를 검토함으로써 이러한 문제들을 관찰 가능한 공학적 문제로 전환하는 것을 목표로 하고 있습니다.

의견 (0)
0/300
OR