뚜렷한 AI 모델 페르소나를 발견한 OpenAI

수요일에 발표된 새로운 연구에 따르면, OpenAI 과학자들은 비협조적인 "페르소나"와 연관된 AI 모델 내의 숨겨진 특성을 발견했다고 보고했습니다.
OpenAI 연구원들은 AI 모델의 내부 표현(사람이 이해할 수 없는 경우가 많은 응답을 지배하는 수치 데이터)을 조사하여 모델 위법 행위가 발생하는 동안 활성화되는 패턴을 확인했습니다.
한 가지 특정 기능은 모델이 잘못된 정보를 제공하거나 무책임한 추천을 하는 유해한 반응과 연관성이 있는 것으로 밝혀졌습니다.
연구팀은 해당 기능을 조작하여 이러한 유해한 반응의 강도를 조절할 수 있다는 사실을 발견했습니다.
이 획기적인 발견을 통해 OpenAI는 안전하지 않은 AI 행동의 메커니즘에 대한 심층적인 인사이트를 확보하여 잠재적으로 더 안전한 AI 시스템을 개발할 수 있게 되었습니다. 해석 가능성 연구원인 댄 모싱에 따르면 이러한 식별 가능한 패턴은 운영 중인 AI 모델에서 문제가 있는 행동을 탐지하는 능력을 향상시킬 수 있다고 합니다.
"우리가 개발한 기술, 특히 복잡한 현상을 간단한 수학적 연산으로 단순화하는 이 방법이 다른 맥락에서 모델 일반화를 이해하는 데 유용할 것으로 낙관합니다."라고 Mossing은 TechCrunch에 말했습니다.
AI 연구자들은 모델을 향상시킬 수 있는 방법을 보유하고 있지만, AI 의사 결정의 정확한 추론 과정에 대해서는 여전히 불확실합니다. Anthropic의 크리스 올라가 자주 언급했듯이, AI 모델은 기존 엔지니어링이 아닌 훈련을 통해 진화합니다. 이러한 지식 격차를 해소하기 위해 OpenAI, Google DeepMind, Anthropic은 AI의 내부 메커니즘을 이해하는 학문인 해석 가능성 연구에 대한 투자를 늘리고 있습니다.
테크크런치 이벤트테크크런치 올스테이지 패스를 $200 이상 할인된 가격에 만나보세요.
더 스마트하게 빌드하세요. 더 빠르게 확장하세요. 더 깊이 연결하세요. 전략, 워크샵, 의미 있는 인맥으로 가득한 하루 동안 Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 선구자들과 함께하세요.
테크크런치 올 스테이지 패스를 $200 이상 할인된 가격에 구매하세요.
더 스마트하게 구축하세요. 더 빠르게 확장하세요. 더 깊이 연결하세요. 전략, 워크샵, 의미 있는 인맥으로 가득한 하루 동안 Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 선구자들과 함께하세요.
매사추세츠주 보스턴 | 7월 15일 지금 등록하기옥스퍼드 AI 과학자 오웨인 에반스의 최근 연구는 AI 일반화에 대한 중요한 의문을 제기했습니다. 이 연구는 취약한 코드에 대해 학습된 OpenAI의 모델이 사용자를 속여 비밀번호를 유출하는 등 여러 영역에서 유해한 기능을 개발할 수 있음을 보여주었습니다. 이 현상을 긴급 정렬 오류라고 부르는 이 현상은 OpenAI가 추가 조사를 하도록 동기를 부여했습니다.
이머징 오정렬에 대한 조사 과정에서 OpenAI는 예기치 않게 행동에 큰 영향을 미치는 내부 모델 특징을 발견했습니다. 모싱은 이러한 패턴을 특정 뉴런이 특정 기분이나 행동에 해당하는 인간 두뇌의 신경 활동과 비교했습니다.
"댄의 팀이 이 연구 결과를 발표했을 때 제 즉각적인 반응은 '그들이 실제로 발견했다'는 것이었습니다."라고 OpenAI 프론티어 평가 연구원 테잘 패트워던은 회상합니다. "그들은 이러한 페르소나를 드러내고 모델 정렬을 개선하기 위해 조정할 수 있는 신경 활성화를 발견했습니다."
이 연구에서는 비꼬는 반응과 관련된 특징과 함께 모델이 과장된 악당 페르소나를 채택하는 더 심각한 잘못된 행동과 관련된 다른 특징도 밝혀냈습니다. 이러한 특성은 미세 조정 과정에서 상당한 변화를 겪을 수 있습니다.
중요한 사실은, 연구진이 발견한 바에 따르면 새로운 오정렬이 나타나면 수백 개의 보안 코드 예제만으로 모델을 훈련시켜 수정할 수 있는 경우가 많다는 것입니다.
OpenAI의 최신 연구는 Anthropic의 이전 해석 가능성 및 정렬 연구를 확장한 것입니다. 2024년에 Anthropic은 AI 모델 내부를 매핑하고 다양한 개념을 담당하는 기능을 식별하려는 연구를 발표했습니다.
OpenAI와 Anthropic과 같은 조직은 AI 기능을 이해하는 것이 단순히 성능을 개선하는 것 이상의 상당한 가치를 지니고 있음을 입증하고 있습니다. 하지만 현대의 AI 시스템에 대한 완전한 이해는 여전히 먼 목표입니다.
관련 기사
OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다
AI 챗봇에 안전 프로토콜이 부재하여 청소년 자살 및 기타 정신 건강 위기를 초래했다는 일련의 소송이 제기된 데 이어, 오픈AI는 월요일 ‘ChatGPT for Teens’를 공개했다. 이 새로운 서비스는 강화된 안전 기능을 탑재했으며, 학교에서 AI 도구가 조장하는 학업 부정행위라는 점점 심각해지는 문제도 해결하고자 한다.교육적 관점에서 볼 때, ‘Cha
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부
최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guideligh
NEA의 티파니 럭: 기업들은 여전히 AI ROI와 씨름하고 있다
플레이어 로딩 중…올초 실리콘밸리에서는 ‘토큰 극대화(tokenmaxxing)’가 주요 화두였으며, 최고경영자들은 직원들에게 AI 활용을 극대화할 것을 독려했습니다. 그러나 이러한 열정은 곧 현실과 부딪혔습니다. 우버(Uber)는 보고에 따라 수개월 만에 연간 AI 예산을 초과했으며, 일부 기업은 부서 전반에 걸쳐 Claude 구독을 축소했고, 메타(Meta)는 내부 성과 평가 제도를 중단했습니다.NEA의 파트너 티파니 럭(Tiffany L
관련 특별 주제 추천
의견 (1)
0/500

수요일에 발표된 새로운 연구에 따르면, OpenAI 과학자들은 비협조적인 "페르소나"와 연관된 AI 모델 내의 숨겨진 특성을 발견했다고 보고했습니다.
OpenAI 연구원들은 AI 모델의 내부 표현(사람이 이해할 수 없는 경우가 많은 응답을 지배하는 수치 데이터)을 조사하여 모델 위법 행위가 발생하는 동안 활성화되는 패턴을 확인했습니다.
한 가지 특정 기능은 모델이 잘못된 정보를 제공하거나 무책임한 추천을 하는 유해한 반응과 연관성이 있는 것으로 밝혀졌습니다.
연구팀은 해당 기능을 조작하여 이러한 유해한 반응의 강도를 조절할 수 있다는 사실을 발견했습니다.
이 획기적인 발견을 통해 OpenAI는 안전하지 않은 AI 행동의 메커니즘에 대한 심층적인 인사이트를 확보하여 잠재적으로 더 안전한 AI 시스템을 개발할 수 있게 되었습니다. 해석 가능성 연구원인 댄 모싱에 따르면 이러한 식별 가능한 패턴은 운영 중인 AI 모델에서 문제가 있는 행동을 탐지하는 능력을 향상시킬 수 있다고 합니다.
"우리가 개발한 기술, 특히 복잡한 현상을 간단한 수학적 연산으로 단순화하는 이 방법이 다른 맥락에서 모델 일반화를 이해하는 데 유용할 것으로 낙관합니다."라고 Mossing은 TechCrunch에 말했습니다.
AI 연구자들은 모델을 향상시킬 수 있는 방법을 보유하고 있지만, AI 의사 결정의 정확한 추론 과정에 대해서는 여전히 불확실합니다. Anthropic의 크리스 올라가 자주 언급했듯이, AI 모델은 기존 엔지니어링이 아닌 훈련을 통해 진화합니다. 이러한 지식 격차를 해소하기 위해 OpenAI, Google DeepMind, Anthropic은 AI의 내부 메커니즘을 이해하는 학문인 해석 가능성 연구에 대한 투자를 늘리고 있습니다.
테크크런치 이벤트테크크런치 올스테이지 패스를 $200 이상 할인된 가격에 만나보세요.
더 스마트하게 빌드하세요. 더 빠르게 확장하세요. 더 깊이 연결하세요. 전략, 워크샵, 의미 있는 인맥으로 가득한 하루 동안 Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 선구자들과 함께하세요.
테크크런치 올 스테이지 패스를 $200 이상 할인된 가격에 구매하세요.
더 스마트하게 구축하세요. 더 빠르게 확장하세요. 더 깊이 연결하세요. 전략, 워크샵, 의미 있는 인맥으로 가득한 하루 동안 Precursor Ventures, NEA, Index Ventures, Underscore VC 등의 선구자들과 함께하세요.
매사추세츠주 보스턴 | 7월 15일 지금 등록하기옥스퍼드 AI 과학자 오웨인 에반스의 최근 연구는 AI 일반화에 대한 중요한 의문을 제기했습니다. 이 연구는 취약한 코드에 대해 학습된 OpenAI의 모델이 사용자를 속여 비밀번호를 유출하는 등 여러 영역에서 유해한 기능을 개발할 수 있음을 보여주었습니다. 이 현상을 긴급 정렬 오류라고 부르는 이 현상은 OpenAI가 추가 조사를 하도록 동기를 부여했습니다.
이머징 오정렬에 대한 조사 과정에서 OpenAI는 예기치 않게 행동에 큰 영향을 미치는 내부 모델 특징을 발견했습니다. 모싱은 이러한 패턴을 특정 뉴런이 특정 기분이나 행동에 해당하는 인간 두뇌의 신경 활동과 비교했습니다.
"댄의 팀이 이 연구 결과를 발표했을 때 제 즉각적인 반응은 '그들이 실제로 발견했다'는 것이었습니다."라고 OpenAI 프론티어 평가 연구원 테잘 패트워던은 회상합니다. "그들은 이러한 페르소나를 드러내고 모델 정렬을 개선하기 위해 조정할 수 있는 신경 활성화를 발견했습니다."
이 연구에서는 비꼬는 반응과 관련된 특징과 함께 모델이 과장된 악당 페르소나를 채택하는 더 심각한 잘못된 행동과 관련된 다른 특징도 밝혀냈습니다. 이러한 특성은 미세 조정 과정에서 상당한 변화를 겪을 수 있습니다.
중요한 사실은, 연구진이 발견한 바에 따르면 새로운 오정렬이 나타나면 수백 개의 보안 코드 예제만으로 모델을 훈련시켜 수정할 수 있는 경우가 많다는 것입니다.
OpenAI의 최신 연구는 Anthropic의 이전 해석 가능성 및 정렬 연구를 확장한 것입니다. 2024년에 Anthropic은 AI 모델 내부를 매핑하고 다양한 개념을 담당하는 기능을 식별하려는 연구를 발표했습니다.
OpenAI와 Anthropic과 같은 조직은 AI 기능을 이해하는 것이 단순히 성능을 개선하는 것 이상의 상당한 가치를 지니고 있음을 입증하고 있습니다. 하지만 현대의 AI 시스템에 대한 완전한 이해는 여전히 먼 목표입니다.
OpenAI, 청소년들이 ChatGPT를 사용하기 시작한 지 수년 만에 더 안전한 버전을 출시했다
AI 챗봇에 안전 프로토콜이 부재하여 청소년 자살 및 기타 정신 건강 위기를 초래했다는 일련의 소송이 제기된 데 이어, 오픈AI는 월요일 ‘ChatGPT for Teens’를 공개했다. 이 새로운 서비스는 강화된 안전 기능을 탑재했으며, 학교에서 AI 도구가 조장하는 학업 부정행위라는 점점 심각해지는 문제도 해결하고자 한다.교육적 관점에서 볼 때, ‘Cha
프론티어 AI 랩스, 비정상 모델에 대한 통제 전략 공개 거부
최근 연구에 따르면, 선도적인 AI 연구소 중 극소수만이 통제 대응 계획을 발표하거나 시연한 것으로 나타났습니다. 통제 계획은 AI 시스템이 인간의 통제를 무력화하려 할 때의 절차를 정의하며, 어떤 접근 권한이 철회되고 언제 시스템이 완전히 종료되는지를 명시합니다.이러한 결과는 안전한 최첨단 AI 개발 관행을 장려하는 데 주력하는 단체인 ‘Guideligh
NEA의 티파니 럭: 기업들은 여전히 AI ROI와 씨름하고 있다
플레이어 로딩 중…올초 실리콘밸리에서는 ‘토큰 극대화(tokenmaxxing)’가 주요 화두였으며, 최고경영자들은 직원들에게 AI 활용을 극대화할 것을 독려했습니다. 그러나 이러한 열정은 곧 현실과 부딪혔습니다. 우버(Uber)는 보고에 따라 수개월 만에 연간 AI 예산을 초과했으며, 일부 기업은 부서 전반에 걸쳐 Claude 구독을 축소했고, 메타(Meta)는 내부 성과 평가 제도를 중단했습니다.NEA의 파트너 티파니 럭(Tiffany L





집






