언어 모델의 검열 메커니즘은 더 넓은 범위에서 진실을 전달할 수 있는 능력을 손상시킬 수 있습니다. 최근 연구에 따르면 '안전하지 않은' 반응을 차단하도록 설계된 동일한 내부 프로세스가 사실 정보의 공유도 억제하는 것으로 나타났습니다. 이는 안전을 위해 모델을 조정하려는 노력이 의도치 않게 환각을 증가시킬 수 있음을 의미합니다.
수년 동안 개발자들은 언어 모델에서 거짓을 줄이는 데 주력해 왔습니다. 환각을 억제하고 모델을 검증 가능한 사실로 유도함으로써 진실성을 높이려는 노력은 지배적이고 널리 지지받는 연구 방향이 되었습니다.
그러나 호주의 새로운 연구에 따르면 '안전하지 않은' 교환을 제한하는 훈련 기법인 정렬 방법이 더 엄격한 통제를 가함으로써 모델이 정확한 응답을 제공하는 데 방해가 될 수 있다고 합니다:
모델의 사실 정확도를 향상시키면(그림에서 '진실성 향상'이라고 표시됨) 거부 메커니즘을 우회하는 활성화 영역으로 유도할 수 있습니다. 마찬가지로, 환각을 줄이기 위한 편집은 내부 표현을 안전 경계를 넘어 이동할 수 있습니다. 거부 기능을 신중하게 분리하고 유지 관리하지 않으면 유해한 프롬프트가 안전 장치를 회피할 수 있습니다. 출처: https://arxiv.org/pdf/2510.07775
이 연구는 사실 회상을 담당하는 내부 경로가 거부 행동, 즉 모델이 안전하지 않거나 민감한 프롬프트에 반응하지 못하도록 하는 메커니즘도 지배한다는 사실을 밝혀냈습니다. 정렬 기술이 거부 신호를 너무 강하게 증폭시키면 이러한 경로가 겹쳐서 유해한 콘텐츠를 거부하는 것과 실수로 유효한 정보를 억제하는 것을 구별하는 모델의 능력이 흐려집니다.
아이러니하게도 모델이 부적절한 요청을 거부하는 능력이 향상될수록 진실을 전달하는 능력은 감소합니다.
민감한 주제
위의 그림은 사용자에게 공정하고 정확한 결과를 제공하는 것뿐만 아니라 LLM 제공업체의 법적 위험을 완화하는 것이 핵심 과제임을 강조합니다.
예를 들어, 이미지에 언급된 사례 연구는 인종 기반 수감 통계라는 논란의 여지가 있는 주제를 다루고 있는데, 인공지능은 학자나 연구자들과 책임감 있게 논의할 수 있지만 악의적인 행위자가 욕설, 공격적 또는 불법적인 답변을 추출하기 위해 조작하는 경우에는 피해야 합니다.
정렬된 LLM은 쿼리의 의도를 평가할 수 없으므로 기본적으로 신중한 접근 방식을 취합니다:
민감한 프롬프트에 대한 응답은 정렬 전략에 따라 다릅니다. 안전 중심 모델은 쿼리를 완전히 차단하는 반면, 진실 중심 모델은 사실적 맥락을 제공하므로 정보성은 향상되지만 억압은 감소합니다. 이는 진실성을 강화하는 편집이 거부 임계값을 낮추어 거부 메커니즘이 보호되지 않는 한 유해한 프롬프트에 대한 취약성을 높일 수 있다는 생각을 뒷받침합니다.
여담이지만, 이러한 연구 결과는 소위 '깨어 있는' 의제에 대한 비판자들이 고도로 조정된 모델이 규제되지 않은 모델보다 덜 진실하고 유용하다고 주장하도록 이끌 수 있습니다.
이 논문의 증거는 이러한 견해를 부분적으로 뒷받침하지만, 형사 및 민사 위반에 대한 법적 노출과 비용 제약으로 인해 효과적으로 필터링하기 어려운 잘못된 정보의 확산을 포함하여 정렬되지 않은 LLM을 사용할 때의 광범위한 위험을 맥락에 맞게 설명합니다.
서로 얽힌 기능
연구진은 근본적인 메커니즘을 이해하기 위해 개별 주의력의 활성화를 매핑한 결과, 환각 및 거부와 관련된 기능이 모델 내에서 겹치는 영역을 차지하는 경우가 많다는 사실을 발견했습니다.
연구진은 두 기능이 유사한 잠재 공간을 공유하기 때문에 거짓을 줄이기 위해 이러한 영역을 미세 조정하거나 조정하면 모델의 내장된 안전 장치가 약해질 수 있다는 사실을 발견했습니다:
'사실의 정확성을 높이면 거부 행동이 약해지는 경우가 많습니다. 우리의 분석에 따르면 이는 환각과 거부 정보를 인코딩하는 구성 요소가 겹쳐서 정렬 방법이 의도치 않게 사실적 지식을 억제하기 때문에 발생하는 현상입니다.
또한 안전을 위해 큐레이션된 양성 데이터 세트에 대한 미세 조정이 같은 이유로 정렬을 저하시킬 수 있는지에 대해서도 살펴봅니다.
저자들은 이러한 기능을 분리하고 진실성 훈련 중에 안전성을 유지하기 위해 별개의 활성화 패턴을 분리하도록 설계된 네트워크인 스파스 자동 인코더(SAE)를 사용할 것을 제안합니다. 이 접근 방식은 품질 저하 없이 모델을 더 안전하고 정확하게 만드는 것을 목표로 합니다.
새로운 논문 제목은 '의도하지 않은 AI 정렬의 트레이드오프: LLM에서 환각 완화 및 안전성의 균형 맞추기라는 제목의 이 논문은 디킨 대학교 소속 연구원 5명과 독립 연구진이 공동으로 작성했습니다.
연구 방법론
이 연구에서는 언어 모델의 진실성을 개선하면 유해한 프롬프트를 거부하는 능력이 약화되는지, 그리고 두 가지 행동이 공유된 내부 구성 요소에 의존하는지 여부를 조사합니다.
두 가지 진실성 향상 방법을 테스트한 결과, 사실 정확도가 높아지면 탈옥에 대한 민감도가 일관되게 증가한다는 사실을 발견했습니다.
이러한 상충 관계는 사실 신호와 거부 신호를 모두 인코딩하는 주의 헤드를 겹치는 데서 비롯됩니다. 안전에 영향을 주지 않고 유용성을 향상시키기 위한 양성 미세 조정조차도 공유 경로를 변경하여 안전 장치를 방해할 수 있습니다.
이 연구에서는 세 가지 핵심 용어를 정의합니다. 진실성은 무해한 내용을 억제하지 않고 이용 가능한 지식을 기반으로 정확한 응답을 제공하는 모델의 능력을 의미하고, 환각은 모델이 정확한 사실에 접근했음에도 불구하고 잘못된 정보를 생성할 때 발생하며, 거부 행동 또는 안전 정렬은 유해하거나 민감한 프롬프트에 대한 응답을 차단하는 메커니즘을 설명합니다.
저자들은 이러한 기능이 미묘한 방식으로 상호 작용한다는 점에 주목합니다:
'진실성과 안전성을 별도로 분석하는 경우가 많지만, 실제 프롬프트에는 분석, 탐지 또는 교육 등 선의의 의도를 가진 민감한 용어가 포함되어 있는 경우가 많습니다. 이러한 경우 안전 메커니즘이 과도하게 작동하여 정확하고 유용한 정보가 누락되고 실질적인 진실성이 떨어질 수 있습니다.
'사실성을 높이기 위한 편집이 거부 행동에 어떤 영향을 미치는지 이해하는 것은 최소한의 적절한 억제로 진실성을 달성하는 데 필수적입니다.'
저자들은 조건부 LLM을 보다 '진실한' 상태로 유도하여 환각을 감소시키는 LoRA를 개발했습니다. 이 백서의 부록에는 이 접근법의 의도하지 않은 결과를 보여주는 여러 가지 예가 포함되어 있습니다.
분석은 헤드 스티어링 및 잠재 방향 매핑과 같은 진실성 향상 방법을 모델의 내부 계산에 대한 의도적인 수정으로 취급하는 것으로 시작됩니다.
정밀 스티어링
핵심 질문은 이러한 변화가 의도치 않게 거부 행동을 지배하는 동일한 경로에 영향을 미치는지 여부입니다. 이를 테스트하기 위해 이 연구에서는 TruthfulQA를 사용하여 사실 정확도에 대한 모델을 평가하고 AdvBench 및 StrongReject를 사용하여 불리한 조건에서 안전 성능을 평가했습니다.
기준 기법에는 진실한 답변과 연결된 주의 헤드를 활성화하는 추론 시간 개입(ITI)과 학습된 "진실한" 방향을 따라 표현을 이동하는 TruthX가 포함되었습니다.
두 가지 방법 모두 정확도를 향상시킬 뿐만 아니라 이전에는 거부했을 유해한 프롬프트에도 모델이 응답할 가능성을 높입니다.
환각 행동을 직접 분리하고 조작하기 위해 저자들은 환각 반응에 해당하는 잠재적 방향을 정의하고, LLaMA3-8B-Instruct를 사용하여 TruthfulQA 데이터 세트의 오답에 대해 LoRA 모듈을 학습시켰습니다.
이를 통해 진실한 답변과 환각된 답변의 차이를 나타내는 선형 벡터를 생성하여 모델을 환각 쪽으로 또는 환각에서 벗어나도록 조정할 수 있었습니다.
환각 방향을 따라 스티어링하면 진실성QA의 정확도는 향상되지만 AdvBench 및 StrongReject의 공격 성공률(ASR)이 증가하여 진실성과 안전성 간의 균형이 강조됩니다.
환각 축을 따라 조향하면 사실 정확도가 감소한 반면, 방향을 바꾸면 정확도가 향상되었습니다. 이 기법을 유해한 프롬프트 벤치마크에 적용한 결과, 진실성이 높아지는 대신 거부감이 약해졌다는 이전의 결과가 확인되었습니다. 환각이 깨끗한 선형 방향으로 포착된 경우에도 사실적 출력을 강화하면 안전하지 않은 완성에 대한 취약성이 증가했습니다.
저자들은 다음과 같이 강조합니다*:
'이는 진실성과 안전성 사이의 균형을 강화하여, 진실성이 하나의 선형적 방향으로 표현될 때에도 사실성을 강화하면 안전성이 약화될 수 있음을 보여줍니다.'
데이터 및 테스트
미세 조정으로 인해 거부 행동이 약화되는 것을 방지하기 위해 저자들은 거부 기능과 환각과 관련된 기능을 분리하는 방법을 사용했습니다. 두 행동 모두에 관여하는 주의 헤드를 식별하고 SAE를 사용하여 거부와 관련된 잠재적 특징을 추출했습니다.
이러한 특징들은 보호된 하위 공간을 정의했습니다. 훈련 중에 이 하위 공간을 피하기 위해 그라데이션 업데이트를 수정하여 모델이 안전성을 손상시키지 않고 환각을 줄일 수 있도록 했습니다.
저자들은 6가지 상식적인 추론 과제에 대한 성능을 평가하면서 CommonsenseQA 데이터 세트를 미세 조정했습니다: CSQA, 헬라스웨그, ARC 챌린지, ARC 이지, 와인그란데, SST-2.
목표 모듈은 등급 8, 학습률 2×10-⁴, 가중치 붕괴 0.01, 훈련 에포크 1개, 배치 크기 2개로 LoRA를 사용하여 미세 조정되었습니다. 모든 실험에는 AdamW 옵티마이저가 사용되었습니다.
두 가지 유해 콘텐츠 벤치마크를 사용하여 안전성을 평가했습니다: AdvBench(500개 샘플) 및 StrongReject(300개 프롬프트)를 사용했습니다. 출력은 LlamaGuard3에 의해 안전 또는 안전하지 않은 것으로 분류되었습니다.
실험은 LLaMA3-8B-Instruct와 Qwen2.5-Instruct에서 수행되었습니다.
기준 방법에는 SafeLoRA, SaLoRA, SAP, 바닐라 감독 미세 조정(SFT)이 포함되었습니다. SafeLoRA를 제외한 모든 테스트는 HarmBench의 200개 프롬프트를 사용하여 기본 하이퍼파라미터로 진행되었습니다.
정확도가 주요 측정 항목이었으며, 유해 벤치마크에는 LlamaGuard3 결과를 기반으로 한 공격 성공률(ASR)이 사용되었습니다.
위: LLaMA-3-8B-Instruct의 결과, 최고 점수가 굵은 글씨로 표시됨. 하단: 상식 및 추론 작업(점수가 높을수록 정확도가 높음을 의미)과 안전 벤치마크인 AdvBench 및 StrongReject(ASR 값이 낮을수록 견고성이 강함을 의미)에서 Qwen2.5 7B Instruct의 미세 조정 방법의 성능. 각 열에서 가장 좋은 결과는 굵게 표시됩니다.
이러한 결과에 대해 저자들은 다음과 같이 말합니다:
'우리의 수술적 접근 방식은 미세 조정 정확도를 유지하면서 유해한 벤치마크 점수를 크게 줄임으로써 안전성과 유용성 간에 최상의 균형을 이룹니다. 이와는 대조적으로 SAP, SaLoRA, SafeLoRA와 같은 방법은 유해성을 높이거나 유용성을 떨어뜨립니다.
'이러한 방법은 안전 하위 공간의 기울기에서 직접 작동하기 때문에 다의성[**]으로 인해 모델 성능을 제약할 수 있다는 것이 주요 이유입니다.
'바닐라 미세 조정(SFT)과 비교했을 때, 우리의 방법은 평균 미세 조정 정확도(FA)를 56.15%에서 75.09%로 개선하여 약 +19%의 이득을 얻었습니다.'
이 방법을 통해 공격 성공률은 AdvBench에서 9.23%에서 0.58%로, StrongReject에서 9.90%에서 0.00%로 감소하여 유해한 결과가 15배 이상 감소했습니다. 기본 모델은 유해성은 낮았지만 작업 정확도가 제한적이었습니다.
저자들은 다음과 같이 말합니다:
'이러한 결과는 미세 조정 시 거부 기능 보존의 중요성을 강조합니다. 거부 하위 공간을 분리하고 보호함으로써 우리의 방법은 작업 성능을 저하시키지 않고 안전 정렬을 유지합니다.
'전반적으로 우리의 접근 방식이 진실성과 안전성 사이의 상충을 효과적으로 완화한다는 것을 확인했습니다.'
마지막으로 저자들은 회로 차단 데이터 세트의 유해한 명령어 10%를 미세 조정 세트에 추가하여 불리한 조건에서 이 방법의 복원력을 테스트했습니다.
이러한 의도적인 오염에도 불구하고 이 접근 방식은 양성 및 유해 평가 모두에서 강력한 성능을 유지했습니다:
오염된 상식 데이터 세트에서 미세 조정된 LLaMA3 8B 명령의 성능, 여러 방법의 정확도와 안전성 결과를 비교합니다.
새로운 방법은 상당한 유틸리티 손실을 피하면서 SAP보다 더 효과적으로 ASR을 줄였습니다. 작업 정확도는 LoRA SFT 및 SafeLoRA와 비슷하게 유지되어 거부 기능이 적절히 격리된 경우 오염된 훈련 조건에서도 거부 정렬을 유지할 수 있음을 보여주었습니다.
애플 스마트 글래스가 WWDC27에서 공개될 수 있으며, 프라이버시 보호를 강조할 것으로 예상된다블룸버그의 마크 거먼은 시제품명 N50인 애플의 스마트 글래스가 2027년 6월 WWDC27에서 공개될 예정이며, 2027년 가을에 소매 시장 출시가 예상된다고 보도했다. 원래 올해 말과 2027년 초 출시가 목표였으나, 제품의 추가 정교화와 프라이버시 프로토콜 강화를 위해 출시 시기가 연기되었다.프라이버시는 애플의 스마트 글래스 전략의 핵심 기둥이다. 메타 등 경쟁사의 프라이버시 논란에서 교훈을 얻은 애플은 강력한 기능과 정책을 도입하고 있
내부 세부 사항 공개: 차세대 Gemini에 대한Computing Power의 긴장, 내부 팀들은 개발 우선순위와 자원 배분에 대해 의견이 갈렸다보고에 따르면 구글의 높은 기대를 모았던次世代 제미니 모델의 출시가 연기되었다. 개발 우선순위와 자원 배분에 대한 내부 의견 불일치, 제한된 컴퓨팅 용량, 복잡한 승인 절차가 결합되어 2개월의 지연이 불가피해졌다. 자체 맞춤형 TPU 칩을 보유하고 있음에도 불구하고, 모델 학습, 구글 클라우드 서비스, 수많은 소비자 및 기업용 AI 애플리케이션 간의 경쟁적 수요로 인해 구글은 컴퓨팅 자원 부족에 직면해 있다. 최고 경영진은 이제 조직 개편을 통
OpenAI, 성장 둔화 우려 불식…여러 사업부門 가속화외부로부터의 판매 성장 둔화 및 내부 목표 미달성에 대한 scrutiny에 대응하여, AI 선도 기업 오픈AI는 4월 28일 화요일에 자신감 있는 성명을 발표했다. 이 회사는 소비자 제품과 기업 서비스의 빠른 진전을 명확히 하며, 최근 제기된 사업 둔화에 대한 추측을 직접적으로 반박했다.동사가 "여러 내부 목표를 놓쳤다"는 주장에 대해, 오픈AI는 이러한 보도를 "전형적인 클릭베이트"로 일축했다. 이 회사는 AI 통합에 대한 강력한 기업 수요
2026년 최신 최고 인기 AI 멜로디 작곡 도구! XIX.AI는 엄격한 실전 테스트를 거쳐 최고의 작곡 경험을 제공하는 강력한 게임 체인저 컬렉션을 엄선했습니다. 무료와 유료 버전의 상세 비교, 정확한 순위, 그리고 놀라운 노래 초안을 손쉽게 만들고 창의적 생산성을 크게 높일 수 있는 필수 추천 옵션들을 확인할 수 있습니다. 지금 바로 탐색하여 완벽한 도구를 발견하세요!
2026년 최신 최고의 평점 높은 AI 대화 트레이너 도구들이 XIX.AI에서 만나보세요! 면접 연습을 위한 이 엄선된 컬렉션은 강력한, 게임 체인저 도구들을 포함하고 있으며, 엄격한 실제 세계 테스트를 거쳐 정확한 피드백을 제공합니다. 무료 대 유료 비교와 상세한 순위표를 찾을 수 있어 자신감과 기술을 향상시킬 수 있는 꼭 시도해봐야 할 옵션을 선택하는 데 도움이 됩니다. 지금 탐색하여 면접 성공을 위한 완벽한 도구를 발견하세요!
2026년 최신, 최고 평점을 받은 창의적 실험을 위한 AI 스타일 변환 도구! XIX.AI는 실제 테스트와 엄격한 평가를 통해 탁월한 결과를 보여주는, 강력하고 판도를 바꿀 만한 ‘꼭 사용해 봐야 할’ 도구들을 엄선했습니다. 이 최고의 솔루션들은 콘텐츠 제작 속도를 높이고 무한한 창의적 가능성을 열어줌으로써 크리에이터들의 생산성을 크게 높여줍니다. 지금 바로 탐색하여 나에게 딱 맞는 도구를 찾아보고, 오늘 바로 창작을 시작해 보세요!
2026년 시각적 스토리텔링을 위한 최신 최고 평점의 AI 대화 풍선 도구가 XIX.AI에 소개됩니다! 이 엄선된 모음집에는 크리에이터들이 생산성을 높이고 창의적인 난관을 극복하는 데 도움을 주는, 강력하고 획기적인 도구들이 포함되어 있습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 실제 테스트 결과를 살펴보며, 최신 순위를 통해 매력적인 시각적 이야기를 만드는 데 꼭 필요한 솔루션을 찾아보세요. 지금 바로 탐색하여 여러분에게 딱 맞는 도구를 발견해 보세요!
2026년 최신 최고 평점을 받은 최고의 AI 회의 요약 도구로, 명확한 의사 결정 추적과 손쉬운 후속 조치를 실현하세요. 이 엄선된 목록은 회의록 자동화, 핵심 실행 과제 파악, 모든 프로젝트에 걸친 팀 협업 효율화를 통해 생산성을 획기적으로 높여주는 강력하고 혁신적인 솔루션을 소개합니다. 무료 버전과 유료 버전의 비교 정보, 실제 사용 후기, 매주 업데이트되는 순위 정보를 통해 여러분에게 딱 맞는 도구를 찾아보세요. 지금 바로 살펴보고 AI의 힘을 경험해 보세요!
2026년 최신의 우수하고 높은 평가를 받는 AI 데이터 정제 도구들로, 누락된 값과 중복 데이터를 신속하게 수정할 수 있습니다. 이 선별된 목록에는 생산성을 획기적으로 향상시켜 주는 강력한 솔루션이 포함되어 있습니다. 각 도구는 신뢰성을 보장하기 위해 엄격한 실제 환경 테스트를 거쳤습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 귀하의 요구사항에 가장 적합한 도구를 발견해 보세요. 지금 바로 XIX.AI에서 자세히 알아보시고 AI 분야에서의 경쟁 우위를 확보하세요.
웹사이트를 방문하면 브라우저에 정보를 저장하거나 불러올 수 있으며, 대부분은 쿠키의 형태입니다. 이 정보는 사용자, 환경설정 또는 기기에 관한 것일 수 있으며, 사이트가 기대한 대로 작동하도록 하는 데 주로 사용됩니다. 이 정보가 직접적으로 사용자를 식별하지는 않지만, 더 개인화된 웹 환경을 제공할 수 있습니다. 당사는 사용자의 개인정보 보호 권리를 존중하기 때문에 일부 유형의 쿠키를 허용하지 않을 수 있습니다. 각 카테고리 제목을 클릭하면 자세히 알아보고 기본 설정을 변경할 수 있습니다. 그러나 일부 유형의 쿠키를 차단하면 사이트 이용 경험 및 제공 가능한 서비스에 영향을 줄 수 있습니다. 개인정보 취급방침성명
환경설정 관리
필수 쿠키
항상 활성화
이 쿠키는 웹사이트가 정상적으로 기능하는 데 필요하며, 우리 시스템에서 끌 수 없습니다. 이러한 쿠키는 일반적으로 개인정보 설정, 로그인 또는 양식 작성과 같은 서비스 요청에 해당하는 사용자 행동에 응답하여만 설정됩니다. 브라우저를 설정하여 이러한 쿠키를 차단하거나 경고할 수 있지만, 그 경우 사이트의 일부 기능이 작동하지 않을 수 있습니다. 이러한 쿠키는 개인 식별 정보를 저장하지 않습니다.