옵션
뉴스
결함을 증폭시켜 AI 이미지 환각에 대처하기

결함을 증폭시켜 AI 이미지 환각에 대처하기

2025년 12월 22일
105

ChatGPT와 같은 비전 모델은 이미지에서 누락된 요소를 자주 생성합니다. 새로운 접근 방식은 캡션에서 모델 자체의 과장된 버전을 생성한 다음 수정하라는 메시지를 표시하여 이러한 오류를 줄입니다. 이 기술은 재교육이나 추가 데이터가 필요하지 않으므로 다양한 모델과 아키텍처에 광범위하게 적용할 수 있습니다.

중국에서 발표된 새로운 연구는 AI가 생성한 이미지와 동영상에서 사용자의 요청과 명백히 모순되는 디테일이 나타나는 고질적인 문제를 해결합니다.

프로세스는 전통적인 방식으로 시작됩니다. 모델이 이미지를 설명합니다. 그런 다음 이 캡션을 텍스트 이미지 모델에 입력하여 새로운 이미지를생성하는데, 이 재구성에서 추가되는 물체나 특징은 모델의 초기 환각을 직접적으로 드러냅니다. 시스템은 원본 이미지와 생성된 이미지를 비교하여 향후 시도에서 이러한 실수를 반복하지 않도록 모델을 안내합니다.

새로운 방법이 이미지 캡션에서 환각을 식별하고 줄이는 방법을 보여주는 그림입니다. 일반 모델은 원본 이미지에 존재하지 않는 새를 묘사하여 이를 추가하는 재구성된 이미지로 이어집니다. 이러한 오류는 빨간색으로 표시됩니다. 반면, 제안된 방법은 이러한 오류를 방지하면서 캡션을 구체적이고 유창하게 유지합니다. 출처: https://arxiv.org/pdf/2509.21997

이 다이어그램은 새로운 기술이 캡션 착시를 감지하고 최소화하는 방법을 보여줍니다. 표준 모델은 이미지 설명에 새를 잘못 추가하고, 재구성된 버전은 새를 시각적으로 삽입합니다(빨간색으로 강조 표시). 새로운 방법은 설명의 정확성을 유지하면서 이러한 조작을 방지합니다. 출처: https://arxiv.org/pdf/2509.21997

이 방법은 모델이 실제 이미지를 설명하도록 하는 것으로 시작하며, 때로는 실제로 존재하지 않는 물체나 세부 사항을 포함하기도 합니다. 이렇게 부정확한 캡션은 오류를 강조하는 합성 이미지를 생성합니다. 시스템은 실제 이미지와 합성 이미지를 비교하여 오류를 유발하는 내부 패턴을 식별합니다.

이러한 오류 패턴이 인식되면 나중에 사용할 수 있도록 저장됩니다. 새로운 이미지를 캡쳐할 때 시스템은 모델의 내부 신호를 조정하여 알려진 환각 유발 요인에서 벗어나도록 유도합니다. 이 보정은 테스트 중에 추가 데이터, 재교육 또는 이미지 생성 없이 한 번의 패스로 이루어집니다.

얽힘의 도전 과제

이 논문의 예에서 '얽힘'은 새가 없는 이미지에 새가 추가된 이유를 설명할 수 있습니다.

얽힘은 특정 개념이 학습 데이터에 자주 함께 나타나기 때문에 모델이 특정 개념을 강력하게 연결할 때 발생합니다. 여기서는 모델이 새가 있는 비행기를 자주 접하여 캡션에 잘못된 영향을 미치는 연관성을 만들었을 수 있습니다.

학습을 일찍 종료하면 얽힘을 줄일 수 있지만(모델 유연성 증가), 개념의 세부 사항과 해상도가 떨어집니다. 개발자는 유연하고 얽힘이 없는 모델을 우선시할 것인가, 아니면 연관 환각이 발생하기 쉬운 생성형 모델을 우선시할 것인가 하는 지속적인 트레이드오프에 직면하게 됩니다.

이상적으로는 소스 이미지 캡션이 존재하는 모든 객체를 항목화하여 모델에서 별도의 분리된 항목으로 저장할 수 있도록 하는 것이 좋습니다. 그러나 강력한 생성 모델을 훈련할 때 흔히 사용되는 SEO 기반의 캡션 작성 관행과 대규모 웹 스크래핑은 종종 이 표준에 미치지 못합니다.

약한 캡션이 안정적 확산과 같은 학습 모델에 대한 LAION 이미지의 유용성을 제한하는 방법을 보여주는 예시입니다. 많은 텍스트 레이블이 얕고 모호하거나 정확한 설명보다는 SEO에 최적화되어 있어 모델이 얼굴 특징과 같은 세분화된 시각적 개념을 학습하기 어렵게 만듭니다(원본 출처: https://rom1504.github.io/, 현재는 사라짐).

약한 캡션은 안정적 확산과 같은 학습 모델을 위한 LAION 이미지의 가치를 떨어뜨립니다. 라벨은 종종 얕고 모호하거나 설명보다는 SEO에 초점을 맞춘 경우가 많아 얼굴 특징과 같은 세부적인 시각적 개념을 학습하는 모델의 능력을 방해합니다. (원본 출처는 https://rom1504.github.io/, 현재는 사라짐).

근본적인 해결책은 현실적으로 불가능하기 때문에 LLM과 VLM에서 환각을 줄이기 위한 해결 방법이 중요한 연구 과제가 되었습니다. 다양한 아키텍처와 조건에서 테스트된 중국의 새로운 방법은 "환각 오염"을 억제할 수 있는 가능성을 보여줍니다.

저자들은 다음과 같이 말합니다:

'여러 벤치마크에 걸친 광범위한 실험 결과, 우리의 방법은 대상, 속성 및 관계 수준에서 환각을 크게 줄이면서도 리콜과 캡션 [풍부함]은 대부분 보존하는 것으로 나타났습니다.'

이 논문은 중국과학기술대학과 난징대학의 연구진이 작성한 ' 환각을 억제하기 위한 노출: 생성 앵커를 사용한 VLM의 표현 편집'이라는 제목의 논문입니다.

방법의 작동 원리

연구진은 캡션 환각을 노출하고 억제하기 위한 엔드투엔드 파이프라인을 개발했습니다:

전체 파이프라인의 그림입니다. 먼저 시각 언어 모델이 입력 이미지에서 캡션을 생성하며, 여기에는 환각 콘텐츠가 포함될 수 있습니다. 이 캡션은 텍스트-이미지 모델을 통해 재구성된 이미지를 생성하는 데 사용되어 환각을 더 쉽게 발견할 수 있게 해줍니다. 원본 이미지와 재구성된 이미지 모두에서 임베딩을 추출하여 디코더 내부의 조정을 안내하는 데 사용하므로 모델이 캡션 품질을 유지하면서 환각 디테일을 억제하는 데 도움이 됩니다.

전체 파이프라인 그림. 시각 언어 모델은 입력 이미지에서 잠재적으로 환각을 포함한 캡션을 생성합니다. 이 캡션은 텍스트-이미지 모델을 통해 재구성된 이미지를 생성하는 데 사용되어 오류를 표시합니다. 두 이미지의 임베딩은 내부 조정을 안내하여 모델이 캡션 품질을 잃지 않고 발명된 세부 사항을 줄이는 데 도움을 줍니다.

비전 언어 모델은 먼저 실제 이미지에 캡션을 생성하여 객체나 관계를 생성할 수 있습니다. 그런 다음 이 캡션은 재구성된 이미지를 생성하여 시각적 불일치로 조작된 부분을 드러냅니다. 두 이미지를 비교하면 미묘한 텍스트 오류가 측정 가능하고 수정 가능한 신호로 바뀝니다.

발명을 막기 위해 시스템은 원본 이미지(신뢰할 수 있는 참조)와 재구성된 이미지(오류를 강조 표시)를 비교합니다. 각각은 컴팩트한 임베딩으로 변환됩니다. 원본과 더 가깝게 일치하도록 내부 표현을 조정하고 재구성된 이미지와 차이가 나면 모델은 완전한 자기 감독 방식으로 자체 수정합니다.

논문은 이렇게 설명합니다:

'MLLM의 환각은 언어적으로 잘 형성되어 있고 텍스트 수준의 충실한 설명과 구별할 수 없는 경우가 많기 때문에 본질적으로 감지하기가 어렵습니다. 이러한 불일치는 언어적 타당성이 아니라 시각적 증거와의 불일치에서 비롯되는데, 일반적으로 모델 자체는 이러한 불일치에 민감하지 않습니다.

'이 문제를 해결하기 위해 우리는 암시적 불일치를 명시적이고 관찰 가능한 신호로 변환하기 위해 생성적 재구성을 활용하는 환각 노출 메커니즘을 도입했습니다.'

이 시스템은 FLUX.1-dev 텍스트-이미지 변환 모델을 사용하여 캡션에서 이미지를 재구성하여 잘못된 세부 사항을 과장합니다. 이렇게 증폭된 오류는 모델이 실수를 인식하고 수정하는 데 도움이 됩니다.

연구자들은 이 접근 방식을 검증하기 위해 캡션에 환각을 주입하고 재구성된 이미지를 생성한 다음 LLaVA로 다시 캡션을 작성했습니다. 그리고 원본 캡션과 환각 캡션 간의 의미적 유사성을 측정했습니다:

환각 증폭 메커니즘이 미묘한 오류를 어떻게 가시화하는지 보여주는 그림입니다. 각 점은 하나의 이미지-캡션 쌍에 대한 원본 이미지와 재구성된 이미지의 캡션 간의 유사성을 나타냅니다. 주황색 선은 원본과 환각 캡션 간에 직접 측정한 유사도를 나타내며, 이는 높게 유지되어 작은 실수를 가리고, 파란색 선은 재구성 후 유사도를 나타내며, 이는 급격히 감소하여 이 프로세스가 숨겨진 환각을 감지 및 수정할 수 있는 명확한 의미적 마커로 바꾼다는 것을 보여줍니다.

환각 증폭 메커니즘은 미묘한 오류를 시각화합니다. 각 점은 이미지-캡션 쌍에 대한 캡션 유사성을 보여줍니다. 주황색 선(직접 비교)은 높은 유사도를 유지하여 실수를 가리고, 파란색 선(재구성 후)은 급격히 감소하여 숨겨진 환각을 감지 가능한 의미적 마커로 드러냅니다.

재구성 후 유사성이 크게 감소하여 이 방법이 미묘한 오류를 노출하는 능력을 보여줬습니다.

데이터 및 테스트

세 가지 벤치마크를 사용하여 효과를 검증했습니다: 이미지 관련성을 통한 캡션 환각 평가 (CHAIR), 다중 언어 모델평가 (MME), 풀링 기반 객체 프로빙 평가 (POPE).

CHAIR 릴리스 문서에서: 노트북, 싱크대, 서핑보드 등 이미지에 실제로 존재하지 않는 시각적 요소를 각 모델에 삽입하는 두 가지 주요 캡션 시스템인 TopDown과 NBT로 생성한 환각 물체의 예시입니다. 출처: https://arxiv.org/pdf/1809.02156

CHAIR 릴리스 문서에서: 이미지에 존재하지 않는 노트북, 싱크대 또는 서핑보드와 같은 요소를 생성하는 캡션 시스템 TopDown 및 NBT에서 생성된 환각 객체의 예시. 출처: https://arxiv.org/pdf/1809.02156

환각률이나 회상률과 같은 표준 지표는 오해의 소지가 있을 수 있으며, 모델은 모호한 캡션을 생성하여 오류를 피할 수 있습니다. 정확성과 완전성의 균형을 맞추기 위해 두 요소에 가중치를 조정하여 캡션에 점수를 매기는 통합 지표인 환각률과 회상률(HAR@β)을 사용했습니다.

POPE는 맥락에 민감한 사물 환각을 평가했고, MME는 속성 수준의 환각을 예/아니요 작업으로 평가했습니다.

테스트는 Microsoft COCO, A-OKVQA, GQA를 포함한 데이터 세트에서 Flux 모델과 LLaVA-v1.5-7B를 사용했습니다. 잠재 편집은 모든 테스트에서 일관된 하이퍼파라미터와 온도로 모델의 두 번째 레이어를 대상으로 했습니다.

초기 CHAIR 결과는 아래와 같습니다*:

여러 메트릭을 사용하여 평가한 환각 완화를 위한 CHAIR 벤치마크의 성능.

여러 메트릭으로 평가한 환각 완화를 위한 CHAIR 벤치마크의 성능.

저자는 다음과 같이 말합니다:

'[우리의 방법은 CHAIRS와 CHAIRI[*] 모두에서 다른 기준선보다 일관되게 우수한 성능을 보여 환각을 억제하는 데 탁월한 효과가 있음을 입증했습니다. 한편, 거의 모든 방법이 환각을 억제하는 동안 필연적으로 회상률을 감소시키지만, 충실도와 정보성 사이의 균형을 반영하여 우리의 접근 방식은 가장 작은 감소를 달성합니다.

'이는 우리의 방법이 광범위한 범위의 실사 객체를 포착한다는 것을 보여줍니다. HAR@β 메트릭에서 우리 방법은 가장 높은 점수를 획득하여 커버리지를 유지하면서 환각을 줄일 수 있는 능력을 강조했습니다.

강력한 결과는 원본 이미지의 깨끗한 의미를 강화하는 동시에 재구성의 잘못된 신호를 억제하는 이중 감독에 기인합니다. 이 시스템은 환각과 관련된 방향만 타겟팅하여 디테일을 잃지 않고 오류를 수정합니다.

다양한 구성 및 데이터 세트에서 POPE 벤치마크의 성능 비교.

다양한 구성과 데이터 세트에 대한 POPE 벤치마크의 성능 비교.

논문은 POPE 결과에 대해 다음과 같이 설명합니다:

'우리의 방법은 모든 설정에서 일관되게 최고의 성능을 달성하는 것을 관찰할 수 있습니다. 특히, 우리의 방법은 평균적으로 최대 +5.95%의 정확도와 +6.85%의 F1 점수를 달성할 수 있어 다른 훈련 없는 접근법을 큰 차이로 능가합니다.

'따라서 이러한 결과는 우리의 방법이 다양한 난이도 수준에서 안정적이고 일반화 가능한 솔루션을 제공한다는 것을 보여줍니다.

세 번째 테스트 라운드부터는 MME를 통한 성능 비교가 이루어집니다.

MME에 대한 세 번째 테스트 라운드의 성능 비교.

마지막 메인 테스트는 MME에서 진행되었으며, 결과는 위와 같습니다. 그러나 논문은 본문이나 부록에서 'OPERA'라는 방법을 정의하지 않고 언급하고 있습니다. 저자들은 강력한 MME 성능을 주장하지만, 방법에 대한 자세한 설명이 없기 때문에 이 결과를 해석할 때 주의가 필요합니다.

관련 기사
CodeBuddy와 WorkBuddy, Hy3 모델 무료 체험 기간을 8월 31일까지 연장 CodeBuddy와 WorkBuddy, Hy3 모델 무료 체험 기간을 8월 31일까지 연장 CodeBuddy와 WorkBuddy가 제공하는 Hy3 모델의 기간 한정 무료 체험 기간이 2026년 8월 31일까지 연장되었습니다. 압도적인 사용자 관심에 부응하여, 플랫폼 측은 더 많은 사용자가 해당 모델의 기능을 체험할 수 있도록 무료 이용을 계속 제공하기로 결정했습니다.Hy3는 현재 멀티모달 기능을 지원하지 않는 텍스트 중심의 대규모 언어 모델입니다
통이 랩, 직교 분리기 기술 적용된 ‘Qwen3.7-Max’ 공개… 국내 다수 벤치마크에서 1위 기록 통이 랩, 직교 분리기 기술 적용된 ‘Qwen3.7-Max’ 공개… 국내 다수 벤치마크에서 1위 기록 Tongyi Lab은 차세대 AI 에이전트 파운데이션 모델인 ‘Qwen3.7-Max’를 공식 출시했습니다. 이 모델은 여러 권위 있는 벤치마크에서 1위를 차지했으며, 장기간의 생산 환경에서 지능형 에이전트가 보이는 취약성과 불안정성 등 업계의 주요 과제를 해결합니다.알려지지 않은 하드웨어 플랫폼인 ZW-M890L PPU에서 실시된 엄격한 스트레스 테스트에서
제네시스 AI, 단일 모델로 로봇 작업 마스터… ‘챗GPT’와 유사한 전환점 마련 제네시스 AI, 단일 모델로 로봇 작업 마스터… ‘챗GPT’와 유사한 전환점 마련 전 세계적으로 로봇 공학에 대한 관심이 높아지는 가운데, 제네시스 AI는 자사의 첫 번째 로봇 파운데이션 모델인 ‘GENE-26.5’를 선보였습니다. 이번 출시는 범용 로봇 공학, 특히 복잡하고 구조화되지 않은 작업을 처리하는 분야에서 큰 도약을 의미합니다.최근 공개 시연에서는 이 로봇의 놀라운 민첩성과 자율성이 돋보였습니다. 한 손으로 달걀을 휘젓는 것과
관련 특별 주제 추천
만화 창작 연속 연재용 최고의 AI 만화 배경 생성기
연속 연재용 최고의 AI 만화 배경 생성기

2026년 최신 최고 인기 AI 만화 배경 생성기 시리즈물! 이 엄선된 목록에는 창작자가 놀라운 시각적 콘텐츠를 빠르게 제작할 수 있도록 도와주는 강력한 게임 체인저 도구들이 포함되어 있어 생산성을 크게 향상시킵니다. 모든 옵션은 최고 품질을 보장하기 위해 실제 테스트를 거쳤습니다. 무료와 유료 비교 및 순위를 확인하여 자신에게 가장 적합한 도구를 찾아보세요. XIX.AI에서 지금 탐색하고 만화 제작에서 AI의 이점을 활용하세요.

9 도구
xix.ai
챗봇 최고의 AI 대화 상대: 장기 기억을 바탕으로 자연스러운 대화를 나누세요
최고의 AI 대화 상대: 장기 기억을 바탕으로 자연스러운 대화를 나누세요

‘2026년 최신 최고의 AI 채팅 동반자 순위’는 자연스러운 대화를 나누고 장기 기억을 유지하는 능력으로 정평이 난, 최고 평점을 받은 강력한 도구들을 소개합니다. 이 엄선된 목록에는 실제 테스트를 거치고 매주 업데이트되는 순위를 바탕으로, 무료 및 유료 서비스 전반에 걸쳐 꼭 사용해 봐야 할 옵션들이 포함되어 있습니다. XIX.AI는 이 엄선된 목록에서 신뢰할 수 있는 선택지로 두각을 나타내고 있습니다. 지금 바로 살펴보고 나에게 딱 맞는 AI 채팅 동반자를 찾아, 오늘부터 생산성을 한 단계 높여보세요.

11 도구
xix.ai
애니메이션 제작 최고의 AI 애니메이션 생성기: 아이디어를 빠르게 모션 클립으로 변환
최고의 AI 애니메이션 생성기: 아이디어를 빠르게 모션 클립으로 변환

2026년 최신 최고 인기 AI 애니메이션 생성기! XIX.AI는 창의적인 아이디어를 고품질 모션 클립으로 빠르게 변환할 수 있는 필수 도구들을 엄선한 혁신적인 컬렉션을 제공합니다. 각 옵션은 철저한 실제 테스트를 거쳤으며, 무료와 유료 버전의 상세 비교와 매주 업데이트되는 랭킹을 제공하여 애니메이션 생산성을 높일 수 있는 최적의 도구를 찾을 수 있도록 도와줍니다. 지금 바로 탐색하고 AI 경쟁력을 확보하세요!

11 도구
xix.ai
텍스트 음성 변환 최고의 다국어 AI 음성 생성기: 대규모 오디오 현지화
최고의 다국어 AI 음성 생성기: 대규모 오디오 현지화

2026년 최신 최고 평점을 받은 대규모 오디오 현지화를 위한 최고의 다국어 AI 음성 생성기. 이 엄선된 목록에는 고품질의 현지화된 오디오를 신속하게 제공하는 강력하고 혁신적인 도구들이 포함되어 있습니다. 각 옵션은 신뢰성을 보장하기 위해 엄격한 실제 테스트를 거쳤습니다. 무료 버전과 유료 버전을 비교해 보고, 여러분의 프로젝트에 가장 적합한 도구를 찾아보세요. 지금 XIX.AI에서 탐색하여 AI를 활용한 경쟁 우위를 확보하세요.

18 도구
xix.ai
글쓰기 장문 SEO 기사, 개요 및 핵심 페이지를 위한 최고의 AI 개요 생성기
장문 SEO 기사, 개요 및 핵심 페이지를 위한 최고의 AI 개요 생성기

2026년 최신 최고 평점을 받은 AI 개요 생성기: 장문 SEO 기사, 브리프, 필러 페이지용. XIX.AI는 매주 업데이트되는 실제 테스트를 거쳐 엄선한, 판도를 바꿀 만한 강력한 도구 모음을 제공하며, 글쓰기 효율을 높이고 콘텐츠 제작 과정을 간소화하며 AI의 장점을 최대한 활용할 수 있도록 도와주는 꼭 사용해 봐야 할 도구들을 소개합니다. 지금 바로 탐색하여 최고의 SEO 성과를 거둘 수 있는 완벽한 도구를 찾아보세요.

11 도구
xix.ai
회의 도우미 AI 음성-문서 변환 어시스턴트: 팀 회의를 깔끔한 회의록으로 변환
AI 음성-문서 변환 어시스턴트: 팀 회의를 깔끔한 회의록으로 변환

2026년 최신 최고 평점을 받은 AI 음성-문서 변환 어시스턴트 가이드! XIX.AI는 모든 팀 대화를 즉시 완벽하고 체계적인 기록으로 변환해 주는, 매우 강력하고 혁신적인 도구 모음을 엄선했습니다. 매주 업데이트되는 저희 순위 목록에는 무료 및 유료 옵션이 모두 포함되어 있으며, 모든 업무 상황에서 생산성을 높이는 데 얼마나 효과적인지 보여주는 실제 테스트 결과도 함께 제공됩니다. AI의 장점을 최대한 활용하고자 하는 분이라면 꼭 시도해 보셔야 할 필수 가이드입니다. 지금 바로 확인해 보세요!

9 도구
xix.ai
의견 (0)
0/500
OR