ChatGPT와 같은 비전 모델은 이미지에서 누락된 요소를 자주 생성합니다. 새로운 접근 방식은 캡션에서 모델 자체의 과장된 버전을 생성한 다음 수정하라는 메시지를 표시하여 이러한 오류를 줄입니다. 이 기술은 재교육이나 추가 데이터가 필요하지 않으므로 다양한 모델과 아키텍처에 광범위하게 적용할 수 있습니다.
중국에서 발표된 새로운 연구는 AI가 생성한 이미지와 동영상에서 사용자의 요청과 명백히 모순되는 디테일이 나타나는 고질적인 문제를 해결합니다.
프로세스는 전통적인 방식으로 시작됩니다. 모델이 이미지를 설명합니다. 그런 다음 이 캡션을 텍스트 이미지 모델에 입력하여 새로운 이미지를생성하는데, 이 재구성에서 추가되는 물체나 특징은 모델의 초기 환각을 직접적으로 드러냅니다. 시스템은 원본 이미지와 생성된 이미지를 비교하여 향후 시도에서 이러한 실수를 반복하지 않도록 모델을 안내합니다.
이 다이어그램은 새로운 기술이 캡션 착시를 감지하고 최소화하는 방법을 보여줍니다. 표준 모델은 이미지 설명에 새를 잘못 추가하고, 재구성된 버전은 새를 시각적으로 삽입합니다(빨간색으로 강조 표시). 새로운 방법은 설명의 정확성을 유지하면서 이러한 조작을 방지합니다. 출처: https://arxiv.org/pdf/2509.21997
이 방법은 모델이 실제 이미지를 설명하도록 하는 것으로 시작하며, 때로는 실제로 존재하지 않는 물체나 세부 사항을 포함하기도 합니다. 이렇게 부정확한 캡션은 오류를 강조하는 합성 이미지를 생성합니다. 시스템은 실제 이미지와 합성 이미지를 비교하여 오류를 유발하는 내부 패턴을 식별합니다.
이러한 오류 패턴이 인식되면 나중에 사용할 수 있도록 저장됩니다. 새로운 이미지를 캡쳐할 때 시스템은 모델의 내부 신호를 조정하여 알려진 환각 유발 요인에서 벗어나도록 유도합니다. 이 보정은 테스트 중에 추가 데이터, 재교육 또는 이미지 생성 없이 한 번의 패스로 이루어집니다.
얽힘의 도전 과제
이 논문의 예에서 '얽힘'은 새가 없는 이미지에 새가 추가된 이유를 설명할 수 있습니다.
얽힘은 특정 개념이 학습 데이터에 자주 함께 나타나기 때문에 모델이 특정 개념을 강력하게 연결할 때 발생합니다. 여기서는 모델이 새가 있는 비행기를 자주 접하여 캡션에 잘못된 영향을 미치는 연관성을 만들었을 수 있습니다.
학습을 일찍 종료하면 얽힘을 줄일 수 있지만(모델 유연성 증가), 개념의 세부 사항과 해상도가 떨어집니다. 개발자는 유연하고 얽힘이 없는 모델을 우선시할 것인가, 아니면 연관 환각이 발생하기 쉬운 생성형 모델을 우선시할 것인가 하는 지속적인 트레이드오프에 직면하게 됩니다.
이상적으로는 소스 이미지 캡션이 존재하는 모든 객체를 항목화하여 모델에서 별도의 분리된 항목으로 저장할 수 있도록 하는 것이 좋습니다. 그러나 강력한 생성 모델을 훈련할 때 흔히 사용되는 SEO 기반의 캡션 작성 관행과 대규모 웹 스크래핑은 종종 이 표준에 미치지 못합니다.
약한 캡션은 안정적 확산과 같은 학습 모델을 위한 LAION 이미지의 가치를 떨어뜨립니다. 라벨은 종종 얕고 모호하거나 설명보다는 SEO에 초점을 맞춘 경우가 많아 얼굴 특징과 같은 세부적인 시각적 개념을 학습하는 모델의 능력을 방해합니다. (원본 출처는 https://rom1504.github.io/, 현재는 사라짐).
근본적인 해결책은 현실적으로 불가능하기 때문에 LLM과 VLM에서 환각을 줄이기 위한 해결 방법이 중요한 연구 과제가 되었습니다. 다양한 아키텍처와 조건에서 테스트된 중국의 새로운 방법은 "환각 오염"을 억제할 수 있는 가능성을 보여줍니다.
저자들은 다음과 같이 말합니다:
'여러 벤치마크에 걸친 광범위한 실험 결과, 우리의 방법은 대상, 속성 및 관계 수준에서 환각을 크게 줄이면서도 리콜과 캡션 [풍부함]은 대부분 보존하는 것으로 나타났습니다.'
이 논문은 중국과학기술대학과 난징대학의 연구진이 작성한 ' 환각을 억제하기 위한 노출: 생성 앵커를 사용한 VLM의 표현 편집'이라는 제목의 논문입니다.
방법의 작동 원리
연구진은 캡션 환각을 노출하고 억제하기 위한 엔드투엔드 파이프라인을 개발했습니다:
전체 파이프라인 그림. 시각 언어 모델은 입력 이미지에서 잠재적으로 환각을 포함한 캡션을 생성합니다. 이 캡션은 텍스트-이미지 모델을 통해 재구성된 이미지를 생성하는 데 사용되어 오류를 표시합니다. 두 이미지의 임베딩은 내부 조정을 안내하여 모델이 캡션 품질을 잃지 않고 발명된 세부 사항을 줄이는 데 도움을 줍니다.
비전 언어 모델은 먼저 실제 이미지에 캡션을 생성하여 객체나 관계를 생성할 수 있습니다. 그런 다음 이 캡션은 재구성된 이미지를 생성하여 시각적 불일치로 조작된 부분을 드러냅니다. 두 이미지를 비교하면 미묘한 텍스트 오류가 측정 가능하고 수정 가능한 신호로 바뀝니다.
발명을 막기 위해 시스템은 원본 이미지(신뢰할 수 있는 참조)와 재구성된 이미지(오류를 강조 표시)를 비교합니다. 각각은 컴팩트한 임베딩으로 변환됩니다. 원본과 더 가깝게 일치하도록 내부 표현을 조정하고 재구성된 이미지와 차이가 나면 모델은 완전한 자기 감독 방식으로 자체 수정합니다.
논문은 이렇게 설명합니다:
'MLLM의 환각은 언어적으로 잘 형성되어 있고 텍스트 수준의 충실한 설명과 구별할 수 없는 경우가 많기 때문에 본질적으로 감지하기가 어렵습니다. 이러한 불일치는 언어적 타당성이 아니라 시각적 증거와의 불일치에서 비롯되는데, 일반적으로 모델 자체는 이러한 불일치에 민감하지 않습니다.
'이 문제를 해결하기 위해 우리는 암시적 불일치를 명시적이고 관찰 가능한 신호로 변환하기 위해 생성적 재구성을 활용하는 환각 노출 메커니즘을 도입했습니다.'
이 시스템은 FLUX.1-dev 텍스트-이미지 변환 모델을 사용하여 캡션에서 이미지를 재구성하여 잘못된 세부 사항을 과장합니다. 이렇게 증폭된 오류는 모델이 실수를 인식하고 수정하는 데 도움이 됩니다.
연구자들은 이 접근 방식을 검증하기 위해 캡션에 환각을 주입하고 재구성된 이미지를 생성한 다음 LLaVA로 다시 캡션을 작성했습니다. 그리고 원본 캡션과 환각 캡션 간의 의미적 유사성을 측정했습니다:
환각 증폭 메커니즘은 미묘한 오류를 시각화합니다. 각 점은 이미지-캡션 쌍에 대한 캡션 유사성을 보여줍니다. 주황색 선(직접 비교)은 높은 유사도를 유지하여 실수를 가리고, 파란색 선(재구성 후)은 급격히 감소하여 숨겨진 환각을 감지 가능한 의미적 마커로 드러냅니다.
재구성 후 유사성이 크게 감소하여 이 방법이 미묘한 오류를 노출하는 능력을 보여줬습니다.
데이터 및 테스트
세 가지 벤치마크를 사용하여 효과를 검증했습니다: 이미지 관련성을 통한 캡션 환각 평가 (CHAIR), 다중 언어 모델 링 평가 (MME), 풀링 기반 객체 프로빙 평가 (POPE).
CHAIR 릴리스 문서에서: 이미지에 존재하지 않는 노트북, 싱크대 또는 서핑보드와 같은 요소를 생성하는 캡션 시스템 TopDown 및 NBT에서 생성된 환각 객체의 예시. 출처: https://arxiv.org/pdf/1809.02156
환각률이나 회상률과 같은 표준 지표는 오해의 소지가 있을 수 있으며, 모델은 모호한 캡션을 생성하여 오류를 피할 수 있습니다. 정확성과 완전성의 균형을 맞추기 위해 두 요소에 가중치를 조정하여 캡션에 점수를 매기는 통합 지표인 환각률과 회상률(HAR@β)을 사용했습니다.
POPE는 맥락에 민감한 사물 환각을 평가했고, MME는 속성 수준의 환각을 예/아니요 작업으로 평가했습니다.
테스트는 Microsoft COCO, A-OKVQA, GQA를 포함한 데이터 세트에서 Flux 모델과 LLaVA-v1.5-7B를 사용했습니다. 잠재 편집은 모든 테스트에서 일관된 하이퍼파라미터와 온도로 모델의 두 번째 레이어를 대상으로 했습니다.
초기 CHAIR 결과는 아래와 같습니다*:
여러 메트릭으로 평가한 환각 완화를 위한 CHAIR 벤치마크의 성능.
저자는 다음과 같이 말합니다:
'[우리의 방법은 CHAIRS와CHAIRI[*] 모두에서 다른 기준선보다 일관되게 우수한 성능을 보여 환각을 억제하는 데 탁월한 효과가 있음을 입증했습니다. 한편, 거의 모든 방법이 환각을 억제하는 동안 필연적으로 회상률을 감소시키지만, 충실도와 정보성 사이의 균형을 반영하여 우리의 접근 방식은 가장 작은 감소를 달성합니다.
'이는 우리의 방법이 광범위한 범위의 실사 객체를 포착한다는 것을 보여줍니다. HAR@β 메트릭에서 우리 방법은 가장 높은 점수를 획득하여 커버리지를 유지하면서 환각을 줄일 수 있는 능력을 강조했습니다.
강력한 결과는 원본 이미지의 깨끗한 의미를 강화하는 동시에 재구성의 잘못된 신호를 억제하는 이중 감독에 기인합니다. 이 시스템은 환각과 관련된 방향만 타겟팅하여 디테일을 잃지 않고 오류를 수정합니다.
다양한 구성과 데이터 세트에 대한 POPE 벤치마크의 성능 비교.
논문은 POPE 결과에 대해 다음과 같이 설명합니다:
'우리의 방법은 모든 설정에서 일관되게 최고의 성능을 달성하는 것을 관찰할 수 있습니다. 특히, 우리의 방법은 평균적으로 최대 +5.95%의 정확도와 +6.85%의 F1 점수를 달성할 수 있어 다른 훈련 없는 접근법을 큰 차이로 능가합니다.
'따라서 이러한 결과는 우리의 방법이 다양한 난이도 수준에서 안정적이고 일반화 가능한 솔루션을 제공한다는 것을 보여줍니다.
MME에 대한 세 번째 테스트 라운드의 성능 비교.
마지막 메인 테스트는 MME에서 진행되었으며, 결과는 위와 같습니다. 그러나 논문은 본문이나 부록에서 'OPERA'라는 방법을 정의하지 않고 언급하고 있습니다. 저자들은 강력한 MME 성능을 주장하지만, 방법에 대한 자세한 설명이 없기 때문에 이 결과를 해석할 때 주의가 필요합니다.
CodeBuddy와 WorkBuddy, Hy3 모델 무료 체험 기간을 8월 31일까지 연장CodeBuddy와 WorkBuddy가 제공하는 Hy3 모델의 기간 한정 무료 체험 기간이 2026년 8월 31일까지 연장되었습니다. 압도적인 사용자 관심에 부응하여, 플랫폼 측은 더 많은 사용자가 해당 모델의 기능을 체험할 수 있도록 무료 이용을 계속 제공하기로 결정했습니다.Hy3는 현재 멀티모달 기능을 지원하지 않는 텍스트 중심의 대규모 언어 모델입니다
통이 랩, 직교 분리기 기술 적용된 ‘Qwen3.7-Max’ 공개… 국내 다수 벤치마크에서 1위 기록Tongyi Lab은 차세대 AI 에이전트 파운데이션 모델인 ‘Qwen3.7-Max’를 공식 출시했습니다. 이 모델은 여러 권위 있는 벤치마크에서 1위를 차지했으며, 장기간의 생산 환경에서 지능형 에이전트가 보이는 취약성과 불안정성 등 업계의 주요 과제를 해결합니다.알려지지 않은 하드웨어 플랫폼인 ZW-M890L PPU에서 실시된 엄격한 스트레스 테스트에서
제네시스 AI, 단일 모델로 로봇 작업 마스터… ‘챗GPT’와 유사한 전환점 마련전 세계적으로 로봇 공학에 대한 관심이 높아지는 가운데, 제네시스 AI는 자사의 첫 번째 로봇 파운데이션 모델인 ‘GENE-26.5’를 선보였습니다. 이번 출시는 범용 로봇 공학, 특히 복잡하고 구조화되지 않은 작업을 처리하는 분야에서 큰 도약을 의미합니다.최근 공개 시연에서는 이 로봇의 놀라운 민첩성과 자율성이 돋보였습니다. 한 손으로 달걀을 휘젓는 것과
2026년 최신 최고 인기 AI 만화 배경 생성기 시리즈물! 이 엄선된 목록에는 창작자가 놀라운 시각적 콘텐츠를 빠르게 제작할 수 있도록 도와주는 강력한 게임 체인저 도구들이 포함되어 있어 생산성을 크게 향상시킵니다. 모든 옵션은 최고 품질을 보장하기 위해 실제 테스트를 거쳤습니다. 무료와 유료 비교 및 순위를 확인하여 자신에게 가장 적합한 도구를 찾아보세요. XIX.AI에서 지금 탐색하고 만화 제작에서 AI의 이점을 활용하세요.
‘2026년 최신 최고의 AI 채팅 동반자 순위’는 자연스러운 대화를 나누고 장기 기억을 유지하는 능력으로 정평이 난, 최고 평점을 받은 강력한 도구들을 소개합니다. 이 엄선된 목록에는 실제 테스트를 거치고 매주 업데이트되는 순위를 바탕으로, 무료 및 유료 서비스 전반에 걸쳐 꼭 사용해 봐야 할 옵션들이 포함되어 있습니다. XIX.AI는 이 엄선된 목록에서 신뢰할 수 있는 선택지로 두각을 나타내고 있습니다. 지금 바로 살펴보고 나에게 딱 맞는 AI 채팅 동반자를 찾아, 오늘부터 생산성을 한 단계 높여보세요.
2026년 최신 최고 인기 AI 애니메이션 생성기! XIX.AI는 창의적인 아이디어를 고품질 모션 클립으로 빠르게 변환할 수 있는 필수 도구들을 엄선한 혁신적인 컬렉션을 제공합니다. 각 옵션은 철저한 실제 테스트를 거쳤으며, 무료와 유료 버전의 상세 비교와 매주 업데이트되는 랭킹을 제공하여 애니메이션 생산성을 높일 수 있는 최적의 도구를 찾을 수 있도록 도와줍니다. 지금 바로 탐색하고 AI 경쟁력을 확보하세요!
2026년 최신 최고 평점을 받은 대규모 오디오 현지화를 위한 최고의 다국어 AI 음성 생성기. 이 엄선된 목록에는 고품질의 현지화된 오디오를 신속하게 제공하는 강력하고 혁신적인 도구들이 포함되어 있습니다. 각 옵션은 신뢰성을 보장하기 위해 엄격한 실제 테스트를 거쳤습니다. 무료 버전과 유료 버전을 비교해 보고, 여러분의 프로젝트에 가장 적합한 도구를 찾아보세요. 지금 XIX.AI에서 탐색하여 AI를 활용한 경쟁 우위를 확보하세요.
2026년 최신 최고 평점을 받은 AI 개요 생성기: 장문 SEO 기사, 브리프, 필러 페이지용. XIX.AI는 매주 업데이트되는 실제 테스트를 거쳐 엄선한, 판도를 바꿀 만한 강력한 도구 모음을 제공하며, 글쓰기 효율을 높이고 콘텐츠 제작 과정을 간소화하며 AI의 장점을 최대한 활용할 수 있도록 도와주는 꼭 사용해 봐야 할 도구들을 소개합니다. 지금 바로 탐색하여 최고의 SEO 성과를 거둘 수 있는 완벽한 도구를 찾아보세요.
2026년 최신 최고 평점을 받은 AI 음성-문서 변환 어시스턴트 가이드! XIX.AI는 모든 팀 대화를 즉시 완벽하고 체계적인 기록으로 변환해 주는, 매우 강력하고 혁신적인 도구 모음을 엄선했습니다. 매주 업데이트되는 저희 순위 목록에는 무료 및 유료 옵션이 모두 포함되어 있으며, 모든 업무 상황에서 생산성을 높이는 데 얼마나 효과적인지 보여주는 실제 테스트 결과도 함께 제공됩니다. AI의 장점을 최대한 활용하고자 하는 분이라면 꼭 시도해 보셔야 할 필수 가이드입니다. 지금 바로 확인해 보세요!
웹사이트를 방문하면 브라우저에 정보를 저장하거나 불러올 수 있으며, 대부분은 쿠키의 형태입니다. 이 정보는 사용자, 환경설정 또는 기기에 관한 것일 수 있으며, 사이트가 기대한 대로 작동하도록 하는 데 주로 사용됩니다. 이 정보가 직접적으로 사용자를 식별하지는 않지만, 더 개인화된 웹 환경을 제공할 수 있습니다. 당사는 사용자의 개인정보 보호 권리를 존중하기 때문에 일부 유형의 쿠키를 허용하지 않을 수 있습니다. 각 카테고리 제목을 클릭하면 자세히 알아보고 기본 설정을 변경할 수 있습니다. 그러나 일부 유형의 쿠키를 차단하면 사이트 이용 경험 및 제공 가능한 서비스에 영향을 줄 수 있습니다. 개인정보 취급방침성명
환경설정 관리
필수 쿠키
항상 활성화
이 쿠키는 웹사이트가 정상적으로 기능하는 데 필요하며, 우리 시스템에서 끌 수 없습니다. 이러한 쿠키는 일반적으로 개인정보 설정, 로그인 또는 양식 작성과 같은 서비스 요청에 해당하는 사용자 행동에 응답하여만 설정됩니다. 브라우저를 설정하여 이러한 쿠키를 차단하거나 경고할 수 있지만, 그 경우 사이트의 일부 기능이 작동하지 않을 수 있습니다. 이러한 쿠키는 개인 식별 정보를 저장하지 않습니다.