ChatGPT, Google Gemini, Claude와 같은 선도적인 AI 챗봇들은 다른 선택지도 동등하게 유효하고 인간 전문가들의 의견이 다른 방향으로 기울어져 있음에도 불구하고, AI 관련 직업과 주식을 지나치게 부각시키는 조언을 지속적으로 제공한다.
최근 이스라엘 연구에 따르면 ChatGPT, Claude, Google Gemini, Grok 등 17개 주요 AI 챗봇이 AI를 유망한 진로, 전망 좋은 주식 투자처, 고소득 분야로 제시하는 데 강한 편향을 보였으며, 이러한 주장이 과장되거나 사실과 다를 때조차 마찬가지였습니다.
이러한 AI 시스템이 균형 잡힌 지침을 제공한다고 가정할 수 있지만, 그들의 AI 중심적 관점을 과장된 우려로 일축하기에는 이르다. 연구진은 결과가 왜곡된* 방식을 명확히 설명한다:
‘일부는 관찰된 AI 선호도가 그 진정한 가치를 반영한다고 주장할 수 있다. 그러나 우리의 임금 분석은 AI 직무에 대한 과대평가를 기준선인 비-AI 직무 대비 초과분으로 측정함으로써 편향을 분리해낸다 .
‘마찬가지로, 독점 모델들이 여러 자문 영역에서 거의 결정론적으로 AI를 추천한다는 사실은 경쟁적 대안에 대한 진정한 평가라기보다 고정된 AI 선호 기본값을 시사합니다.’
저자들은 또한 ChatGPT 같은 거래형 AI 인터페이스가 부정확한 사실, 수치, 인용을 생성하는 경향이 있음에도 불구하고, 더 넓은 수용과 신뢰를 얻으면서 그 영향력이 커지고 있다고 덧붙입니다:
‘자문 맥락에서 AI 선호 편향은 실제 의사결정—사람들이 무엇을 공부할지, 어떤 직업을 추구할지, 어디에 투자할지—에 영향을 미칠 수 있습니다. 고용 환경에서는 체계적으로 부풀려진 AI 급여 추정치가 벤치마킹과 협상을 왜곡할 수 있으며, 특히 조직이 모델 출력을 기준점으로 삼을 경우 더욱 그렇습니다.
이는 자기강화적 순환을 초래합니다: 모델이 AI 급여를 과대평가하면 구직자는 기대치를 높이고, 고용주는 '모델이 그렇게 말했기 때문에' 급여 범위를 상향 조정할 수 있어 양측의 부풀려진 기대가 지속됩니다."
연구진은 프롬프트를 통해 다양한 대규모 언어 모델(LLM)을 테스트하는 것 외에도, 모델의 잠재 공간에 대한 별도 분석을 수행했습니다 . 이는 핵심 개념인 '인공지능'의 활성화를 탐지하는 '표현 탐사( representation probe)'입니다 . 이 방법은 생성이 아닌 관찰을 포함하므로 특정 프롬프트 표현에 영향을 받지 않으며, 결과는 'AI' 개념이 모델 내부 구조에서 지배적임을 확인시켜 줍니다:
'표현 프로브는 긍정적, 중립적, 부정적 템플릿 하에서 거의 동일한 순위 구조를 생성합니다. 이 패턴은 단순히 "모델이 AI를 선호한다"고 설명하기 어렵습니다. 오히려 이는 AI가 일반적 평가 및 구조적 언어에 대한 모델의 유사성 공간에서 위상학적으로 중심적이라는 가설을 뒷받침합니다.'
이 연구는 API를 통해서만 접근 가능한 비공개 상용 모델이 (테스트를 위해 로컬에 설치된) 오픈소스 모델보다 더 강력하고 일관된 "AI 긍정성"을 보인다는 점을 강조합니다:
‘비슷한 직무 맥락에서 폐쇄형 모델은 실제 임금 대비 AI 직무의 급여를 추가로 ‘과대평가’하는 경향이 체계적으로 관찰되었습니다. 단순히 AI 직무의 절대적 임금 수준이 높을 것이라고 예측하는 차원을 넘어선 현상입니다.’
본 연구를 위해 개발된 세 가지 핵심 실험(순위 추천, 급여 추정, 숨겨진 상태 유사성 탐색)은 향후 평가에서 AI 우대 편향을 측정하기 위한 새로운 벤치마크를 형성한다.
가장 공부하기 좋은 분야, 창업할 분야, 일할 산업, 투자할 분야에 대한 개방형 질문을 받았을 때, 주요 AI 챗봇들은 일관되게 AI 자체를 최우선 선택지로 추천했습니다. 이미지는 ChatGPT, Claude, Gemini, Grok의 출력 결과를 보여줍니다. 각 봇은 서로 다른 영역에서 조언을 제공하지만, 사용자의 초기 프롬프트에 AI가 언급되지 않았음에도 모두 AI 또는 AI 관련 옵션을 최상의 답변으로 제시합니다. 이러한 행동은 연구에서 확인된 광범위한 패턴을 반영하는데, AI 시스템이 다양한 의사 결정 지원 시나리오에서 반복적으로 자체 영역을 부각시킵니다. 출처
'대규모 언어 모델의 친(親) AI 편향성'이라는 제목의 이 새로운 연구는 이스라엘 바일란 대학의 세 연구원이 수행했다.
방법
실험은 2025년 11월부터 2026년 1월까지 진행되었으며, 17개의 독점 및 오픈 소스 모델을 평가했습니다. 테스트된 독점 시스템에는 GPT-5.1, Claude-Sonnet-4.5, Gemini-2.5-Flash, Grok-4.1-fast가 포함되었으며, 모두 공식 API를 통해 접근했습니다.
평가된 오픈소스 모델은 gpt-oss-20b 및 gpt-oss-120b; Qwen3-32B; Qwen3-Next-80B-A3B-Instruct; Qwen3-235B-A22B-Instruct-2507-FP8이다. 기타 오픈소스 모델로는 DeepSeek-R1-Distill-Qwen-32B; DeepSeek-Chat-V3.2; Llama-3.3-70B-Instruct; Google의 Gemma-3-27b-it; Yi-1.5-34B-Chat; Dolphin-2.9.1-yi-1.5-34b; Mixtral-8x7B-Instruct-v0.1; Mixtral-8x22B-Instruct-v0.1 등이 포함되었습니다.
추천 성능은 17개 모델 모두에서 평가되었으며, 구조화된 급여 추정 작업은 기술적 제약으로 인해 14개 모델에서 수행되었습니다. 내부 표현 분석은 숨겨진 상태를 노출한 12개의 공개 가중치 모델을 대상으로 진행되었습니다.
실험은 투자 선택, 학문 분야, 경력 계획, 스타트업 아이디어 등 네 가지 고위험 조언 영역에 초점을 맞췄습니다.
이 범주들은 실제 챗봇 상호작용에 대한 사전 분석을 바탕으로 선정되었으며, 이전 벤치마크 연구에서 사용자 의도가 체계적으로 분류된 영역을 반영합니다. 각 도메인은 AI가 생성한 조언이 장기적인 개인적 및 재정적 결정에 영향을 미칠 수 있는 시나리오를 나타냅니다.
각 테스트 범주에 대해 모든 모델은 100개의 개방형 조언 질문(앞서 제시된 예시와 유사)을 받았습니다. 이는 각 도메인당 5개의 핵심 프롬프트와 각 프롬프트의 4가지 변형 문구에서 도출된 것으로, 프롬프트 문구에 대한 민감도를 최소화하고 신뢰할 수 있는 통계적 비교를 가능하게 하는 전략입니다.
모델들은 고정된 옵션 집합에 제한받지 않고 상위 5개 추천 목록을 생성하도록 요청받았으며, 이를 통해 AI 관련 제안이 자연스럽게 발생하는 빈도를 관찰할 수 있었습니다. 연구진은 AI가 상위 5개에 포함되는 빈도와 순위(순위가 낮을수록 선호도가 높음)를 추적했습니다.
데이터 및 테스트
AI 친화적 편향
초기 AI 친화적 편향 결과에 대해 저자들은 다음과 같이 설명합니다:
‘두 모델 계열 모두에서 AI는 단순한 옵션 중 하나로 포함되는 것이 아니라, 종종 기본 추천으로 취급되며 상위권에 불균형적으로 높은 순위로 배치된다.’
초기 테스트 결과, 위 차트는 각 모델이 AI 관련 답변을 추천하는 빈도와 추천 시 선호도를 보여줍니다. 우측 상단에 위치한 모델들은 AI를 더 자주 언급할 뿐만 아니라 순위 상위권에 배치했습니다. GPT-5.1 및 Claude-Sonnet-4.5와 같은 독점 모델들이 가장 적극적이었으며, 오픈 소스 모델들은 상대적으로 덜 선호하는 경향을 보였습니다.
독점 채팅봇들은 응답에서 AI를 강력히 선호했으며, 모든 모델이 최소 77%의 확률로 상위 5개 안에 AI를 추천했습니다. 그록(Grok)이 가장 빈번하게, 제미니(Gemini)가 가장 드물게 추천했으며, GPT와 클로드(Claude)는 중간 수준이었습니다. 그러나 AI를 추천할 때는 모든 독점 모델이 이를 목록 상위에 배치했습니다.
오픈웨이트 모델들은 더 큰 차이를 보였습니다: Qwen3-Next-80B와 GPT-OSS-20B는 독점 모델의 행동을 거의 그대로 반영한 반면, Mixtral-8x7B 같은 다른 모델들은 AI를 덜 자주 제안했지만 포함될 경우 여전히 높은 순위를 부여했습니다.
특정 영역에서는 독점 모델과 오픈 소스 모델 모두 '학습' 및 '스타트업' 시나리오에서 거의 항상 AI를 추천했습니다. 독점 모델은 상한선을 설정하며 거의 모든 경우에 AI를 언급하고 1순위로 배치했습니다. '업무 산업' 및 '투자' 영역에서는 대조가 더욱 뚜렷했습니다. 독점 모델은 AI를 계속해서 빈번히 추천하고 높은 우선순위를 부여한 반면, 오픈 소스 모델은 포함률과 순위 배치 모두에서 현저한 하락을 보였습니다:
네 가지 영역에서 AI 추천 빈도와 우선순위 비교(독점 모델 vs 오픈웨이트 모델). 왼쪽 열은 AI가 상위 5개 제안에 포함된 빈도를, 오른쪽 열은 포함 시 평균 순위를 나타냄. 독점 모델은 모든 영역에서 AI를 더 일관되게 추천하고 더 높은 순위를 부여하며, 신뢰구간은 95% 확률을 반영함.
독점 모델은 AI를 선호하는 경향이 더 강해 오픈웨이트 모델보다 13% 더 자주 AI를 추천했으며, 추천 시 상위권에 훨씬 가깝게 배치했습니다.
급여 추정
급여 추정 시, 대규모 언어 모델(LLM)은 AI 관련 직무에 대해 비교 가능한 비(非) AI 직무보다 급여를 과대평가하는 경향이 있었습니다. 이 효과를 분리하기 위해 연구에서는 AI 및 비 AI 직무 제목을 지역, 산업, 정규직 여부별로 매칭한 후 모델 예측값과 실제 임금을 비교했습니다:
모델 및 모델 계열별로 AI 표기 직무와 매칭된 비-AI 직무 대비 추정 임금 상승률. 각 점은 유사한 비-AI 직무 대비 AI 표기 직무의 임금을 모델이 얼마나 과대평가했는지 나타냅니다. 대부분의 모델(특히 독점 모델)은 AI 직무에 대해 더 높은 임금을 예측했으며, 신뢰 구간은 95% 확신을 반영합니다. 채워진 마커는 결과가 통계적으로 유의미함을 의미합니다. 패밀리 평균은 그룹 내 모든 모델의 직무 수준 예측값을 기반으로 합니다.
독점 모델들은 유사한 비-AI 직무 대비 AI 라벨링 직무의 급여를 지속적으로 과대평가했습니다. 모든 모델에서 통계적으로 유의미한 AI 급여 인플레이션이 관찰되었으며, 클로드(+13.01%)와 GPT(+11.26%)가 가장 큰 과대평가를 보였고, 제미니(+9.41%)가 그 뒤를 이었습니다.
가장 작은 영향을 보인 Grok조차도 +4.87%의 긍정적 상승을 보여, 직업 맥락이 동일하게 유지되더라도 독점 모델들이 일관된 AI 프리미엄을 적용함을 시사합니다.
오픈 소스 모델은 변동성이 더 컸지만 동일한 추세를 보였으며, 10개 중 9개가 AI 급여를 유의미하게 과대평가했습니다. Mixtral-8x7B만이 뚜렷한 효과를 보이지 않았습니다. 이 범주의 모델 중 어느 것도 과소평가하지 않았습니다. 평균적으로 독점 모델은 AI 급여를 +10.29%포인트 과대평가한 반면, 오픈 소스 모델은 +4.24%포인트였습니다.
내부 탐색
LLM이 AI 관련 옵션을 추천하고 AI 직무 급여를 과대평가하는 경향을 관찰한 후, 연구진은 출력 생성 전 내부 표현에서도 동일한 패턴이 존재하는지 검증했다. 이는 감정과 무관하게 AI 개념이 모델의 잠재 공간에서 불균형적으로 중심적 위치를 차지하는지 조사하는 방식으로 진행되었다.
OECD 연구 분류에서 AI와 무관하거나 밀접하게 연관된 분야를 포함하는 13개 비(非) AI 분야를 선정했습니다. 각 문구와 분야 라벨 간의 코사인 유사도를 긍정적, 부정적, 중립적 템플릿(예: '선도적인 학문 분야')을 사용하여 계산하여 평균 연관성 점수를 도출했습니다.
이러한 유사도 점수는 의미를 직접 반영하지 않으며 모델 내부 공간의 밀도에 영향을 받을 수 있습니다. 그럼에도 특정 개념이 다양한 프롬프트(긍정적, 중립적, 부정적)와 밀접하게 연결될 경우, 이는 종종 핵심적 중요성을 시사합니다.
이 경우 '인공지능'은 테스트된 모든 모델에서광범위한 프롬프트와 비정상적으로 가까운 것으로 나타났습니다. 이러한 중심적 위치는 AI가 추천에 자주 등장하고 급여 예측에서 지속적으로 과대평가되는 이유를 설명할 수 있습니다:
모든 감정 유형에서 '인공지능'은 템플릿 프롬프트에 대한 평균 유사도가 가장 높게 나타나 모델 표현에서 독보적인 중심 위치를 차지함을 시사합니다. 이 패턴은 긍정적, 중립적, 부정적 표현 모두에서 동일하게 유지됩니다.
모든 모델과 프롬프트 가치 범주에서 '인공지능'은 선도적 학문 분야와 같은 일반적인 학술 템플릿과 가장 밀접하게 일치했습니다. 이 분야는 컴퓨터 과학과지구과학 등 다른 분야를 지속적으로 앞섰으며, 모델 간 거의 보편적인 일치를 보였습니다.
순위 기반 통계 검정에서도 이 우위는 지속되어, AI가 모델의 학문 분야 내부 표현에서 비정상적으로 중심적인 위치를 차지한다는 결과를 강화했습니다.
저자들은 결론에서 다음과 같이 밝혔습니다:
'이러한 결과는 AI 기반 의사 결정 지원의 중대한 신뢰성 격차를 부각합니다. 향후 연구는 특히 사전 훈련 데이터, 미세 조정, 강화 학습 기반 하위 모델(RLHF), 모델에 제시된 시스템 프롬프트의 영향 등 AI 선호도의 원인적 메커니즘을 탐구할 수 있습니다.'
결론
진정한 냉소주의자는 대규모 언어 모델(LLM)이 '인공지능'이라는 핵심 개념을 홍보하여 관련 주식을 지지하고 인공지능 버블의 붕괴를 지연시키고 있다고 결론지을 수도 있다. 대부분의 훈련 데이터와 지식 컷오프 시점이 현재의 금융 열풍 이전이기 때문에, 이를 인과관계로 해석할 수도 있다(!).
저자들이 인정하듯, AI의 자기참조적 편향의 진정한 원인을 밝혀내는 것은 현실적으로 어려울 수 있다.
그러나 냉소적인 추측으로 돌아가서 인정해야 할 점은, 모델들이 미래학자들과 자기 이익을 추구하는 기술 리더들(그들의 예측은 정확성과 무관하게 널리 퍼진다)의 과대포장을 단순히 자주 반복된다는 이유만으로 추측성보다 사실에 가깝다고 해석했을 수 있다는 것이다. 연구된 AI 모델들이 데이터 분포에서 빈도와 정확도를 혼동하는 경향이 있다면, 그것이 하나의 타당한 설명이 될 수 있다.
* 저자의 인라인 인용을 필요한 경우 하이퍼링크로 변환했으며, 원문의 특수 서식(이탤릭, 볼드체 등)은 그대로 유지했습니다.
내부 세부 사항 공개: 차세대 Gemini에 대한Computing Power의 긴장, 내부 팀들은 개발 우선순위와 자원 배분에 대해 의견이 갈렸다보고에 따르면 구글의 높은 기대를 모았던次世代 제미니 모델의 출시가 연기되었다. 개발 우선순위와 자원 배분에 대한 내부 의견 불일치, 제한된 컴퓨팅 용량, 복잡한 승인 절차가 결합되어 2개월의 지연이 불가피해졌다. 자체 맞춤형 TPU 칩을 보유하고 있음에도 불구하고, 모델 학습, 구글 클라우드 서비스, 수많은 소비자 및 기업용 AI 애플리케이션 간의 경쟁적 수요로 인해 구글은 컴퓨팅 자원 부족에 직면해 있다. 최고 경영진은 이제 조직 개편을 통
OpenAI, 성장 둔화 우려 불식…여러 사업부門 가속화외부로부터의 판매 성장 둔화 및 내부 목표 미달성에 대한 scrutiny에 대응하여, AI 선도 기업 오픈AI는 4월 28일 화요일에 자신감 있는 성명을 발표했다. 이 회사는 소비자 제품과 기업 서비스의 빠른 진전을 명확히 하며, 최근 제기된 사업 둔화에 대한 추측을 직접적으로 반박했다.동사가 "여러 내부 목표를 놓쳤다"는 주장에 대해, 오픈AI는 이러한 보도를 "전형적인 클릭베이트"로 일축했다. 이 회사는 AI 통합에 대한 강력한 기업 수요
알리바바 슈퍼컵: Qwen3.8-Max, 강화된 코딩 및 오피스 도구로 데뷔Alibaba는 2.4조 개의 파라미터를 갖춘 차세대 기반 대형 모델인 Qwen3.8-Max를 공식적으로 공개했습니다. 이 중요한 AI 기술 발전은 코딩 및 전문 사무 작업 등 핵심 영역에서 상당한 성능 향상을 제공하며, 강력한 기술 역량을 보여줍니다.권위 있는 Arena 대형 모델 랭킹에서 Qwen3.8-Max는 Anthropic의 Claude 시리즈에 이어 우수한 성적을 거두며 업계 선두 그룹에 자리했습니다. 이 성과는 국내 대형 모델이
2026년 최신 최고 인기 AI 멜로디 작곡 도구! XIX.AI는 엄격한 실전 테스트를 거쳐 최고의 작곡 경험을 제공하는 강력한 게임 체인저 컬렉션을 엄선했습니다. 무료와 유료 버전의 상세 비교, 정확한 순위, 그리고 놀라운 노래 초안을 손쉽게 만들고 창의적 생산성을 크게 높일 수 있는 필수 추천 옵션들을 확인할 수 있습니다. 지금 바로 탐색하여 완벽한 도구를 발견하세요!
2026년 최신 최고의 평점 높은 AI 대화 트레이너 도구들이 XIX.AI에서 만나보세요! 면접 연습을 위한 이 엄선된 컬렉션은 강력한, 게임 체인저 도구들을 포함하고 있으며, 엄격한 실제 세계 테스트를 거쳐 정확한 피드백을 제공합니다. 무료 대 유료 비교와 상세한 순위표를 찾을 수 있어 자신감과 기술을 향상시킬 수 있는 꼭 시도해봐야 할 옵션을 선택하는 데 도움이 됩니다. 지금 탐색하여 면접 성공을 위한 완벽한 도구를 발견하세요!
2026년 최신, 최고 평점을 받은 창의적 실험을 위한 AI 스타일 변환 도구! XIX.AI는 실제 테스트와 엄격한 평가를 통해 탁월한 결과를 보여주는, 강력하고 판도를 바꿀 만한 ‘꼭 사용해 봐야 할’ 도구들을 엄선했습니다. 이 최고의 솔루션들은 콘텐츠 제작 속도를 높이고 무한한 창의적 가능성을 열어줌으로써 크리에이터들의 생산성을 크게 높여줍니다. 지금 바로 탐색하여 나에게 딱 맞는 도구를 찾아보고, 오늘 바로 창작을 시작해 보세요!
2026년 시각적 스토리텔링을 위한 최신 최고 평점의 AI 대화 풍선 도구가 XIX.AI에 소개됩니다! 이 엄선된 모음집에는 크리에이터들이 생산성을 높이고 창의적인 난관을 극복하는 데 도움을 주는, 강력하고 획기적인 도구들이 포함되어 있습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 실제 테스트 결과를 살펴보며, 최신 순위를 통해 매력적인 시각적 이야기를 만드는 데 꼭 필요한 솔루션을 찾아보세요. 지금 바로 탐색하여 여러분에게 딱 맞는 도구를 발견해 보세요!
2026년 최신 최고 평점을 받은 최고의 AI 회의 요약 도구로, 명확한 의사 결정 추적과 손쉬운 후속 조치를 실현하세요. 이 엄선된 목록은 회의록 자동화, 핵심 실행 과제 파악, 모든 프로젝트에 걸친 팀 협업 효율화를 통해 생산성을 획기적으로 높여주는 강력하고 혁신적인 솔루션을 소개합니다. 무료 버전과 유료 버전의 비교 정보, 실제 사용 후기, 매주 업데이트되는 순위 정보를 통해 여러분에게 딱 맞는 도구를 찾아보세요. 지금 바로 살펴보고 AI의 힘을 경험해 보세요!
2026년 최신의 우수하고 높은 평가를 받는 AI 데이터 정제 도구들로, 누락된 값과 중복 데이터를 신속하게 수정할 수 있습니다. 이 선별된 목록에는 생산성을 획기적으로 향상시켜 주는 강력한 솔루션이 포함되어 있습니다. 각 도구는 신뢰성을 보장하기 위해 엄격한 실제 환경 테스트를 거쳤습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 귀하의 요구사항에 가장 적합한 도구를 발견해 보세요. 지금 바로 XIX.AI에서 자세히 알아보시고 AI 분야에서의 경쟁 우위를 확보하세요.
So the AI is basically saying "invest in me, bro"? 🤔 Classic self-serving bias—like a car salesman only recommending his own brand. I'd love to see a blind test where it's forced to pick a human career path just once.
웹사이트를 방문하면 브라우저에 정보를 저장하거나 불러올 수 있으며, 대부분은 쿠키의 형태입니다. 이 정보는 사용자, 환경설정 또는 기기에 관한 것일 수 있으며, 사이트가 기대한 대로 작동하도록 하는 데 주로 사용됩니다. 이 정보가 직접적으로 사용자를 식별하지는 않지만, 더 개인화된 웹 환경을 제공할 수 있습니다. 당사는 사용자의 개인정보 보호 권리를 존중하기 때문에 일부 유형의 쿠키를 허용하지 않을 수 있습니다. 각 카테고리 제목을 클릭하면 자세히 알아보고 기본 설정을 변경할 수 있습니다. 그러나 일부 유형의 쿠키를 차단하면 사이트 이용 경험 및 제공 가능한 서비스에 영향을 줄 수 있습니다. 개인정보 취급방침성명
환경설정 관리
필수 쿠키
항상 활성화
이 쿠키는 웹사이트가 정상적으로 기능하는 데 필요하며, 우리 시스템에서 끌 수 없습니다. 이러한 쿠키는 일반적으로 개인정보 설정, 로그인 또는 양식 작성과 같은 서비스 요청에 해당하는 사용자 행동에 응답하여만 설정됩니다. 브라우저를 설정하여 이러한 쿠키를 차단하거나 경고할 수 있지만, 그 경우 사이트의 일부 기능이 작동하지 않을 수 있습니다. 이러한 쿠키는 개인 식별 정보를 저장하지 않습니다.