Datagemma는 실제 데이터를 사용하여 AI 환각을 다룹니다

대규모 언어 모델(LLMs)은 오늘날 AI 혁신의 핵심에 있으며, 방대한 텍스트 데이터셋을 분석하여 요약을 생성하고, 창의적인 아이디어를 촉발하며, 심지어 코드를 작성할 수 있습니다. 하지만 그 능력에도 불구하고, 이 모델들은 때때로 완전히 잘못된 정보를 제공하는데, 이를 우리는 "환각(hallucination)"이라고 부릅니다. 이는 생성 AI 세계에서 큰 장애물입니다.
우리는 이 문제를 정면으로 해결하는 최첨단 연구를 공유하게 되어 기쁩니다. 이 연구는 LLMs를 실세계 통계에 기반을 두어 환각을 줄이는 것을 목표로 합니다. 그리고 우리는 Google의 Data Commons에서 제공하는 풍부한 실세계 데이터와 LLMs를 연결하는 최초의 오픈 모델인 DataGemma를 소개하게 되어 매우 기쁩니다.
Data Commons: 신뢰할 수 있는 데이터의 보물창고
Data Commons는 건강에서 경제에 이르기까지 모든 주제에 걸쳐 2400억 개 이상의 데이터 포인트를 자랑하는 거대한, 끊임없이 성장하는 공개 데이터 도서관과 같습니다. 이 정보는 UN, WHO, CDC, 인구조사국과 같은 신뢰할 수 있는 출처에서 가져옵니다. 이러한 데이터셋을 단일한 강력한 도구와 AI 모델로 통합함으로써, Data Commons는 정책 입안자, 연구자, 조직이 필요한 정확한 통찰을 얻을 수 있도록 돕습니다.
평범한 영어로 질문을 던질 수 있는 거대한 데이터베이스를 상상해보세요. 예를 들어, 어떤 아프리카 국가들이 전기 접근성이 가장 크게 증가했는지, 또는 미국 카운티에서 소득이 당뇨병과 어떻게 관련 있는지. 이것이 Data Commons입니다.
Data Commons가 환각을 줄이는 방법
점점 더 많은 사람들이 생성 AI를 사용함에 따라, 우리는 Data Commons를 우리의 가볍고 우수한 오픈 모델 패밀리인 Gemma에 통합하여 이러한 경험을 더 견고하게 만들고자 합니다. 이 DataGemma 모델들은 이제 연구자와 개발자들이 탐구할 수 있도록 제공됩니다.
DataGemma는 Data Commons의 지식을 활용하여 LLMs의 정확성과 추론 능력을 향상시키는 두 가지 멋진 방법을 사용해 Gemma의 능력을 강화합니다:
RIG (Retrieval-Interleaved Generation)는 Data Commons에 대한 사실 확인을 적극적으로 수행하여 Gemma 2 모델을 강화합니다. DataGemma에 질문을 하면, Data Commons에서 통계 데이터를 찾아내어 확실한 답변을 제공합니다. RIG는 새로운 아이디어가 아니지만, 우리가 DataGemma에서 사용하는 방식은 꽤 독특합니다.
예시 질의: ''세계에서 재생 가능 에너지 사용이 증가했나요?'' DataGemma RIG 방법론을 적용하면 Data Commons(DC)에서 권위 있는 데이터를 활용합니다.
RAG (Retrieval-Augmented Generation)는 언어 모델이 학습된 내용을 넘어 추가 정보를 가져와 더 풍부하고 정확한 답변을 제공하도록 합니다. DataGemma에서는 Gemini 1.5 Pro의 긴 컨텍스트 창을 사용해 모델이 답변을 생성하기 전에 Data Commons에서 관련 데이터를 가져와 환각을 줄입니다.
예시 질의: ''세계에서 재생 가능 에너지 사용이 증가했나요?'' DataGemma RAG 방법론을 적용하면 더 뛰어난 추론과 각주 포함을 보여줍니다.
유망한 결과와 다음 단계
RIG와 RAG에 대한 초기 테스트 결과는 긍정적입니다. 숫자를 다룰 때 모델의 정확도가 향상되어 연구, 의사 결정, 또는 단순한 호기심 충족을 위해 이 모델을 사용하는 사람들에게 환각이 줄어들고 있습니다. 이러한 결과는 우리의 연구 논문에서 확인할 수 있습니다.
RAG 질의와 응답의 예시. Data Commons에서 제공된 표로 참조되는 근거 통계가 지원됩니다. *간략함을 위해 부분 응답만 표시.
우리는 여기서 멈추지 않습니다. 우리는 이러한 방법을 개선하고, 노력을 확대하며, 더 많은 테스트를 통해 철저히 검증할 것입니다. 결국, 우리는 Gemma와 Gemini 모델 모두에 이러한 개선 사항을 점진적으로 배포할 것이며, 제한된 접근 단계부터 시작합니다.
우리의 연구를 공유하고 이 새로운 Gemma 모델 변형을 오픈함으로써, 우리는 Data Commons 기반 기술의 사용을 널리 확산시키고자 합니다. LLMs를 더 신뢰할 수 있고 믿을 만한 도구로 만드는 것은 모두에게 필수적인 도구로 전환하는 데 중요하며, AI가 정확한 정보를 제공하고, 정보에 기반한 선택을 지원하며, 세상에 대한 우리의 이해를 깊게 하는 미래를 만드는 데 기여합니다.
연구자와 개발자는 RIG와 RAG를 위한 우리의 퀵스타트 노트북을 사용해 DataGemma를 바로 시작할 수 있습니다. Data Commons와 Gemma가 어떻게 함께 작동하는지 더 깊이 알아보려면, 우리의 연구 게시물을 확인하세요.
관련 기사
워너 뮤직이 AI 귀속 스타트업 서룰 AI를 인수하다
워너 뮤직 그룹(WMG)은 수요일 Sureel AI라는 인공지능 속성 추적 스타트업을 인수한다고 확인했다. Sureel의 독점 기술은 음악 트랙에 대한 ‘AI DNA’를 생성하며, 이를 구성 요소로 분해하여 AI 모델이 이러한 요소를 어떻게 활용하는지 추적한다.이번 인수를 통해 WMG는 아티스트와 작곡가의 작품이 AI 생성 콘텐츠에서 어떻게 활용되거나 AI 모델 학습에 사용되는지를 모니터링하는 능력을 강화할 계획이다.“Sureel을 WMG에
아마존은 쇼핑용 알렉사를 출시하면서 루푸스를 후순위로 밀어붙이고 있다
아마존은 Alexa for Shopping을 출시하며, Rufus 쇼핑 챗봇과 Alexa+를 앱, 웹사이트 및 Echo Show 기기 전반에 걸쳐 통합했습니다.이 도우미는 제품 문의에 답변하고, 상품을 비교하며, 가격을 추적하고, 쇼핑 알림을 지원합니다. 또한 예약된 쇼핑 작업과 자격이 있는 자동 구매도 처리합니다.회사에 따르면, Alexa for Shopping은 Rufus의 제품 전문성과 Alexa+의 개인화된 도우미 컨텍스트를 결합합니
마이크로소프트, 애저, AI 기술이 캘리포니아 산불 위험에 맞서다
마이크로소프트는 AI 기반 산불 탐지 기술에 투자하고 있으며, CVP 겸 수석 데이터 과학자인 후안 라비스타 페레스가 환경 피해 완화 전략을 논의하고 있다.NASA에 따르면, 기후 변화는 지구상의 모든 사람에게 영향을 미치며, 기온 상승, 강수 패턴의 변화, 해수면 상승 등의 형태로 나타납니다.NASA는 인간 활동이 주된 원인으로 작용하여 지구가 전례 없는
관련 특별 주제 추천
의견 (42)
0/500
Interesting approach! Using real-world data to ground the model seems like a practical step beyond just scaling parameters. Hope it doesn't just trade hallucinations for boring, overly-cautious outputs though. The 'Gemma' naming trend continues! 🤔
Finally! A real solution to AI hallucinations? DataGemma sounds promising, but I'm honestly a bit skeptical. 🤔 How do they ensure the "real-world data" isn't biased itself? Would love to see a breakdown of their methodology compared to other approaches like Retrieval-Augmented Generation.
Me pregunto si DataGemma realmente podrá resolver el problema de las alucinaciones en IA. Parece prometedor, pero ya hemos visto muchas soluciones 'milagrosas' que luego no cumplen. Ojalá esta vez sea diferente, porque los errores en los modelos actuales pueden ser bastante graves 😅
This article on DataGemma is super intriguing! It's wild how LLMs can churn out so much but still trip up on facts sometimes. 😅 Makes me wonder if grounding them in real-world data could finally make AI as reliable as we hope!

대규모 언어 모델(LLMs)은 오늘날 AI 혁신의 핵심에 있으며, 방대한 텍스트 데이터셋을 분석하여 요약을 생성하고, 창의적인 아이디어를 촉발하며, 심지어 코드를 작성할 수 있습니다. 하지만 그 능력에도 불구하고, 이 모델들은 때때로 완전히 잘못된 정보를 제공하는데, 이를 우리는 "환각(hallucination)"이라고 부릅니다. 이는 생성 AI 세계에서 큰 장애물입니다.
우리는 이 문제를 정면으로 해결하는 최첨단 연구를 공유하게 되어 기쁩니다. 이 연구는 LLMs를 실세계 통계에 기반을 두어 환각을 줄이는 것을 목표로 합니다. 그리고 우리는 Google의 Data Commons에서 제공하는 풍부한 실세계 데이터와 LLMs를 연결하는 최초의 오픈 모델인 DataGemma를 소개하게 되어 매우 기쁩니다.
Data Commons: 신뢰할 수 있는 데이터의 보물창고
Data Commons는 건강에서 경제에 이르기까지 모든 주제에 걸쳐 2400억 개 이상의 데이터 포인트를 자랑하는 거대한, 끊임없이 성장하는 공개 데이터 도서관과 같습니다. 이 정보는 UN, WHO, CDC, 인구조사국과 같은 신뢰할 수 있는 출처에서 가져옵니다. 이러한 데이터셋을 단일한 강력한 도구와 AI 모델로 통합함으로써, Data Commons는 정책 입안자, 연구자, 조직이 필요한 정확한 통찰을 얻을 수 있도록 돕습니다.
평범한 영어로 질문을 던질 수 있는 거대한 데이터베이스를 상상해보세요. 예를 들어, 어떤 아프리카 국가들이 전기 접근성이 가장 크게 증가했는지, 또는 미국 카운티에서 소득이 당뇨병과 어떻게 관련 있는지. 이것이 Data Commons입니다.
Data Commons가 환각을 줄이는 방법
점점 더 많은 사람들이 생성 AI를 사용함에 따라, 우리는 Data Commons를 우리의 가볍고 우수한 오픈 모델 패밀리인 Gemma에 통합하여 이러한 경험을 더 견고하게 만들고자 합니다. 이 DataGemma 모델들은 이제 연구자와 개발자들이 탐구할 수 있도록 제공됩니다.
DataGemma는 Data Commons의 지식을 활용하여 LLMs의 정확성과 추론 능력을 향상시키는 두 가지 멋진 방법을 사용해 Gemma의 능력을 강화합니다:
RIG (Retrieval-Interleaved Generation)는 Data Commons에 대한 사실 확인을 적극적으로 수행하여 Gemma 2 모델을 강화합니다. DataGemma에 질문을 하면, Data Commons에서 통계 데이터를 찾아내어 확실한 답변을 제공합니다. RIG는 새로운 아이디어가 아니지만, 우리가 DataGemma에서 사용하는 방식은 꽤 독특합니다.
예시 질의: ''세계에서 재생 가능 에너지 사용이 증가했나요?'' DataGemma RIG 방법론을 적용하면 Data Commons(DC)에서 권위 있는 데이터를 활용합니다. RAG (Retrieval-Augmented Generation)는 언어 모델이 학습된 내용을 넘어 추가 정보를 가져와 더 풍부하고 정확한 답변을 제공하도록 합니다. DataGemma에서는 Gemini 1.5 Pro의 긴 컨텍스트 창을 사용해 모델이 답변을 생성하기 전에 Data Commons에서 관련 데이터를 가져와 환각을 줄입니다.
예시 질의: ''세계에서 재생 가능 에너지 사용이 증가했나요?'' DataGemma RAG 방법론을 적용하면 더 뛰어난 추론과 각주 포함을 보여줍니다.
유망한 결과와 다음 단계
RIG와 RAG에 대한 초기 테스트 결과는 긍정적입니다. 숫자를 다룰 때 모델의 정확도가 향상되어 연구, 의사 결정, 또는 단순한 호기심 충족을 위해 이 모델을 사용하는 사람들에게 환각이 줄어들고 있습니다. 이러한 결과는 우리의 연구 논문에서 확인할 수 있습니다.
우리의 연구를 공유하고 이 새로운 Gemma 모델 변형을 오픈함으로써, 우리는 Data Commons 기반 기술의 사용을 널리 확산시키고자 합니다. LLMs를 더 신뢰할 수 있고 믿을 만한 도구로 만드는 것은 모두에게 필수적인 도구로 전환하는 데 중요하며, AI가 정확한 정보를 제공하고, 정보에 기반한 선택을 지원하며, 세상에 대한 우리의 이해를 깊게 하는 미래를 만드는 데 기여합니다.
연구자와 개발자는 RIG와 RAG를 위한 우리의 퀵스타트 노트북을 사용해 DataGemma를 바로 시작할 수 있습니다. Data Commons와 Gemma가 어떻게 함께 작동하는지 더 깊이 알아보려면, 우리의 연구 게시물을 확인하세요.
워너 뮤직이 AI 귀속 스타트업 서룰 AI를 인수하다
워너 뮤직 그룹(WMG)은 수요일 Sureel AI라는 인공지능 속성 추적 스타트업을 인수한다고 확인했다. Sureel의 독점 기술은 음악 트랙에 대한 ‘AI DNA’를 생성하며, 이를 구성 요소로 분해하여 AI 모델이 이러한 요소를 어떻게 활용하는지 추적한다.이번 인수를 통해 WMG는 아티스트와 작곡가의 작품이 AI 생성 콘텐츠에서 어떻게 활용되거나 AI 모델 학습에 사용되는지를 모니터링하는 능력을 강화할 계획이다.“Sureel을 WMG에
마이크로소프트, 애저, AI 기술이 캘리포니아 산불 위험에 맞서다
마이크로소프트는 AI 기반 산불 탐지 기술에 투자하고 있으며, CVP 겸 수석 데이터 과학자인 후안 라비스타 페레스가 환경 피해 완화 전략을 논의하고 있다.NASA에 따르면, 기후 변화는 지구상의 모든 사람에게 영향을 미치며, 기온 상승, 강수 패턴의 변화, 해수면 상승 등의 형태로 나타납니다.NASA는 인간 활동이 주된 원인으로 작용하여 지구가 전례 없는
Interesting approach! Using real-world data to ground the model seems like a practical step beyond just scaling parameters. Hope it doesn't just trade hallucinations for boring, overly-cautious outputs though. The 'Gemma' naming trend continues! 🤔
Finally! A real solution to AI hallucinations? DataGemma sounds promising, but I'm honestly a bit skeptical. 🤔 How do they ensure the "real-world data" isn't biased itself? Would love to see a breakdown of their methodology compared to other approaches like Retrieval-Augmented Generation.
Me pregunto si DataGemma realmente podrá resolver el problema de las alucinaciones en IA. Parece prometedor, pero ya hemos visto muchas soluciones 'milagrosas' que luego no cumplen. Ojalá esta vez sea diferente, porque los errores en los modelos actuales pueden ser bastante graves 😅
This article on DataGemma is super intriguing! It's wild how LLMs can churn out so much but still trip up on facts sometimes. 😅 Makes me wonder if grounding them in real-world data could finally make AI as reliable as we hope!





집






