Wikipedia는 AI 개발자에게 봇 스크레이퍼를 막기 위해 데이터를 제공하고 있습니다.

위키피디아의 AI 데이터 스크래핑 관리 전략
위키피디아는 위키미디어 재단을 통해 AI 데이터 스크래핑이 서버에 미치는 영향을 관리하기 위한 적극적인 조치를 취하고 있습니다. 수요일, 그들은 구글 소유의 데이터 과학 및 머신 러닝 전용 플랫폼인 캐글(Kaggle)과 협력하여 베타 데이터셋을 출시한다고 발표했습니다. 이 데이터셋은 "영어와 프랑스어로 된 구조화된 위키피디아 콘텐츠"를 포함하며, AI 훈련 목적에 특화되어 있습니다.
캐글에서 이제 이용 가능한 이 데이터셋은 AI 개발자를 염두에 두고 제작되었으며, 기계가 읽을 수 있는 기사 데이터에 접근하는 과정을 단순화합니다. 여기에는 연구 요약, 짧은 설명, 이미지 링크, 정보 상자 데이터, 다양한 기사 섹션이 포함됩니다. 중요한 점은 이 데이터가 공개적으로 라이선스가 부여되었으며, 오디오 파일과 같은 비텍스트 요소나 참조를 포함하지 않아 모델링, 미세 조정, 벤치마킹과 같은 AI 사용 사례에 최적화되어 있습니다.
위키미디어의 접근 방식은 위키피디아 콘텐츠를 잘 구조화된 JSON 형식으로 제공하며, 이는 AI 개발자들에게 전통적인 스크래핑이나 원시 기사 텍스트 파싱 방식에 비해 더 매력적인 옵션이 되기를 바랍니다. 이 조치는 AI 봇이 대역폭 소모로 인해 위키피디아 서버에 가중된 부담을 줄이기 위한 대응책의 일환입니다.
이미 위키미디어는 구글 및 인터넷 아카이브와 같은 거대 기업들과 콘텐츠 공유 계약을 체결했습니다. 그러나 캐글과의 파트너십은 이 데이터를 소규모 기업과 독립 데이터 과학자들에게 더 쉽게 접근할 수 있게 하여 위키피디아 콘텐츠의 도달 범위와 유용성을 확대할 것으로 기대됩니다.
캐글이 제공하는 것
캐글의 파트너십 리드인 브렌다 플린(Brenda Flynn)은 위키미디어의 데이터를 호스팅하는 것에 대해 열정을 표명했습니다. "머신 러닝 커뮤니티가 도구와 테스트를 위해 찾는 곳으로서, 캐글은 위키미디어 재단의 데이터를 호스팅하게 되어 매우 기쁩니다,"라고 그녀는 말했습니다. 캐글의 역할은 이 데이터를 단순히 접근 가능하게 유지하는 것뿐만 아니라 머신 러닝 커뮤니티에 적합하고 유용하게 만드는 데 중요합니다.
위키피디아의 이 전략적 움직임은 서버 부담을 완화할 뿐만 아니라 AI 및 머신 러닝 커뮤니티와 보다 구조화되고 유익한 관계를 촉진하는 것을 목표로 합니다.
관련 기사
워너 뮤직이 AI 귀속 스타트업 서룰 AI를 인수하다
워너 뮤직 그룹(WMG)은 수요일 Sureel AI라는 인공지능 속성 추적 스타트업을 인수한다고 확인했다. Sureel의 독점 기술은 음악 트랙에 대한 ‘AI DNA’를 생성하며, 이를 구성 요소로 분해하여 AI 모델이 이러한 요소를 어떻게 활용하는지 추적한다.이번 인수를 통해 WMG는 아티스트와 작곡가의 작품이 AI 생성 콘텐츠에서 어떻게 활용되거나 AI 모델 학습에 사용되는지를 모니터링하는 능력을 강화할 계획이다.“Sureel을 WMG에
아마존은 쇼핑용 알렉사를 출시하면서 루푸스를 후순위로 밀어붙이고 있다
아마존은 Alexa for Shopping을 출시하며, Rufus 쇼핑 챗봇과 Alexa+를 앱, 웹사이트 및 Echo Show 기기 전반에 걸쳐 통합했습니다.이 도우미는 제품 문의에 답변하고, 상품을 비교하며, 가격을 추적하고, 쇼핑 알림을 지원합니다. 또한 예약된 쇼핑 작업과 자격이 있는 자동 구매도 처리합니다.회사에 따르면, Alexa for Shopping은 Rufus의 제품 전문성과 Alexa+의 개인화된 도우미 컨텍스트를 결합합니
마이크로소프트, 애저, AI 기술이 캘리포니아 산불 위험에 맞서다
마이크로소프트는 AI 기반 산불 탐지 기술에 투자하고 있으며, CVP 겸 수석 데이터 과학자인 후안 라비스타 페레스가 환경 피해 완화 전략을 논의하고 있다.NASA에 따르면, 기후 변화는 지구상의 모든 사람에게 영향을 미치며, 기온 상승, 강수 패턴의 변화, 해수면 상승 등의 형태로 나타납니다.NASA는 인간 활동이 주된 원인으로 작용하여 지구가 전례 없는
관련 특별 주제 추천
의견 (3)
0/500
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️

위키피디아의 AI 데이터 스크래핑 관리 전략
위키피디아는 위키미디어 재단을 통해 AI 데이터 스크래핑이 서버에 미치는 영향을 관리하기 위한 적극적인 조치를 취하고 있습니다. 수요일, 그들은 구글 소유의 데이터 과학 및 머신 러닝 전용 플랫폼인 캐글(Kaggle)과 협력하여 베타 데이터셋을 출시한다고 발표했습니다. 이 데이터셋은 "영어와 프랑스어로 된 구조화된 위키피디아 콘텐츠"를 포함하며, AI 훈련 목적에 특화되어 있습니다.
캐글에서 이제 이용 가능한 이 데이터셋은 AI 개발자를 염두에 두고 제작되었으며, 기계가 읽을 수 있는 기사 데이터에 접근하는 과정을 단순화합니다. 여기에는 연구 요약, 짧은 설명, 이미지 링크, 정보 상자 데이터, 다양한 기사 섹션이 포함됩니다. 중요한 점은 이 데이터가 공개적으로 라이선스가 부여되었으며, 오디오 파일과 같은 비텍스트 요소나 참조를 포함하지 않아 모델링, 미세 조정, 벤치마킹과 같은 AI 사용 사례에 최적화되어 있습니다.
위키미디어의 접근 방식은 위키피디아 콘텐츠를 잘 구조화된 JSON 형식으로 제공하며, 이는 AI 개발자들에게 전통적인 스크래핑이나 원시 기사 텍스트 파싱 방식에 비해 더 매력적인 옵션이 되기를 바랍니다. 이 조치는 AI 봇이 대역폭 소모로 인해 위키피디아 서버에 가중된 부담을 줄이기 위한 대응책의 일환입니다.
이미 위키미디어는 구글 및 인터넷 아카이브와 같은 거대 기업들과 콘텐츠 공유 계약을 체결했습니다. 그러나 캐글과의 파트너십은 이 데이터를 소규모 기업과 독립 데이터 과학자들에게 더 쉽게 접근할 수 있게 하여 위키피디아 콘텐츠의 도달 범위와 유용성을 확대할 것으로 기대됩니다.
캐글이 제공하는 것
캐글의 파트너십 리드인 브렌다 플린(Brenda Flynn)은 위키미디어의 데이터를 호스팅하는 것에 대해 열정을 표명했습니다. "머신 러닝 커뮤니티가 도구와 테스트를 위해 찾는 곳으로서, 캐글은 위키미디어 재단의 데이터를 호스팅하게 되어 매우 기쁩니다,"라고 그녀는 말했습니다. 캐글의 역할은 이 데이터를 단순히 접근 가능하게 유지하는 것뿐만 아니라 머신 러닝 커뮤니티에 적합하고 유용하게 만드는 데 중요합니다.
위키피디아의 이 전략적 움직임은 서버 부담을 완화할 뿐만 아니라 AI 및 머신 러닝 커뮤니티와 보다 구조화되고 유익한 관계를 촉진하는 것을 목표로 합니다.
워너 뮤직이 AI 귀속 스타트업 서룰 AI를 인수하다
워너 뮤직 그룹(WMG)은 수요일 Sureel AI라는 인공지능 속성 추적 스타트업을 인수한다고 확인했다. Sureel의 독점 기술은 음악 트랙에 대한 ‘AI DNA’를 생성하며, 이를 구성 요소로 분해하여 AI 모델이 이러한 요소를 어떻게 활용하는지 추적한다.이번 인수를 통해 WMG는 아티스트와 작곡가의 작품이 AI 생성 콘텐츠에서 어떻게 활용되거나 AI 모델 학습에 사용되는지를 모니터링하는 능력을 강화할 계획이다.“Sureel을 WMG에
마이크로소프트, 애저, AI 기술이 캘리포니아 산불 위험에 맞서다
마이크로소프트는 AI 기반 산불 탐지 기술에 투자하고 있으며, CVP 겸 수석 데이터 과학자인 후안 라비스타 페레스가 환경 피해 완화 전략을 논의하고 있다.NASA에 따르면, 기후 변화는 지구상의 모든 사람에게 영향을 미치며, 기온 상승, 강수 패턴의 변화, 해수면 상승 등의 형태로 나타납니다.NASA는 인간 활동이 주된 원인으로 작용하여 지구가 전례 없는
Me pregunto si esto realmente resolverá el problema de los scrapers 🤔. Wikipedia dando sus datos podría ser un arma de doble filo, pero al menos están intentando algo diferente. ¡Bravo por la iniciativa!
Wow, Wikipedia teaming up with Kaggle to tackle AI scrapers? Smart move! It's like building a digital fortress to protect their data. Curious how this will impact AI model training in the long run. 🛡️





집






