AI爬行者湧現Wikimedia Commons帶寬需求50%

維基媒體基金會,維基百科及眾多其他群眾外包知識平台的母體,於週三宣布,自2024年1月起,來自維基共享資源的多媒體下載頻寬使用量驚人地增長了50%。根據週二的一篇博客文章詳細說明,這一激增並非由於人類好奇心的增加,而是由於自動化爬蟲對數據的渴求,用於訓練AI模型。
“我們的基礎設施設計用於處理重大事件期間來自人類的突發流量激增,但來自爬蟲機器人的流量量無與倫比,且帶來日益增加的風險和成本,”該文章解釋道。
維基共享資源作為一個可自由訪問的圖像、視頻和音頻文件中心,所有內容均以開放許可證或公共領域形式提供。
深入探究,維基媒體透露,資源消耗最嚴重的流量中有高達65%來自機器人,這是以內容消耗類型衡量的。然而,這些機器人僅佔總頁面瀏覽量的35%。維基媒體表示,這一差異源於經常訪問的內容會被緩存在靠近用戶的地方,而機器人經常針對的較不受歡迎的內容則儲存在成本更高的“核心數據中心”。
“人類讀者傾向於專注於特定的、通常相似的話題,而爬蟲機器人則傾向於‘批量閱讀’更多頁面,並訪問較不受歡迎的頁面,”維基媒體指出。“這導致這些請求被轉發到核心數據中心,顯著增加了我們的資源消耗成本。”
因此,維基媒體基金會的網站可靠性團隊正在投入大量時間和資源來阻止這些爬蟲,以防止對日常用戶的干擾。這還未觸及基金會正應對的不斷上升的雲端成本。
這種情況是威脅開放互聯網的更廣泛趨勢的一部分。就在上個月,軟件工程師兼開源倡導者Drew DeVault哀嘆,AI爬蟲公然無視旨在阻止自動流量的“robots.txt”文件。同樣,被稱為“務實工程師”的Gergely Orosz最近也表達了他對來自Meta等公司的AI爬蟲如何使其項目頻寬需求激增的不滿。
雖然開源基礎設施尤其脆弱,但開發者們正以創造力和決心應對。TechCrunch上週報導,一些科技公司正在加緊行動。例如,Cloudflare推出了AI Labyrinth,旨在通過AI生成的內容減緩爬蟲速度。
然而,這仍然是一場持續的貓鼠遊戲,可能會迫使許多出版商退回到登錄和付費牆後,最終損害我們都依賴的網絡的開放性質。
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (15)
0/500
這流量暴增也太誇張了吧!AI爬蟲把Wikimedia Commons的頻寬吃掉一半?難怪最近載圖變超慢...不過想想也合理,現在一堆AI模型都在狂抓訓練資料,但這樣搞下去會不會把非營利資源榨乾啊?有點擔心未來開放資源的永續性😅
Incroyable, 50% d'augmentation de bande passante pour Wikimedia Commons ! Ça montre à quel point l'IA aspire tout sur son passage, non ? 😅 J’espère juste que ça ne va pas surcharger les serveurs ou freiner l’accès pour les utilisateurs classiques.
Whoa, a 50% spike in Wikimedia Commons bandwidth? AI crawlers are eating up data like it’s an all-you-can-eat buffet! 😄 Makes me wonder how much of this is legit research vs. bots just hoarding images for some shady AI training. Anyone else curious about what’s driving this?
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Kinda cool but also makes me wonder if this is pushing the limits of what open platforms can handle. 😅
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Makes me wonder how much data these AI models are chugging through daily. 😳 Cool to see open knowledge fueling innovation, though!

維基媒體基金會,維基百科及眾多其他群眾外包知識平台的母體,於週三宣布,自2024年1月起,來自維基共享資源的多媒體下載頻寬使用量驚人地增長了50%。根據週二的一篇博客文章詳細說明,這一激增並非由於人類好奇心的增加,而是由於自動化爬蟲對數據的渴求,用於訓練AI模型。
“我們的基礎設施設計用於處理重大事件期間來自人類的突發流量激增,但來自爬蟲機器人的流量量無與倫比,且帶來日益增加的風險和成本,”該文章解釋道。
維基共享資源作為一個可自由訪問的圖像、視頻和音頻文件中心,所有內容均以開放許可證或公共領域形式提供。
深入探究,維基媒體透露,資源消耗最嚴重的流量中有高達65%來自機器人,這是以內容消耗類型衡量的。然而,這些機器人僅佔總頁面瀏覽量的35%。維基媒體表示,這一差異源於經常訪問的內容會被緩存在靠近用戶的地方,而機器人經常針對的較不受歡迎的內容則儲存在成本更高的“核心數據中心”。
“人類讀者傾向於專注於特定的、通常相似的話題,而爬蟲機器人則傾向於‘批量閱讀’更多頁面,並訪問較不受歡迎的頁面,”維基媒體指出。“這導致這些請求被轉發到核心數據中心,顯著增加了我們的資源消耗成本。”
因此,維基媒體基金會的網站可靠性團隊正在投入大量時間和資源來阻止這些爬蟲,以防止對日常用戶的干擾。這還未觸及基金會正應對的不斷上升的雲端成本。
這種情況是威脅開放互聯網的更廣泛趨勢的一部分。就在上個月,軟件工程師兼開源倡導者Drew DeVault哀嘆,AI爬蟲公然無視旨在阻止自動流量的“robots.txt”文件。同樣,被稱為“務實工程師”的Gergely Orosz最近也表達了他對來自Meta等公司的AI爬蟲如何使其項目頻寬需求激增的不滿。
雖然開源基礎設施尤其脆弱,但開發者們正以創造力和決心應對。TechCrunch上週報導,一些科技公司正在加緊行動。例如,Cloudflare推出了AI Labyrinth,旨在通過AI生成的內容減緩爬蟲速度。
然而,這仍然是一場持續的貓鼠遊戲,可能會迫使許多出版商退回到登錄和付費牆後,最終損害我們都依賴的網絡的開放性質。
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
這流量暴增也太誇張了吧!AI爬蟲把Wikimedia Commons的頻寬吃掉一半?難怪最近載圖變超慢...不過想想也合理,現在一堆AI模型都在狂抓訓練資料,但這樣搞下去會不會把非營利資源榨乾啊?有點擔心未來開放資源的永續性😅
Incroyable, 50% d'augmentation de bande passante pour Wikimedia Commons ! Ça montre à quel point l'IA aspire tout sur son passage, non ? 😅 J’espère juste que ça ne va pas surcharger les serveurs ou freiner l’accès pour les utilisateurs classiques.
Whoa, a 50% spike in Wikimedia Commons bandwidth? AI crawlers are eating up data like it’s an all-you-can-eat buffet! 😄 Makes me wonder how much of this is legit research vs. bots just hoarding images for some shady AI training. Anyone else curious about what’s driving this?
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Kinda cool but also makes me wonder if this is pushing the limits of what open platforms can handle. 😅
Wow, a 50% spike in bandwidth for Wikimedia Commons? That’s wild! AI crawlers are probably gobbling up all those images for training. Makes me wonder how much data these AI models are chugging through daily. 😳 Cool to see open knowledge fueling innovation, though!





首頁






