開源開發人員用獨創性和報應來對抗AI爬行者
AI網路爬蟲機器人已成為網路的禍害,許多軟體開發者均持此觀點。為因應此問題,一些開發者開始以創意且往往有趣的策略進行反擊。
開源軟體開發者尤其深受這些流氓機器人的影響,正如Linux桌面環境Plasma及LibreNews部落格的開發者Niccolò Venerandi所指出的。FOSS網站,作為免費開源項目的托管平台,暴露了更多的基礎架構,且通常比商業網站擁有更少的資源。
問題因許多AI機器人無視Robots Exclusion Protocol的robot.txt檔案而加劇,該檔案本應指示機器人哪些內容不可爬取。
在一篇於一月發表的感人部落格文章中,FOSS開發者Xe Iaso分享了與AmazonBot的痛苦經歷,該機器人對Git伺服器網站進行了猛烈攻擊,導致DDoS中斷。Git伺服器對於托管FOSS項目至關重要,允許任何人下載並貢獻程式碼。
Iaso指出,該機器人無視robot.txt檔案,使用不同的IP位址,甚至偽裝成其他用戶。Iaso感嘆道:「試圖阻止AI爬蟲機器人是徒勞的,因為它們會撒謊、變更用戶代理、使用住宅IP位址作為代理等等。」
該開發者寫道:「它們會不斷刮取你的網站直到它崩潰,然後繼續刮取。它們會點擊每個連結上的每個連結,無休止地重複瀏覽相同的頁面。有些甚至在同一秒內多次點擊同一連結。」
墓地之神的登場
為對抗此問題,Iaso開發了一個名為Anubis的巧妙工具。它作為反向代理,要求在允許請求到達Git伺服器之前進行工作量證明檢查。這有效阻擋了機器人,同時允許人類操作的瀏覽器通過。
該工具名為Anubis,源自埃及神話中引導死者接受審判的神祇。Iaso向TechCrunch解釋:「Anubis會稱量你的靈魂(心臟),如果它比羽毛還重,你的心臟會被吞噬,你將徹底死亡。」成功通過挑戰的用戶會看到一張可愛的Anubis動漫圖片,而機器人請求則被拒絕。
該項目於3月19日在GitHub上分享,迅速獲得關注,僅數天內便累積了2000顆星、20位貢獻者及39個分支。

以復仇作為防禦
Anubis的廣泛採用顯示Iaso的困境並非個案。Venerandi回顧了許多類似的經歷:
- SourceHut的創始人兼執行長Drew DeVault花費大量時間處理激進的LLM爬蟲,並頻繁遭遇中斷。
- 知名FOSS開發者及LWN運營者Jonathan Corbet發現其網站因AI刮取機器人而變慢。
- Linux Fedora項目的系統管理員Kevin Fenzi因激進的AI機器人活動,不得不封鎖來自巴西的所有流量。
Venerandi向TechCrunch提到,他知道其他項目不得不採取極端措施,例如禁止所有中國IP位址。
一些開發者認為,以復仇的方式反擊是最佳防禦。Hacker News上名為xyzal的用戶建議在robot.txt禁止的頁面中填充誤導性內容,例如宣揚飲用漂白水的好處或麻疹對臥室表現的正面影響。
xyzal解釋道:「我們需要讓機器人從訪問我們的陷阱中獲得負面的效用價值,而不僅僅是零價值。」
一月,一位匿名開發者「Aaron」發布了Nepenthes,一款旨在將爬蟲困在虛假內容迷宮中的工具,其創作者向Ars Technica承認這是激進的,甚至近乎惡意。Nepenthes以肉食性植物命名,旨在迷惑並浪費不良機器人的資源。
同樣地,Cloudflare最近推出了AI Labyrinth,旨在減緩、迷惑並浪費無視「禁止爬取」指令的AI爬蟲的資源。該工具向這些機器人提供無關內容,以保護合法網站數據。
SourceHut的DeVault向TechCrunch表示,雖然Nepenthes通過向爬蟲提供無意義內容帶來正義感,但Anubis對其網站證明更為有效。然而,他也真誠地呼籲更直接的解決方案:「請停止為LLM、AI圖像生成器或GitHub Copilot等垃圾產品正名。我懇求你們停止使用它們,停止討論它們,停止創造新的產品,就此停下。」
鑑於這不太可能實現,特別是FOSS社群的開發者們繼續以創意和一絲幽默進行反擊。
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (20)
0/500
Interesting read! It's wild how AI crawlers are basically the new internet pests. I've seen some devs use fake data traps or even redirect bots to weird sites 😂. But honestly, should we be worried about a future where only big companies can afford to protect their content? Feels like a digital arms race.
¡Qué creatividad la de estos desarrolladores! 😃 Me preocupa que esta 'lucha' contra los crawlers de IA consuma tanto tiempo y energía que podría desviarlos de lo realmente importante: programar. Ojalá hubiera soluciones más estandarizadas, porque esto parece una carrera armamentística sin fin.
These AI crawlers are like uninvited guests at a party, munching on all the free code! 😅 Devs fighting back with clever traps is pure genius—love the creativity!
Wow, open source devs are getting super creative fighting those AI crawlers! I love how they’re turning the tables with clever traps—kinda like digital pranksters. Makes me wonder how far this cat-and-mouse game will go! 😄
Super interesting read! It's wild how devs are outsmarting AI crawlers with such clever tricks. Gotta love the open-source community's creativity! 😎
AI網路爬蟲機器人已成為網路的禍害,許多軟體開發者均持此觀點。為因應此問題,一些開發者開始以創意且往往有趣的策略進行反擊。
開源軟體開發者尤其深受這些流氓機器人的影響,正如Linux桌面環境Plasma及LibreNews部落格的開發者Niccolò Venerandi所指出的。FOSS網站,作為免費開源項目的托管平台,暴露了更多的基礎架構,且通常比商業網站擁有更少的資源。
問題因許多AI機器人無視Robots Exclusion Protocol的robot.txt檔案而加劇,該檔案本應指示機器人哪些內容不可爬取。
在一篇於一月發表的感人部落格文章中,FOSS開發者Xe Iaso分享了與AmazonBot的痛苦經歷,該機器人對Git伺服器網站進行了猛烈攻擊,導致DDoS中斷。Git伺服器對於托管FOSS項目至關重要,允許任何人下載並貢獻程式碼。
Iaso指出,該機器人無視robot.txt檔案,使用不同的IP位址,甚至偽裝成其他用戶。Iaso感嘆道:「試圖阻止AI爬蟲機器人是徒勞的,因為它們會撒謊、變更用戶代理、使用住宅IP位址作為代理等等。」
該開發者寫道:「它們會不斷刮取你的網站直到它崩潰,然後繼續刮取。它們會點擊每個連結上的每個連結,無休止地重複瀏覽相同的頁面。有些甚至在同一秒內多次點擊同一連結。」
墓地之神的登場
為對抗此問題,Iaso開發了一個名為Anubis的巧妙工具。它作為反向代理,要求在允許請求到達Git伺服器之前進行工作量證明檢查。這有效阻擋了機器人,同時允許人類操作的瀏覽器通過。
該工具名為Anubis,源自埃及神話中引導死者接受審判的神祇。Iaso向TechCrunch解釋:「Anubis會稱量你的靈魂(心臟),如果它比羽毛還重,你的心臟會被吞噬,你將徹底死亡。」成功通過挑戰的用戶會看到一張可愛的Anubis動漫圖片,而機器人請求則被拒絕。
該項目於3月19日在GitHub上分享,迅速獲得關注,僅數天內便累積了2000顆星、20位貢獻者及39個分支。

以復仇作為防禦
Anubis的廣泛採用顯示Iaso的困境並非個案。Venerandi回顧了許多類似的經歷:
- SourceHut的創始人兼執行長Drew DeVault花費大量時間處理激進的LLM爬蟲,並頻繁遭遇中斷。
- 知名FOSS開發者及LWN運營者Jonathan Corbet發現其網站因AI刮取機器人而變慢。
- Linux Fedora項目的系統管理員Kevin Fenzi因激進的AI機器人活動,不得不封鎖來自巴西的所有流量。
Venerandi向TechCrunch提到,他知道其他項目不得不採取極端措施,例如禁止所有中國IP位址。
一些開發者認為,以復仇的方式反擊是最佳防禦。Hacker News上名為xyzal的用戶建議在robot.txt禁止的頁面中填充誤導性內容,例如宣揚飲用漂白水的好處或麻疹對臥室表現的正面影響。
xyzal解釋道:「我們需要讓機器人從訪問我們的陷阱中獲得負面的效用價值,而不僅僅是零價值。」
一月,一位匿名開發者「Aaron」發布了Nepenthes,一款旨在將爬蟲困在虛假內容迷宮中的工具,其創作者向Ars Technica承認這是激進的,甚至近乎惡意。Nepenthes以肉食性植物命名,旨在迷惑並浪費不良機器人的資源。
同樣地,Cloudflare最近推出了AI Labyrinth,旨在減緩、迷惑並浪費無視「禁止爬取」指令的AI爬蟲的資源。該工具向這些機器人提供無關內容,以保護合法網站數據。
SourceHut的DeVault向TechCrunch表示,雖然Nepenthes通過向爬蟲提供無意義內容帶來正義感,但Anubis對其網站證明更為有效。然而,他也真誠地呼籲更直接的解決方案:「請停止為LLM、AI圖像生成器或GitHub Copilot等垃圾產品正名。我懇求你們停止使用它們,停止討論它們,停止創造新的產品,就此停下。」
鑑於這不太可能實現,特別是FOSS社群的開發者們繼續以創意和一絲幽默進行反擊。
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
Interesting read! It's wild how AI crawlers are basically the new internet pests. I've seen some devs use fake data traps or even redirect bots to weird sites 😂. But honestly, should we be worried about a future where only big companies can afford to protect their content? Feels like a digital arms race.
¡Qué creatividad la de estos desarrolladores! 😃 Me preocupa que esta 'lucha' contra los crawlers de IA consuma tanto tiempo y energía que podría desviarlos de lo realmente importante: programar. Ojalá hubiera soluciones más estandarizadas, porque esto parece una carrera armamentística sin fin.
These AI crawlers are like uninvited guests at a party, munching on all the free code! 😅 Devs fighting back with clever traps is pure genius—love the creativity!
Wow, open source devs are getting super creative fighting those AI crawlers! I love how they’re turning the tables with clever traps—kinda like digital pranksters. Makes me wonder how far this cat-and-mouse game will go! 😄
Super interesting read! It's wild how devs are outsmarting AI crawlers with such clever tricks. Gotta love the open-source community's creativity! 😎





首頁






