AI機器人刮擦您的數據?這種免費工具使那些討厭的爬行者逐步劃定

人工智能生成內容的興起,常被稱為合成媒體,帶來了多項挑戰,包括錯誤資訊的傳播、藝術家作品的未授權使用,以及線上內容信任度的下降。然而,Cloudflare 可能已找到人工智能的一項有益應用,旨在保護原始內容免受人工智能公司的濫用。
週三,Cloudflare 推出了 AI Labyrinth,一款設計用於利用人工智能生成內容來「減緩、混淆並浪費未授權人工智能爬蟲資源」的工具。
近期研究顯示,人工智能聊天機器人,如 ChatGPT 和 Perplexity,持續從已封鎖其爬蟲的網站存取內容。Cloudflare 在其公告中強調,這些爬蟲每天對其網絡產生超過 500 億次請求,佔其觀察到的所有網絡請求的不到 1%。封鎖這些爬蟲的方法至關重要。
Cloudflare 解釋說,雖然他們擁有多种工具來識別和封鎖未授權的人工智能爬蟲,但簡單地封鎖這些機器人可能會警告攻擊者,導致持續的規避策略。他們希望設計一種新方法來阻止這些不受歡迎的機器人,而不讓它們察覺已被檢測到。
當 Cloudflare 檢測到未授權的爬蟲請求時,AI Labyrinth 不僅僅是封鎖爬蟲,而是連結到多個人工智能生成的網頁,這些網頁看似真實,足以欺騙爬蟲認為它們是合法的。這樣,爬蟲誤以為已成功抓取所需內容,而網站的真實數據則保持安全。此外,這種方法還會消耗爬蟲的計算資源,Cloudflare 認為這是一項優勢。
Cloudflare 的公告詳細說明,該工具在檢測到不當機器人活動時,會自動部署一組人工智能生成的連結頁面,無需客戶設置自訂規則。
為了創建這些頁面,Cloudflare 使用了 Workers AI 和開源模型,提前生成關於各種主題的獨特、類似人類的合成頁面。此預生成管道不僅對內容進行清理以防止 XSS 漏洞,還將其儲存在 R2 中以便更快存取。
AI Labyrinth 僅向人工智能爬蟲顯示這些連結,確保內容對人類訪客隱藏,且不會影響網站的結構、外觀或 SEO。
Cloudflare 強調其承諾不助長錯誤資訊的傳播,確保生成的內容基於事實且與科學主題相關,但與被爬取的網站無關。
此外,Cloudflare 將 AI Labyrinth 視為識別新非法爬蟲的潛在誘捕器。他們指出,真正的人類訪客不太可能瀏覽「人工智能生成的無意義迷宮」,這使該工具能根據點擊模式檢測新機器人。此洞察將幫助 AI Labyrinth 更有效地識別惡意行為者。
隨著機器人越來越擅長檢測傳統誘捕技術,Cloudflare 計劃讓 AI Labyrinth 進化,創建更真實的連結 URL 網絡,使自動化程序更難識別。
對於擔心其內容被用於訓練人工智能或被聊天機器人誤傳的出版商或個人,AI Labyrinth 可能是一個有價值的工具。
所有 Cloudflare 客戶,包括免費層級用戶,今日即可通過訪問 Cloudflare 儀表板,導航至機器人管理部分,並開啟 AI Labyrinth 選項來啟用該工具。
[ttpp]
[yyxx]
相關文章
阿里巴巴超級盃:Qwen3.8-Max 重磅登場,程式碼與辦公工具能力全面升級
阿里巴巴正式釋出了Qwen3.8-Max,這是一款擁有2.4萬億引數的下一代基礎大模型。這一重大AI進展在編碼和專業辦公任務等核心領域帶來了顯著的效能提升,展現了強大的技術能力。在權威的Arena大模型排名中,Qwen3.8-Max取得了令人矚目的成績,僅次於Anthropic的Claude系列,位居行業前列。這一里程碑標誌著國內大模型在處理複雜任務方面取得了快速進展,為開發者和企業使用者提供了先進的智慧工具。該模型的API現已在Qwen AI平臺上上線,並整合到新推出的“Qwen Offic
印度科技巨頭投資3000萬美元,打造微軟Office的AI競爭對手
連續創業者 Bhavin Turakhia 正投入 3000 萬美元自有資金,押注企業 AI 領域仍有新玩家的空間。他最新的創業專案 Neo 基於一個核心信念:傳統的職場軟體不能僅靠聊天機器人進行修補,而需要進行徹底的架構重構。46 歲的 Turakhia 有著支援雄心勃勃的企業科技專案的歷史。在過去二十年中,他聯合創立了 Directi、Radix、Titan 和 Zeta,在尋求外部投資之前,主要使用個人資本為這些專案提供資金。他正將同樣的自力更生策略應用於 Neo。Turakhia 向
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
相關專題推薦
評論 (27)
0/500
Wait, so we're giving AI bots a taste of their own medicine? That's pretty ironic and kind of satisfying, not gonna lie! Cloudflare stepping in like this is a clever idea, but I wonder how effective it really is long-term. 🤔 Makes me think we're just entering a new arms race between data protection and data scraping. The web feels like a wild west again!
Nützlich, aber ich frage mich, ob solche Tools Privatanwender auch einfach nutzen können, oder ob das eher für Unternehmen gedacht ist. Die Balance zwischen Datenschutz und Zugänglichkeit ist oft schwierig. Auf jeden Fall ein interessanter Ansatz von Cloudflare! 🤔
이 내용 너무 유용해요! 특히 크롤러를 미끼로 빙빙 돌게 만드는 아이디어 정말 기발하네요 🤩 AI가 데이터를 수집하는 게 걱정될 때 이런 무료 도구가 있다는 건 정말 다행이에요. Cloudflare, 잘 해내고 있는 것 같아요!
This Cloudflare tool sounds like a game-changer! 😎 I’m tired of AI bots snooping on my data. Gotta try this to keep those crawlers at bay!
This Cloudflare tool sounds like a game-changer! I’m tired of AI bots scraping my data without consent. Excited to try it out and give those crawlers a headache! 😎

人工智能生成內容的興起,常被稱為合成媒體,帶來了多項挑戰,包括錯誤資訊的傳播、藝術家作品的未授權使用,以及線上內容信任度的下降。然而,Cloudflare 可能已找到人工智能的一項有益應用,旨在保護原始內容免受人工智能公司的濫用。
週三,Cloudflare 推出了 AI Labyrinth,一款設計用於利用人工智能生成內容來「減緩、混淆並浪費未授權人工智能爬蟲資源」的工具。
近期研究顯示,人工智能聊天機器人,如 ChatGPT 和 Perplexity,持續從已封鎖其爬蟲的網站存取內容。Cloudflare 在其公告中強調,這些爬蟲每天對其網絡產生超過 500 億次請求,佔其觀察到的所有網絡請求的不到 1%。封鎖這些爬蟲的方法至關重要。
Cloudflare 解釋說,雖然他們擁有多种工具來識別和封鎖未授權的人工智能爬蟲,但簡單地封鎖這些機器人可能會警告攻擊者,導致持續的規避策略。他們希望設計一種新方法來阻止這些不受歡迎的機器人,而不讓它們察覺已被檢測到。
當 Cloudflare 檢測到未授權的爬蟲請求時,AI Labyrinth 不僅僅是封鎖爬蟲,而是連結到多個人工智能生成的網頁,這些網頁看似真實,足以欺騙爬蟲認為它們是合法的。這樣,爬蟲誤以為已成功抓取所需內容,而網站的真實數據則保持安全。此外,這種方法還會消耗爬蟲的計算資源,Cloudflare 認為這是一項優勢。
Cloudflare 的公告詳細說明,該工具在檢測到不當機器人活動時,會自動部署一組人工智能生成的連結頁面,無需客戶設置自訂規則。
為了創建這些頁面,Cloudflare 使用了 Workers AI 和開源模型,提前生成關於各種主題的獨特、類似人類的合成頁面。此預生成管道不僅對內容進行清理以防止 XSS 漏洞,還將其儲存在 R2 中以便更快存取。
AI Labyrinth 僅向人工智能爬蟲顯示這些連結,確保內容對人類訪客隱藏,且不會影響網站的結構、外觀或 SEO。
Cloudflare 強調其承諾不助長錯誤資訊的傳播,確保生成的內容基於事實且與科學主題相關,但與被爬取的網站無關。
此外,Cloudflare 將 AI Labyrinth 視為識別新非法爬蟲的潛在誘捕器。他們指出,真正的人類訪客不太可能瀏覽「人工智能生成的無意義迷宮」,這使該工具能根據點擊模式檢測新機器人。此洞察將幫助 AI Labyrinth 更有效地識別惡意行為者。
隨著機器人越來越擅長檢測傳統誘捕技術,Cloudflare 計劃讓 AI Labyrinth 進化,創建更真實的連結 URL 網絡,使自動化程序更難識別。
對於擔心其內容被用於訓練人工智能或被聊天機器人誤傳的出版商或個人,AI Labyrinth 可能是一個有價值的工具。
所有 Cloudflare 客戶,包括免費層級用戶,今日即可通過訪問 Cloudflare 儀表板,導航至機器人管理部分,並開啟 AI Labyrinth 選項來啟用該工具。
[ttpp]
[yyxx]
阿里巴巴超級盃:Qwen3.8-Max 重磅登場,程式碼與辦公工具能力全面升級
阿里巴巴正式釋出了Qwen3.8-Max,這是一款擁有2.4萬億引數的下一代基礎大模型。這一重大AI進展在編碼和專業辦公任務等核心領域帶來了顯著的效能提升,展現了強大的技術能力。在權威的Arena大模型排名中,Qwen3.8-Max取得了令人矚目的成績,僅次於Anthropic的Claude系列,位居行業前列。這一里程碑標誌著國內大模型在處理複雜任務方面取得了快速進展,為開發者和企業使用者提供了先進的智慧工具。該模型的API現已在Qwen AI平臺上上線,並整合到新推出的“Qwen Offic
印度科技巨頭投資3000萬美元,打造微軟Office的AI競爭對手
連續創業者 Bhavin Turakhia 正投入 3000 萬美元自有資金,押注企業 AI 領域仍有新玩家的空間。他最新的創業專案 Neo 基於一個核心信念:傳統的職場軟體不能僅靠聊天機器人進行修補,而需要進行徹底的架構重構。46 歲的 Turakhia 有著支援雄心勃勃的企業科技專案的歷史。在過去二十年中,他聯合創立了 Directi、Radix、Titan 和 Zeta,在尋求外部投資之前,主要使用個人資本為這些專案提供資金。他正將同樣的自力更生策略應用於 Neo。Turakhia 向
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Wait, so we're giving AI bots a taste of their own medicine? That's pretty ironic and kind of satisfying, not gonna lie! Cloudflare stepping in like this is a clever idea, but I wonder how effective it really is long-term. 🤔 Makes me think we're just entering a new arms race between data protection and data scraping. The web feels like a wild west again!
Nützlich, aber ich frage mich, ob solche Tools Privatanwender auch einfach nutzen können, oder ob das eher für Unternehmen gedacht ist. Die Balance zwischen Datenschutz und Zugänglichkeit ist oft schwierig. Auf jeden Fall ein interessanter Ansatz von Cloudflare! 🤔
이 내용 너무 유용해요! 특히 크롤러를 미끼로 빙빙 돌게 만드는 아이디어 정말 기발하네요 🤩 AI가 데이터를 수집하는 게 걱정될 때 이런 무료 도구가 있다는 건 정말 다행이에요. Cloudflare, 잘 해내고 있는 것 같아요!
This Cloudflare tool sounds like a game-changer! 😎 I’m tired of AI bots snooping on my data. Gotta try this to keep those crawlers at bay!
This Cloudflare tool sounds like a game-changer! I’m tired of AI bots scraping my data without consent. Excited to try it out and give those crawlers a headache! 😎





首頁






