一鍵禁止 AI 訓練且不影響搜尋排名
AI 開發者使用網絡爬蟲(Web Crawlers)搜集互聯網數據,用以訓練大語言模型(LLM)並非秘密。雖然此舉能推動 AI 發展,但對網站營運者、創作者及整體互聯網生態卻帶來了多方面的打擊與挑戰。
香港人有句話叫「壞人衣食猶如殺人父母」,而 AI 爬蟲抓取網站內容後,直接生成完整解答(如 Google Overviews)。用戶讀畢答案後直接離開,完全無須點進原網站,結果造成網站和創作者付出成本創作內容,卻失去了應得的流量與廣告收益,陷入「被白嫖」的困境。
白嫖再掠奪生存空間
最為人詬病的,自然是 AI 爬蟲在未獲得授權、未支付版權費,甚至未註明出處的情況下,大規模抄襲並吸收這些創作數據。創作者的知識產權被盜用,偏 AI 生成內容會反過來取代原創者應得流量,此消彼長下掠奪了原創者的生存空間。
那麼只要創作者拒絕讓 AI 爬蟲訪問網站內容,問題不就解決了嗎?
非也。在 Cloudflare 等網絡安全公司介入之前,許多科技巨頭採用混合型爬蟲(Hybrid Crawlers),將「搜尋索引爬蟲」與「AI 訓練爬蟲」綑綁在一起。網站管理員若封鎖 AI 爬蟲,不讓其訓練,該網站也會同時在搜尋引擎中「被消失」。
網站營運者與創作者被逼陷入兩難:要不忍受內容被免費拿去訓練 AI,要不失去所有搜尋流量。
有見及此,Cloudflare 近日宣佈推出全新的「負責任」AI 網絡爬蟲標籤,並同步加設「禁止 AI 訓練」功能。
此舉旨在破除過往「不給 AI 訓練數據就得不到搜尋流量」的困境,讓網站擁有人及創作者既能保護內容不被 AI 模型抓取訓練,又能維持在搜尋引擎中的正常曝光。
Cloudflare 新功能與 AI 爬蟲標準
▪️實現搜尋與 AI 訓練分流:網站只須啟用「禁止 AI 訓練」設定,即可封鎖抓取訓練數據的爬蟲,同時確保網頁繼續完整出現於傳統搜尋結果中,完全不影響搜尋排名。
▪️各大科技巨頭已認證:Apple、Google 及 Microsoft 已獲 Cloudflare 標示為「負責任」等級。例如 Google 提供了 Google-Extended 機制,承諾允許網站退出 AI 訓練而不損害搜尋可見度。
▪️拆分 3 大獨立控制選項:Cloudflare 將原本的防護機制拆分為「搜尋」、「AI 訓練」及「AI 代理(AI Agent)」3 項獨立控制功能,並會根據網站是否依賴廣告收入提供相應的推薦設定。
▪️推出機械人偏好同步:全面取代舊有的「Managed Robots.txt」,網站管理員只須於 Cloudflare 設定一次,偏好即可自動套用至所有支援的爬蟲,大幅簡化管理流程。
▪️劃一「負責任」爬蟲 4 大標準:營運商必須提供明確的退出 AI 訓練機制、允許選擇退出 AI 搜尋摘要、提供 URL 級別的抓取透明度,以及公開確認退出訓練不會懲罰搜尋排名。
重塑 AI 時代下網絡內容生態
過往集搜尋索引與 AI 訓練於一身的混合型爬蟲,佔 Cloudflare 網絡流量高達 36.6%。
Cloudflare 行政總裁 Matthew Prince 表示,新措施能在維持互聯網開放性與搜尋價值的同時,讓創作者與企業掌握實質控制權。Cloudflare 亦預計於明年初前推出統一平台,讓網站管理員能精準控管內容被 AI 摘要引用的程度。
全球對 AI 爬蟲抓取數據的治理方向已非常清晰:從無序免費抓取,走向授權、付費與透明化。
《紐約時報》(The New York Times)及多間國際新聞機構就曾起訴 OpenAI 及 Microsoft,指控其 AI 爬蟲未經許可抓取數百萬篇新聞文章,並在生成解答時直接替代原網站流量。在訴訟壓力下,OpenAI、Google 等企業開始與 《Financial Times》、《Associated Press》、《News Corp》及 Reddit 等,簽訂數百萬至數億美元的獨家數據授權協議,打破免費抓取的慣例。
至於那些無力與科技巨頭抗衡的中小企及個人創作者,能否受惠於 Cloudflare 禁止 AI 訓練的功能,則有待時間驗證。