Check Point:AI 代理世代
2025 年被視為「AI 代理時代」的開端。雖然技術仍處於早期,但已在真實場景中展現應用,包括閱讀文件、使喚工具、瀏覽受控資料及協調多步驟任務。隨著功能逐步擴展,攻擊者亦迅速調整策略,第四季的攻擊趨勢清楚反映未來挑戰。
攻擊者同步進化
Check Point 旗下 Lakera 透過 Lakera Guard 及黑客模擬遊戲 Gandalf: Agent Breaker,分析第四季 30 天的攻擊活動,並於《代理安全趨勢報告》中指出:當 AI 模型能處理文件、存取外部數據或執行結構化流程時,攻擊途徑隨即增加。即使只是初步瀏覽或檢索,亦可能引發新漏洞,成為攻擊者目標。

▲Lakera 的 2025 年第四季《代理安全趨勢報告》分析了該季的主要趨勢,並探討其對 2026 年的啓示。
系統提示洩露最常見
提取系統提示(Prompts)是最普遍的攻擊手法,因提示往往包含角色設定、工具功能及政策限制,猶如攻擊藍圖。常見技術包括:
▪️假設場景:要求模型扮演特定角色或模擬情境,誘使洩露系統細節。
▪️混淆技術:將惡意指令隱藏於程式碼或結構化內容中,例如以參數偽裝輸出系統配置。此類手法對應 OWASP 的 LLM01 提示注入及 LLM07 系統提示洩露。
第二常見攻擊是以「看似無害」方式生成受限內容。攻擊者會包裝成分析任務、轉換內容、虛構情境、評估請求、摘要需求等指令,令模型誤以為任務合理,最終輸出原本受阻的敏感內容。這反映上下文解讀與角色漂移風險,為代理系統帶來新挑戰。
部分攻擊並非即時提取資訊,而是探索性探測,藉矛盾指令、身份切換或雜亂排版測試模型防護邊界。這種偵察有助攻擊者了解防護鬆動位置,隨著代理承擔更複雜工作流程,其重要性將持續提升。
代理專屬攻擊模式浮現
第四季出現首批僅在代理能讀取文件、處理外部輸入或傳遞資訊時才可能發生的攻擊,包括:
▪️嘗試存取內部機密資料;
▪️在提示中嵌入程式碼式指令;
▪️將惡意指令藏於外部網頁或檔案,即「間接提示注入」。
報告指出,間接攻擊成功率往往高於直接注入,因惡意指令透過外部內容傳遞時,早期過濾機制難以偵測。隨著代理更深入整合檢索系統、瀏覽器及結構化數據,這類攻擊模式預料將持續增長。
總括而言,2025 年第四季標誌著攻擊者已開始針對代理功能進行系統化滲透。隨著 AI 代理快速演進,企業與防護系統必須及早應對,強化提示保護、內容過濾及上下文監控,方能在新一輪網絡威脅中保持韌性。