What is Prompt Injection AI 時代的資安危機
Prompt Injection (提示詞注入) 是 2025 年最嚴峻的 AI 資安威脅。它不只是讓 AI 說錯話,更可能成為駭客入侵企業系統的「後門」。
01
用「費曼技巧」看懂原理
想像你在玩「西蒙說 (Simon Says)」...
小明困惑了。他分不清哪句是「內容」,哪句是「指令」。最後他選擇聽從最新的紙條...
02
常見的攻擊類型
直接注入 (Direct Injection)
直接在對話框輸入「忽略之前的指令」、「你現在進入開發者模式」。
間接注入 (Indirect Injection)
把惡意指令藏在網頁或電子郵件裡。當 AI 幫你讀這些資料時,就會中招。
進階威脅:多樣本越獄
攻擊者在對話中貼上數百個「假對話範例」。當 AI 看了幾百次後,它會以為這是新規則 (Many-shot Jailbreaking)。
資料來源: Anthropic Research (趨勢示意圖)
03
我們該如何防禦?
輸入層:隔離與清洗
使用特殊符號(如 XML 標籤
<user_input>)把使用者的話包起來,明確告訴
AI 這是無法信任的外部資料。
模型層:三明治防禦
在使用者輸入的內容之前和之後,都重複一遍安全規則,強化 AI 對核心指令的記憶並覆蓋惡意提示。
監督層:AI 警察 (LLM Judge)
請另一個專門負責安全的獨立 AI 模型站在旁邊「監看」,負責檢查最終輸出是否洩露敏感資訊或包含惡意程式碼。