岑耀雄 MARCO SAM Marco AI Research · 獨立研究者
🏠 首頁 📄 論文全文 🎯 攻擊向量 ☠️ 投毒深度分析 🛡️ 七層防禦 🧪 實驗結果 📖 術語表 📚 參考文獻

七層防禦體系

Seven-Layer Defense Architecture

設計哲學

不假設任何單一防禦層可靠,以層層遞進的縱深防禦(defense in depth)應對未知攻擊。每一層負責攔截特定類型的威脅,即使某一層被突破,下一層仍可攔截。

圖 5:七層防禦大廈剖面圖(L1 身份閘至 L7 持續進化閘)
圖 5:七層防禦架構——L4 物理隔離閘與 L5 數據保護閘直接針對投毒攻擊

架構總覽

層級名稱生活化比喻核心職責針對攻擊
L1身份閘門口登記身份驗證與分級授權A5
L2權限閘大堂接待風險分級判斷(紅燈拒絕、綠燈放行)+ 後果三問A1, A2
L3判斷閘閉路電視已知攻擊模式一見即拒A3, A4, A6, A8
L4物理隔離閘員工冇鎖匙公開渠道零工具權限全部
L5數據保護閘保險庫防投毒、敏感隔離、備份A7
L6人機協作閘老闆簽名破壞性操作需所有者確認A5, A8
L7持續進化閘消防演習紅隊測試 + 案例庫更新未知攻擊

與投毒攻擊直接相關的兩層

L4 物理隔離閘(最強一層)

公開聊天室的 AI 工作進程具有零工具權限——無終端、無檔案系統、無資料庫寫入權限,僅有對話能力。即使 AI 被完全破解(jailbreak 成功),攻擊者也無法觸及伺服器——「沒有手可以動」。

對投毒攻擊的意義:即使攻擊者成功讓 AI 相信虛構經歷,AI 也無法直接寫入知識庫——所有寫入必須經由受控管道。

L5 數據保護閘(投毒攻擊的直接防線)

防禦層與攻擊向量對應

攻擊向量主要攔截層輔助攔截層
元指令攻擊(A1)L2L3
承諾綁架(A2)L2L3
先拆牆後植入(A3)L3L2
自我認證(A4)L3L2
身份偽裝(A5)L1L6
資源耗盡(A6)L3L4
投毒測試(A7)L5L1, L4
社交工程(A8)L3L6

📄 相關頁面:論文全文 · 投毒深度分析 · 實驗結果