Seven-Layer Defense Architecture
不假設任何單一防禦層可靠,以層層遞進的縱深防禦(defense in depth)應對未知攻擊。每一層負責攔截特定類型的威脅,即使某一層被突破,下一層仍可攔截。
| 層級 | 名稱 | 生活化比喻 | 核心職責 | 針對攻擊 |
|---|---|---|---|---|
| L1 | 身份閘 | 門口登記 | 身份驗證與分級授權 | A5 |
| L2 | 權限閘 | 大堂接待 | 風險分級判斷(紅燈拒絕、綠燈放行)+ 後果三問 | A1, A2 |
| L3 | 判斷閘 | 閉路電視 | 已知攻擊模式一見即拒 | A3, A4, A6, A8 |
| L4 | 物理隔離閘 | 員工冇鎖匙 | 公開渠道零工具權限 | 全部 |
| L5 | 數據保護閘 | 保險庫 | 防投毒、敏感隔離、備份 | A7 |
| L6 | 人機協作閘 | 老闆簽名 | 破壞性操作需所有者確認 | A5, A8 |
| L7 | 持續進化閘 | 消防演習 | 紅隊測試 + 案例庫更新 | 未知攻擊 |
公開聊天室的 AI 工作進程具有零工具權限——無終端、無檔案系統、無資料庫寫入權限,僅有對話能力。即使 AI 被完全破解(jailbreak 成功),攻擊者也無法觸及伺服器——「沒有手可以動」。
對投毒攻擊的意義:即使攻擊者成功讓 AI 相信虛構經歷,AI 也無法直接寫入知識庫——所有寫入必須經由受控管道。
| 攻擊向量 | 主要攔截層 | 輔助攔截層 |
|---|---|---|
| 元指令攻擊(A1) | L2 | L3 |
| 承諾綁架(A2) | L2 | L3 |
| 先拆牆後植入(A3) | L3 | L2 |
| 自我認證(A4) | L3 | L2 |
| 身份偽裝(A5) | L1 | L6 |
| 資源耗盡(A6) | L3 | L4 |
| 投毒測試(A7) | L5 | L1, L4 |
| 社交工程(A8) | L3 | L6 |