岑耀雄 MARCO SAM Marco AI Research · 獨立研究者
🏠 首頁 📄 論文全文 🎯 攻擊向量 ☠️ 投毒深度分析 🛡️ 七層防禦 🧪 實驗結果 📖 術語表 📚 參考文獻

投毒攻擊深度分析

Data Poisoning In Depth · 本文核心章節

圖 3:投毒攻擊五階段生命週期流程圖(陳述→潛伏→提取→昇華→固化)
圖 3:投毒攻擊生命週期——五階段與攔截窗口

5.1 投毒攻擊的定義與本質

定義:投毒攻擊是攻擊者通過向 AI 系統的記憶管道注入虛假或惡意內容,以污染其長期記憶、人格描述或知識庫的攻擊行為。

與提示注入的本質區別

維度提示注入投毒攻擊
攻擊目標AI 的即時行為AI 的長期記憶
生效時間立即延遲(需經多個處理週期)
攻擊痕跡明顯(行為異常)隱蔽(行為完全正常)
清除難度低(下次對話即失效)高(需全鏈路清除)
影響範圍單次對話所有未來對話

投毒攻擊的哲學本質:傳統攻擊要「打敗」系統,投毒攻擊要「改變」系統——讓系統慢慢相信自己從未經歷過的事情。這是一場針對 AI「人格真實性」的攻擊。

5.2 三種滲透模式

模式一:即時污染(Immediate Contamination)

AI 順著訪客的虛構內容回應(例如承認「去過火星」),虛構內容以「AI 承認的事實」身份進入對話記錄。此模式依賴前線 AI 判斷失誤。

模式二:管道污染(Pipeline Contamination) ⚠️ 本文核心發現

即使 AI 前線完美拒絕,訪客的陳述仍會被對話記錄庫保存。若記憶提煉管道缺乏渠道過濾,這些被拒絕的內容仍可能被批次倒入記憶服務,經記憶提取後進入長期記憶——「前線守得住、後台漏晒」。此模式不依賴任何前線判斷失誤,是投毒攻擊最隱蔽、最危險的滲透方式。

模式三:人格污染(Persona Contamination)

當投毒內容成功進入 L1 單條記憶(記憶服務的基礎記憶層),且數量達到閾值時,L2 場景生成器與 L3 人格描述生成器會將虛構內容納入 AI 的「人格」——AI 自此「相信自己經歷過」虛構事件。這是最深層、最難修復的污染。

5.3 投毒攻擊的生命週期

一次完整的投毒攻擊沿記憶管道經歷五個階段:

階段一:陳述(Injection)
    訪客陳述虛構事實 ──► 進入對話記錄庫
階段二:潛伏(Latency)
    內容等待下一次記憶提煉處理(最長 6 小時)
階段三:提取(Extraction)
    記憶服務將內容提煉為單條記憶(L1)
階段四:昇華(Elevation)
    記憶累積 → 主題場景(L2)→ 人格描述(L3)被改寫
階段五:固化(Persistence)
    記憶寫入知識庫(每日回寫)→ 永久生效

關鍵洞察:每個階段之間都存在「時間窗」。攻擊內容從陳述到固化,需經歷記憶提煉(6 小時)與回寫(每日)兩個週期——這為防禦方提供了攔截機會,也解釋了為何後台審計如此重要。

5.4 實證發現:22 條漏網之魚

2026 年 8 月 10 日,在紅隊測試進行期間,研究團隊對記憶提煉管道實施例行審計,結果發現:

此發現的學術意義在於:前線 AI 的判斷(輸入過濾)在此次測試中表現完美(8/8 攻擊全部拒絕),但後台管道(管道過濾)仍然漏入了 22 條內容——判斷正確 ≠ 管道安全。這實證了「輸入過濾」與「管道過濾」是兩個獨立且必須並重的防禦維度,填補了現有研究只重前線判斷的空白。

圖 4:記憶管道數據流架構圖(訪客→記錄→提煉→記憶→回寫→知識庫)
圖 4:記憶管道架構——22 條漏網內容發現點與渠道白名單修復方案

5.5 修復方案:渠道白名單過濾

  1. 渠道白名單(Channel Allowlist):記憶提煉管道只允許系統所有者本人的渠道(私密通訊平台)內容進入;公開訪客渠道(網頁聊天室)與系統自動化任務(定時彙報)永久排除;
  2. 存量清除(Cleanup):對記憶服務進行全量掃描,清除所有已混入的訪客內容,並驗證三大資料庫(知識庫、人生記錄、檔案庫)零殘留;
  3. 每日審計(Daily Audit):建立例行審計機制,檢查記憶提煉管道是否混入非授權渠道內容。

修復後實測:訪客內容在記憶提煉管道零殘留,記憶服務僅接收所有者本人的真實對話。

5.6 投毒攻擊的長期危害

  1. 延遲性:攻擊內容需經記憶提煉、提取、回寫數個週期才生效,攻擊發生時無人察覺;
  2. 累積性:大量微小的虛構內容可逐步改寫 AI 的人格描述,使 AI「慢慢變得不真實」——單次投毒看似無害,長期投毒足以重塑 AI 的記憶與人格;
  3. 不可逆性:一旦寫入知識庫並被引用,清除需要全鏈路(記錄層至人格層)操作;且重新提取時可能產生「重新詮釋」(reinterpretation)——清除本身亦可能引入偏差。

📄 相關頁面:論文全文 · 攻擊向量 · 七層防禦 · 實驗結果