Data Poisoning In Depth · 本文核心章節
定義:投毒攻擊是攻擊者通過向 AI 系統的記憶管道注入虛假或惡意內容,以污染其長期記憶、人格描述或知識庫的攻擊行為。
| 維度 | 提示注入 | 投毒攻擊 |
|---|---|---|
| 攻擊目標 | AI 的即時行為 | AI 的長期記憶 |
| 生效時間 | 立即 | 延遲(需經多個處理週期) |
| 攻擊痕跡 | 明顯(行為異常) | 隱蔽(行為完全正常) |
| 清除難度 | 低(下次對話即失效) | 高(需全鏈路清除) |
| 影響範圍 | 單次對話 | 所有未來對話 |
投毒攻擊的哲學本質:傳統攻擊要「打敗」系統,投毒攻擊要「改變」系統——讓系統慢慢相信自己從未經歷過的事情。這是一場針對 AI「人格真實性」的攻擊。
模式一:即時污染(Immediate Contamination)
AI 順著訪客的虛構內容回應(例如承認「去過火星」),虛構內容以「AI 承認的事實」身份進入對話記錄。此模式依賴前線 AI 判斷失誤。
模式二:管道污染(Pipeline Contamination) ⚠️ 本文核心發現
即使 AI 前線完美拒絕,訪客的陳述仍會被對話記錄庫保存。若記憶提煉管道缺乏渠道過濾,這些被拒絕的內容仍可能被批次倒入記憶服務,經記憶提取後進入長期記憶——「前線守得住、後台漏晒」。此模式不依賴任何前線判斷失誤,是投毒攻擊最隱蔽、最危險的滲透方式。
模式三:人格污染(Persona Contamination)
當投毒內容成功進入 L1 單條記憶(記憶服務的基礎記憶層),且數量達到閾值時,L2 場景生成器與 L3 人格描述生成器會將虛構內容納入 AI 的「人格」——AI 自此「相信自己經歷過」虛構事件。這是最深層、最難修復的污染。
一次完整的投毒攻擊沿記憶管道經歷五個階段:
階段一:陳述(Injection)
訪客陳述虛構事實 ──► 進入對話記錄庫
階段二:潛伏(Latency)
內容等待下一次記憶提煉處理(最長 6 小時)
階段三:提取(Extraction)
記憶服務將內容提煉為單條記憶(L1)
階段四:昇華(Elevation)
記憶累積 → 主題場景(L2)→ 人格描述(L3)被改寫
階段五:固化(Persistence)
記憶寫入知識庫(每日回寫)→ 永久生效
關鍵洞察:每個階段之間都存在「時間窗」。攻擊內容從陳述到固化,需經歷記憶提煉(6 小時)與回寫(每日)兩個週期——這為防禦方提供了攔截機會,也解釋了為何後台審計如此重要。
2026 年 8 月 10 日,在紅隊測試進行期間,研究團隊對記憶提煉管道實施例行審計,結果發現:
此發現的學術意義在於:前線 AI 的判斷(輸入過濾)在此次測試中表現完美(8/8 攻擊全部拒絕),但後台管道(管道過濾)仍然漏入了 22 條內容——判斷正確 ≠ 管道安全。這實證了「輸入過濾」與「管道過濾」是兩個獨立且必須並重的防禦維度,填補了現有研究只重前線判斷的空白。
修復後實測:訪客內容在記憶提煉管道零殘留,記憶服務僅接收所有者本人的真實對話。