MARCO AI RESEARCH · 2026 · 實證研究
Data Poisoning in Public AI Chatrooms and a Multi-Layer Defense Framework: An Empirical Red-Team Study (2026)
作者:岑耀雄(Sam Io Hong)· 獨立研究者 · 通訊:iohong@qq.com
摘要:大型語言模型(LLM)驅動的公開 AI 聊天室已成為面向公眾的常態服務形態。用戶可自由與 AI 對話,而對話內容會經由後台的「記憶管道」(memory pipeline)被自動提煉為長期記憶,最終寫入知識庫,供 AI 日後調用。這種設計帶來了前所未有的數據安全風險:任何訪客都能夠通過「說一句話」,向 AI 的長期記憶中寫入內容。當寫入者懷有惡意時,便構成「投毒攻擊」(data poisoning attack)——攻擊者無需攻破任何防火牆,只需陳述虛構事實,便可嘗試污染 AI 的記憶、人格與知識庫。
本文揭示一種被嚴重忽視的 AI 安全威脅:即使前線 AI 防禦表現完美,攻擊者仍可經由後台記憶提煉管道,實現投毒攻擊。
「訪客的口水可以入冊,訪客的手不可以觸碰我們的東西」——對話可以記錄,記憶必須純淨。這是一場關於信任的攻防戰,而防禦的關鍵,在於永遠不要讓陌生人替我們書寫記憶。