Chapter 4 · Data Layer: Collection and Management of Real Data
作者:岑耀雄(Sam Io Hong)· Marco AI Research · 獨立研究者
本章摘要:數字分身的質量,上限由數據的真實性決定。本章確立素材分類入庫、記錄優先於創作、知識入庫標準化三項採集規範,闡述記憶「沉澱」與「回寫」的管道設計,並提出渠道可信度分級機制——公開網頁渠道的訪客對話不沉澱為主人記憶,私人可信渠道的對話才被視為主人在場的證據,從源頭防止外部訪客污染分身記憶。
數字分身的質量,上限由數據的真實性決定。本文確立以下採集規範:
日常對話是記憶的最大來源。系統設計了一條「記憶管道」(Memory Pipeline):對話發生後,後台程序定期將對話內容沉澱(記憶提煉)為候選記憶,再經審核後回寫(Knowledge Injection)至知識庫。這條管道使數字分身「越聊越懂主人」——每一次對話,都是對分身的餵養。
並非所有對話都應沉澱為記憶。本文提出渠道可信度分級機制:公開網頁渠道的訪客對話僅作即時互動,不沉澱為主人記憶;私人渠道(經身份驗證的即時通訊)的對話才被視為主人在場的證據,允許沉澱。這一機制同時解決了兩個問題:防止外部訪客污染分身記憶,以及確保「在場證據」的真實性——數字分身只承認來自可信渠道的「活人信號」。