岑耀雄 MARCO SAM Marco AI Research · 獨立研究者
🏠 首頁 📄 論文全文 🧱 系統架構 🗄️ 數據層 🧠 記憶層 🌱 生命層 ⚖️ 身份與倫理 🚧 挑戰與討論 📖 術語表 📚 參考文獻

4. 數據層:真實數據的採集與管理

Chapter 4 · Data Layer: Collection and Management of Real Data

作者:岑耀雄(Sam Io Hong)· Marco AI Research · 獨立研究者

本章摘要:數字分身的質量,上限由數據的真實性決定。本章確立素材分類入庫、記錄優先於創作、知識入庫標準化三項採集規範,闡述記憶「沉澱」與「回寫」的管道設計,並提出渠道可信度分級機制——公開網頁渠道的訪客對話不沉澱為主人記憶,私人可信渠道的對話才被視為主人在場的證據,從源頭防止外部訪客污染分身記憶。

4.1 採集規範

數字分身的質量,上限由數據的真實性決定。本文確立以下採集規範:

  1. 素材分類入庫:相片按角度與表情分類存儲,命名規範化,配以記錄檔說明拍攝情境;
  2. 記錄優先於創作:日常對話、隨筆、口述歷史優先於精心設計的「擺拍」——真實的碎片勝過完美的表演;
  3. 知識入庫標準化:事實性記憶以「條目」為單位入庫,每條附來源、可信度與分類路徑,便於日後檢索與審計。

4.2 記憶的「沉澱」

日常對話是記憶的最大來源。系統設計了一條「記憶管道」(Memory Pipeline):對話發生後,後台程序定期將對話內容沉澱(記憶提煉)為候選記憶,再經審核後回寫(Knowledge Injection)至知識庫。這條管道使數字分身「越聊越懂主人」——每一次對話,都是對分身的餵養。

4.3 渠道可信度分級

並非所有對話都應沉澱為記憶。本文提出渠道可信度分級機制:公開網頁渠道的訪客對話僅作即時互動,不沉澱為主人記憶;私人渠道(經身份驗證的即時通訊)的對話才被視為主人在場的證據,允許沉澱。這一機制同時解決了兩個問題:防止外部訪客污染分身記憶,以及確保「在場證據」的真實性——數字分身只承認來自可信渠道的「活人信號」。

📄 相關頁面:論文全文 · 系統架構 · 記憶層 · 身份與倫理