threads
Google Memory Agent Pattern:用超長 Context 取代向量資料庫,三層 Agent 架構重塑 AI 記憶
2026年4月4日1 分鐘閱讀👁 2
核心論點
傳統向量資料庫、嵌入服務、相似度演算法,都是為了解決小 context window 的權宜之計。
當 Claude Haiku 4.5 能直接讀取 25 萬 tokens 時,整個數學都變了。
Google Always On Memory Agent:三層架構
來源:GoogleCloudPlatform/generative-ai
IngestAgent → 提取重點記憶
ConsolidateAgent → 連接洞察
QueryAgent → 合成答案
特點:
- 沒有向量索引
- 沒有餘弦相似度
- 只有直接語義推理(把記憶直接丟給 LLM,讓它自己推理)
關鍵數字
- 單筆結構化記憶:約 300 tokens
- 25 萬 token context 可容納:650+ 條記憶
- 應用範圍:數個月的完整會議紀錄、筆記管理
實際部署
- 運行平台:AWS Bedrock
- 使用模型:Claude Haiku 4.5
- 複雜度:向量資料庫的龐大架構 → 三個 Python class 的協調
意涵
傳統 RAG 管道:嵌入 → 向量索引 → 相似度搜索 → 注入
新方式:直接把所有記憶塞進 context,讓模型自己推理
這個轉變在 context window 夠大的前提下,大幅降低了 AI 記憶體系統的工程複雜度。