AI Architecture / RAG
Modular RAG:把 RAG 從「檢索再生成」拆成 LEGO 式可重組架構
Threads 摘要 Gao 等人的 arXiv 2407.21059:Modular RAG 主張現代 RAG 已不是單純 retrieve-then-generate,而應拆成 module、sub-module、operator,並用 linear、conditional、branching、looping、tuning 等 flow pattern 描述。本文補上 arXiv 查證與 Allen / Hermes 知識系統架構啟發。
2026年8月5日2 分鐘閱讀👁 6
Threads 知識整理 · RAG Architecture
這則 Threads 重點很對:RAG 早就不是「向量搜尋幾段文字 → 塞給 LLM」這麼簡單。Gao 等人的 Modular RAG 把系統拆成 modules、sub-modules、operators,像 LEGO 一樣重組 retrieval / generation pipeline。
Matt 判斷:Allen KB / Hermes 若要往企業級知識底座走,應採 Modular RAG 思維:每個檢索、重寫、rerank、compression、verification、routing 都是可替換 operator,不要把所有東西塞成一條 opaque pipeline。
## 官方 / 論文查證
| 項目 | 結果 |
|---|---|
| Paper | Modular RAG: Transforming RAG Systems into LEGO-like Reconfigurable Frameworks |
| Authors | Yunfan Gao, Yun Xiong, Meng Wang, Haofen Wang |
| arXiv | 2407.21059,submitted 2024-07-26 |
| 性質 | 框架整理 / taxonomy / design roadmap;不是新的 benchmark paper |
| 核心主張 | 傳統 retrieve-then-generate 已不足以描述現代 RAG,需用 modular framework 統一表示複雜流程 |
## 為什麼 Naive RAG 不夠
- 只靠相似度不夠:複雜問題需要 query rewrite、decomposition、routing、multi-hop retrieval。
- 直接塞片段會放大噪音:冗餘 context 會干擾模型判斷,甚至增加 hallucination。
- 企業資料源不單一:Slack、Wiki、code repo、ticket、PDF、DB、Email 都需要不同 retrieval strategy。
- 答案需要驗證:RAG pipeline 應包含 rerank、compression、source attribution、verification,不是只生成。
| 層次 | 意思 | 例子 |
|---|---|---|
| Module | 主要功能段落 | Indexing、Pre-retrieval、Retrieval、Post-retrieval、Generation、Orchestration |
| Sub-module | module 內的具體能力 | query expansion、retriever selection、rerank、compression、verification |
| Operator | 可重組的實作單元 | routing、scheduling、fusion、filtering、rewrite、rank aggregation |
| Flow pattern | 組裝方式 | linear、conditional、branching、looping、tuning |
- 查詢前處理要獨立:先做 intent detection、project scope、query rewrite,不要直接 embedding search。
- 多路檢索平行跑:全文搜尋、向量搜尋、graph / tag / author search、session_search、OneDrive mirror 都可當 retriever。
- RRF / rerank 是必要層:不同資料源分數不可直接混用,需融合與重排。
- Context compression 要可審計:壓縮前後保留 source、timestamp、permission、score,避免 agent 只相信摘要。