MSA(Memory Sparse Attention):端到端可訓練的 1 億 Token 長上下文框架,2 張 A800 就能跑
MSA(Memory Sparse Attention):端到端可訓練的 1 億 Token 長上下文框架,2 張 A800 就能跑
title: "MSA(Memory Sparse Attention):端到端可訓練的 1 億 Token 長上下文框架,2 張 A800 就能跑" date: 2026-03-23 author: EverMind AI source: https://github.com/EverMind-AI/MSA category: articles tags:
- LLM
- 長上下文
- Sparse Attention
- RAG
- 記憶
- 論文 created: 2026-03-23 updated: 2026-03-23
MSA(Memory Sparse Attention):端到端可訓練的 1 億 Token 長上下文框架,2 張 A800 就能跑
專案簡介
MSA(Memory Sparse Attention) 是 EverMind AI 提出的可擴展長期記憶框架,能處理 1 億 Token(100M) 的上下文,且在 2 張 A800 GPU 上即可運行。
論文:arXiv(連結見 GitHub) 程式碼和模型:Coming Soon
解決什麼問題?
大部分 LLM 的有效上下文長度被限制在 128K-1M tokens。現有方案各有缺陷:
- 混合線性注意力:精度衰減快、延遲增加
- 固定狀態記憶(RNN):缺乏端到端可微分性
- 外部儲存(RAG/Agent):需要複雜 pipeline,不是端到端訓練
MSA 的目標:把記憶容量和推理能力解耦。
核心技術
1. Memory Sparse Attention
- 稀疏注意力 + 文件級 RoPE(位置編碼)
- 訓練和推論都接近線性複雜度 O(L)
- 每個文件從 0 開始重置位置,避免長序列位置漂移
- 用 64K 訓練的模型可以外推到 100M
2. KV Cache 壓縮 + Memory Parallel 推論引擎
- 分層儲存:GPU 上放路由 key,CPU RAM 放內容 K/V
- 分散式評分 + 按需傳輸
- 2 張 A800 就能跑 100M Token
3. Memory Interleave(記憶交錯)
- 適應性交替「生成式檢索 → 上下文擴展 → 生成」
- 大幅提升跨文件多跳推理能力
三階段推論流程
- 全域記憶編碼(離線):跑一次語料庫,快取壓縮後的 K/V
- 線上路由 + 上下文組裝:查詢和路由 key 匹配,選 Top-k 文件,載入對應 K/V
- 稀疏生成:在稀疏上下文上自回歸生成