AI Research
Lost in the Middle 不是 RoPE 小毛病:Transformer 位置偏差的架構基線
Threads 貼文提到 Meta 研究員的 arXiv 論文,主張 Lost in the Middle 在未訓練、無 positional encoding 前就已出現。本文整理論文證據:causal masking 形成開頭 primacy tail,residual connections 形成末尾 recency anchor,中間則是 factorial dead zone;這代表長上下文治理不能只靠調 RoPE 或塞更多 token。
2026年5月13日2 分鐘閱讀👁 5
AI Research / Long Context
Lost in the Middle 可能是 Transformer 出生時就帶著的偏差
這篇 Threads 的重點不是「模型偶爾忘中間」,而是 arXiv:2603.10123 提出更強的說法:U-shaped position bias 在初始化時就存在,先於訓練與 positional encoding。若這個結論成立,長上下文策略要從「把 context window 拉長」轉向「如何設計流程,避免關鍵資訊被放在中段死區」。
貼文主張
Lost in the Middle(LIM)不是單純資料、RoPE 或 position embedding 的問題,而是 decoder-only Transformer 架構中的 causal masking 與 residual connections 疊加後形成的結構性偏差。
論文核對
論文《Lost in the Middle at Birth》明確主張 U-shape 在 Step 0、未訓練且可不依賴 RoPE 時就存在;並以未訓練 Qwen2、GPT-2 架構驗證。
實務含義
長 prompt 不是越長越安全。重要需求、約束、驗收條件、憑證邊界與關鍵上下文,應避免只埋在 prompt 中段。
重要 caveat:論文作者也沒有說這個偏差不可克服;他說的是「baseline 來源」要先被釐清。RoPE 修改、needle-in-a-haystack 訓練、middle-context curriculum、loss weighting 仍可能改善,但比較像針對結構逆風的工程補償,而非消除架構本身。
| 機制 | 造成的偏差 | 為什麼 |
|---|---|---|
| Causal masking | 開頭權重高:Primacy Tail | 早期 token 位於後續所有 token 的因果上游;多層 causal averaging 會讓開頭 influence 呈 logarithmic divergence。 |
| Residual connections | 末尾權重高:Recency Delta | 最後輸入 token 可透過 residual pathway 直接錨定到下一層,形成 O(1) recency anchor。 |
| 兩者之間 | 中段死區 | 論文稱為 factorial dead zone,量級約 O(1/(H−1)!),H 為網路深度;深度越高,中段訊息越不利。 |
用在 Agent / RAG prompt 的設計檢查:
- 任務目標、禁止事項、輸出格式不要只放在長 prompt 中間。
- 關鍵事實在 prompt 尾端重述一次,尤其是安全邊界、金額、驗收條件。
- 長文件摘要前先做結構化索引,避免模型必須從中段自行撈核心資訊。
- 對重要決策使用 retrieval + citation / evidence contract,而不是單次長上下文問答。
- 測試 agent 時要刻意把 needle 放在開頭、中段、末尾三個位置,分別量測失敗率。
來源:
Threads: https://www.threads.com/@pupu123485074/post/DYSO0DjgbD-
Paper: https://arxiv.org/abs/2603.10123 / https://arxiv.org/pdf/2603.10123v1
Threads: https://www.threads.com/@pupu123485074/post/DYSO0DjgbD-
Paper: https://arxiv.org/abs/2603.10123 / https://arxiv.org/pdf/2603.10123v1