Headroom:LLM Agent 的 Context 壓縮層,從工具輸出/RAG 到 Agent Wrap 的 Token 治理
Headroom 已從早期 chopratejas/headroom 轉為 headroomlabs-ai/headroom,官方定位為 AI agent 的 context compression layer:JSON 可省 60–95% token、coding agents 約 15–20%,支援 Python/TypeScript library、OpenAI-compatible proxy、MCP server、CLI wrap、多 agent shared memory 與 headroom learn。適合先用在高噪音 logs/RAG/tool output,不宜直接套到安全審查、帳務或事故處理等不能漏細節的任務。
AI Agent Tooling / Context Engineering
Headroom:把「塞進模型前」變成一個可治理的壓縮層
Headroom 的定位很直接:在 LLM 看到工具輸出、logs、檔案內容、RAG chunks 之前,先做 context compression。2026-08 查證時,專案已轉到 headroomlabs-ai/headroom,GitHub 約 6.3 萬 stars,最新版為 v0.33.0;官方 README 主張 JSON data 可減少 60–95% tokens、coding agents 約 15–20% tokens,並提供 library、OpenAI-compatible proxy、MCP server、CLI wrap 等接入方式。
解決的痛點
Coding agent 很常不是推理能力不夠,而是 tool output、測試 log、搜尋結果、RAG 區塊太肥,導致 context 快速爆掉、成本上升、有效訊號被淹沒。
工具定位
它不是 ZIP 壓縮,而是把原始內容轉成更適合 AI 讀的摘要 / 結構地圖;原始內容可留在本地 cache,讓模型需要時再透過 CCR(Compress, Cache, Retrieve)召回。
接入價值
最有吸引力的是不用重寫整條 agent pipeline:可從 library、proxy、MCP 或 CLI wrap 逐步導入。
目前官方能力重點
| 模式 | 用途 | BigIntTech 評估重點 |
|---|---|---|
| Library | Python / TypeScript 直接呼叫 compress(messages) | 最適合先放進自有 RAG / tool-output pipeline 做 A/B test。 |
| Proxy | headroom proxy --port 8787,以 OpenAI-compatible proxy 方式接入 | 低改動,但要確認 streaming、tool call、錯誤格式與既有 SDK 相容。 |
| Agent wrap | headroom wrap claude|codex|grok|copilot|cursor|aider|opencode|cline|continue|goose|openhands|openclaw... | 適合本機 agent 成本實驗;正式導入前要保留 unwrap / bypass。 |