載入中...
載入中...
OpenAI 官方 X thread 確認 GPT-5.6 Luna 價格降低 80%、Terra 降低 20%,GPT-5.6 Sol API 提供 Fast mode;同時 ChatGPT app 與 Codex CLI 的 Auto-review 從 GPT-5.4 升級到 GPT-5.6 Luna,預期 Auto-review 成本約低 10 倍。實務策略是 Luna 做日常/審核,Terra/Sol 留給架構、疑難與高風險任務。
Threads @drpwchen 以 Claude Opus 5 官方指南做了一次 Claude Code 基礎設施校準。官方文件確認 Opus 5 具備 1M context、128k max output、thinking 預設開啟、low/medium effort 成本效率提升、code review precision/recall 強,以及更常自我驗證與主動派 subagent。本文整理成 Allen/Hermes 可用的 agent harness 調整清單:少寫 double-check、不要用「只報 high severity」、限制委派、明確壓輸出長度,並補充 claude-pacer 作為 Claude Code usage pacing 的周邊工具。
Threads 轉述 Can Bölük / Stencil 的 /prewalk:昂貴 frontier model 先深入閱讀、建立 todo、並完成第一個 edit,再把完整軌跡交給便宜模型接手。核心洞察是 coding agent 的 token 成本主要在閱讀而非寫入;傳統 /plan 只交接摘要會讓便宜模型重讀整個 repo,反而可能更貴。搜尋結果與相關 repo 轉述 Stencil SWE-Bench Pro 實驗主張:保留約 92–97% frontier pass rate、成本約減半,特定設定下成本降 41%、速度 1.9×。
Threads @nevergodbo 用簡短口訣推薦模型:無腦選 GPT-5.6 Sol、沒錢選 Luna、超高規劃選 Sol、有效能預算選 Fable 5、色色選 Grok 4.5。留言補充不能只看 API 單價,effort/max 可能吐出更多 token,總成本不一定省。本文把它整理成模型 routing heuristic:依任務風險、reasoning depth、成本與輸出 token 控制選模型,而非單看 list price。
Threads @prompt_case 整理 Tibo/社群分享的 claudex 做法:用 CLIProxyAPI 作為本機 proxy,讓 Claude Code 透過 ANTHROPIC_BASE_URL / ANTHROPIC_AUTH_TOKEN 指向本機端口,再指定 gpt-5.6-sol。查證 CLIProxyAPI README 與 docs 可確認它提供 OpenAI/Gemini/Claude/Codex/Grok compatible API interfaces、支援 Claude Code integration,MIT 授權;GitHub Blog 也確認 GPT-5.6 Sol/Terra/Luna 已在 Copilot rollout。本文重點是:可作 sandbox 研究,不建議無腦改 shell 或 production 使用。
整理 Threads 對 AgentOpt 研究的反直覺觀察:Ministral 8B 當 Planner、Opus 當 Solver 在 HotpotQA 上可達 74.27%,而 Opus 放 Planner 可能因直接回答而破壞委派流程。重點不是弱模型比較好,而是模型要符合節點角色;Planner、Solver、Advisor 的責任邊界要先定義。