載入中...
Allen KB Articles
共 23 篇;目前第 1 / 1 頁,每頁 24 篇。
ihower 分享 LlamaIndex Beyond RAG workshop 導讀,核心論點是 RAG 錯誤多半不是最後生成模型問題,而是文件解析、表格/圖表結構、chunk 粒度、reranking、agentic loop 與 structured query routing 的工程問題。本文整理對 Allen KB / Hermes RAG 架構的實務含義。
Threads 轉述 Can Bölük / Stencil 的 /prewalk:昂貴 frontier model 先深入閱讀、建立 todo、並完成第一個 edit,再把完整軌跡交給便宜模型接手。核心洞察是 coding agent 的 token 成本主要在閱讀而非寫入;傳統 /plan 只交接摘要會讓便宜模型重讀整個 repo,反而可能更貴。搜尋結果與相關 repo 轉述 Stencil SWE-Bench Pro 實驗主張:保留約 92–97% frontier pass rate、成本約減半,特定設定下成本降 41%、速度 1.9×。
Dustin GMAT 分享一個 Claim-Evidence Hook:當模型宣稱已驗證、已測試、已實測,或宣稱找不到、不存在、查無時,hook 會檢查本輪 session 是否真的有相應工具 / 指令證據;沒有就要求拿出證據、回去驗證或降級成「尚未驗證」。查證 Claude Code hooks 官方文件後,本文整理 Stop / PreToolUse / PostToolUse 等事件如何支撐這種 guard,並翻成 Athena / Hermes 可用的 execution ledger + claim classifier + evidence matcher 架構。
TokenBar 是 Nanako0129 開源的 macOS menu bar AI coding usage / quota monitor,讀本機 logs 追蹤 Claude Code、Codex、Cursor、OpenCode、Hermes 等 25+ agents。GitHub 查證:MIT、Rust + Swift、Apple Silicon / macOS 14+、Homebrew cask、Liquid Glass、zero telemetry,latest release v1.7.0。適合多 agent 工作流的 spend observability;若只想看 5-hour / weekly quota bar,CodexBar 或更極簡工具可能較少噪音。
Threads 轉介 ClaudeWorld 的 Agent 工具差異地圖:用 11 個系統層級比較 Claude Code、Codex 與 Grok Build,指出三者正從不同路線走向同一台 Agent Computer。Claude Code 偏 Agent OS / 協作控制面,Codex 偏 local-to-cloud execution fabric,Grok Build 偏可攜本機 agent runtime;共同缺口是一致語意狀態、全域資源核心、統一授權、因果副作用帳本、交易式復原與位置透明執行層。
Threads 作者整理 5-Day AI Agent 課程第三堂:重點不是堆 multi-agent swarms 或超大 context,而是用 Agent Skills 把任務流程、scripts、references 封裝成可版本化、可測試、可治理的工程資產。
Threads @ryy.dev 分享 Databricks 用內部真實 PR 建立 coding agent benchmark,重點結論是:模型能力、token 單價、task-level cost 與 harness/context 管理都要一起看;同模型同 effort 下,Pi harness 在部分組合可用約 3x 少 context per turn、成本便宜 1.2–2.08x 且品質接近。本文查證 Databricks 官方 benchmark 與 Omnigent meta-harness / GitHub,整理對 BigIntTech/Hermes agent ops 的啟發。
Nanako Tsai 發布 pilotfish v1.1.1 community fixes。這版修正三個實務坑:subagent 不能再往下派 subagent,避免遞迴委派燒預算且難 debug;executor / mech-executor 對長時間 build/test/server 改成 detached background process + log path handoff,不在子代理回合內傻等;安裝驗證流程因 Claude Code 2.1.198 移除 /agents 指令而改用 /model 與直接詢問可用 subagent。
Threads 分享 Anthropic 官方 Claude Loops 入門文章,重點是把 agent 從單次 prompt 進化成可驗證、可停止、可排程、可主動執行的 loop。官方文章將 loops 分成 turn-based、goal-based、time-based、proactive 四種,並強調 success criteria、verification skills、fresh-context reviewer、token/cost boundaries 與小規模 pilot。
darkseoking 分享的 Fable Soul 是一個 MIT 開源的 AI coding agent judgment layer,repo 為 akseolabs-seo/fable-soul。它把 Fable5 使用體感中最有價值的操作紀律——先找根因、不要照抄錯誤指令、改完要驗證、不能沒測就說完成——整理成 SKILL.md、soul.md、compact mirror、transfer prompts、evals、worked examples 與同步腳本。重點不是讓小模型變成 Fable5,而是把高階 agent 的判斷習慣轉成可維護的 proof contract / rationalization table / capture loop。
Sentinel Gateway 類架構把 Agent 指令通道與外部資料通道分離,用 signed scoped token、tool scope、policy enforcement 與 audit log 降低 prompt injection 風險;對任何會讀網頁、API、PDF、email、留言的 Agent 都是重要設計。
Threads 討論 LangChain/LangGraph、Anthropic/OpenAI SDK、Pydantic AI 與自建 agent harness 的選型。真正的判斷軸不是流行度,而是流程固定度、客製化程度、可觀測性、團隊招募、模型升級速度與產品控制權。
runs.dash 的 Threads 貼文提出一個反直覺的 multi-agent 架構:不用中央 orchestrator、不靠共享資料庫,而是把 Telegram supergroup topic 當成 coordination layer。每個 agent session 掛在 topic 上,由 bridge 攔截 agent-B <msg> 這類訊息並注入對方下一個 turn;同 chat 直接注入、跨 chat fanout。真正的風險不是 routing,而是 agent 互相觸發形成 loop,因此需要 per-agent rate limit、state persistence 與 e2e 驗證。
Threads 實測 Google Chrome 團隊的 Modern Web Guidance agent skill:用 Hermes 掃網站後發現安全 headers 缺失,並可用 Cloudflare 快速補上。本文核對官方文件,整理 skill 定位、安裝方式、安全 header 清單與導入流程。
Threads 介紹 Ole Lehmann 的 Hermes 9 個 workflow:晨間簡報、會前背景、X 書籤到 Obsidian、humanizer 等。這類清單的真正價值不是技能數量,而是把每天重複的資訊收集、整理、提醒、審查與知識沉澱變成可排程、可追蹤、可迭代的 AI Chief-of-Staff。
Twinkle Hub 是台灣社群 TwinkleAI 打造的 MCP service,將 data.gov.tw 與台灣在地工具包成單一 MCP endpoint。它的重點不是又一個資料網站,而是讓 Claude、Cursor、Hermes、OpenClaw 等 agent 可以用一致協定查台灣開放資料、跑 SQL、做地址/統編/捷運/曆法等在地查詢。
整理 Threads 用陰陽術語彙比喻 AI 工程的五層成熟度:PE 提示詞工程是咒文,CE 上下文工程是符咒,HE 挽具工程是式神,ME 駕馭工程是陰陽寮,FDE 則是把 AI 部署到真實組織流程的現代陰陽師。
Threads 貼文指出,多數企業不會直接採用 Hermes / OpenClaw,原因不是能力不足,而是 compliance、audit、security review 與 sandboxing 不夠企業級。OpenFang 以 Rust、16 層 security、sandboxed execution、single binary 作為企業級 agent OS 敘事,值得觀察。
Threads 貼文介紹 Printing Press:一套 CLI-factory + CLI-library,主張多數 API、MCP、官方 CLI 對 agent 不友善,浪費 token 與時間;它提供 30+ agent-native CLIs,並能為任意產品生成本地、SQLite-backed 的 CLI。
Rapid-MLX 是針對 Apple Silicon 的本地 AI engine,基於 MLX 與 Metal/unified memory,主打 OpenAI-compatible API、prompt cache、tool calling recovery、reasoning separation 與多 agent harness 相容。真正價值不是單一速度數字,而是讓 Mac 本地模型更接近可用於 agent workflow。
Claw-Eval-Live 用 105 個市場訊號導向的 workflow tasks 評估 13 個 frontier models,第一名也只過 66.7%。真正重點不是分數,而是 benchmark 的 evidence contract:用 traces、audit logs、service state 與 artifacts 驗證 agent 是否真的完成工作。
長期與多個 AI agent 協作時,問題不只是記憶不連續,而是決策、上下文、規則、文件與執行責任沒有治理;需要把 AI 協作視為一套可審計、可同步、可約束的系統。