載入中...
Allen KB Articles
共 143 篇;目前第 1 / 6 頁,每頁 24 篇。
danyuchn/iso-24495-skill 把 ISO 24495-1:2023 plain language 四原則做成 Claude Code skill,並加入繁體中文技術層;它和 ASD-STE100 的差別是 ISO 管邏輯與結構,ASD 管文法與受控用字。
整理 Threads 介紹 Cloudflare Kitesurf,查核 Cloudflare Blog / Browser Run docs:Kitesurf 是跑在 Workers / V8 isolates 上的 agent-first browser,CPU / memory 比 Chromium 低 3–7×,但 wall time 較慢且目前屬 Browser Run beta runtime;適合大規模 agent 抽取與瀏覽器工具分層。
Threads 討論把 Grok CLI 用在資料標註:每次用新 session、關閉記憶/子代理/web search、指定 rubric 與 JSON schema。本文對照 xAI 官方 CLI headless / structured outputs 文件,整理可用模式與安全 caveats。
Threads 提到用政府開放資料與開源工具把台灣公司、法人、董監事關係視覺化。本文整理台灣公司關係圖的用途、資料來源、限制與 BigIntTech 在客戶/供應商合作前可採用的查核流程。
高見龍在 iT 邦幫忙 / 個人 Blog 開始 30 天系列,打算用 Python 手刻一個教學用 coding agent「KeSi」。Day 01 的重點不是複製 Claude Code,而是拆掉 agent 的魔法感:核心是模型、while loop、工具呼叫與 context 管理;真正動手與權限把關的是本機程式,不是遠端模型。
paid-tw/payment 是 MIT 授權的台灣金流 SDK,GitHub metadata 顯示支援 PAYUNi、藍新 NewebPay、綠界 ECPay(AIO + 站內付 2.0)。它跟既有 paid-tw/einvoice 組成「金流 + 電子發票」統一 adapter 層;對 AI agents 處理帳務有價值,但金流屬高風險依賴,正式導入前必須跑 sandbox、退款/取消/對帳測試與資安審查。
YC Software 開源 QM,一個 Slack + Web 的 multiplayer agent harness。官方 README 強調每個人與每個 room/project 有 scoped memory、files、keychain view、permissions、crons、web apps 與 durable sandbox,可切換 Pi/OpenCode/Codex/Claude Code。重點是團隊 agent 的 credential/memory isolation,不是再開一個全公司共用 bot。
OpenAI 報告指出,ARC-AGI-3 官方 harness 因丟棄 private reasoning 與 rolling truncation,讓 GPT-5.6 Sol 難以累積互動經驗;改用 Responses API 的 retained reasoning 與 compaction 後,公開集 RHAE 從 13.3% 到 38.3%,output tokens 降 6 倍。
SHOPLINE 官方 MCP 支援用 Claude、Codex、Grok 等 AI Agent 查訂單、商品、庫存、顧客、優惠活動;重點不是把資料整包丟給 AI,而是權限、資料定義與人工審核流程。
Threads 以 Grok 開源與 Hermes Agent 上的 Memory OS 為例,指出開源生態正在從模型本身競爭轉向 agent 底座、記憶與協作框架。本文校正 xAI 開源事實並整理架構含意。
Sam Lung 將 Antigravity、Grok Build、Claude Code、Codex 的多 Agent 能力分成 workflow 編排型與最高推理自動多 Agent 型。本文查證 Claude Dynamic Workflows 與 ultracode 官方文件、xAI Grok Build 文件,並把 Grok/Claude/Codex/Antigravity整理成 Allen 可用的任務分派決策表。
RAGU 把 GraphRAG 的知識圖譜建構拆成兩階段萃取、DBSCAN 去重、LLM 濃縮與 Leiden 社群偵測;論文聲稱 7B Meno-Lite 在知識圖譜建構上相對 Qwen2.5-32B 有 +12.5% harmonic mean,GraphRAG-Bench Medical 證據召回最高 0.84。適合作為「管線內 LLM 不必越大越好」的架構訊號,但仍需以實際語料重測。
CabLate 的貼文提醒:面對更強模型,不要把 prompt / skill 寫成窮舉 rules;更穩的做法是陳述原則、目標與判斷框架。規則能控制少數情境,但任務變化、資訊不足或突發狀況時,模型容易變成一個口令一個動作。
ego-lite 是 citrolabs 開源的 AI agent browser,目標是讓 Codex / Claude Code 等 agent 使用你的真實登入、cookies、extensions 與 bookmarks,但在自己的 Spaces 執行瀏覽器任務,不干擾人類 tabs。GitHub 查證 MIT、約 4.9k stars、macOS-first。
Threads 介紹美團 CatPaw:手機可派任務看進度,桌面可讀檔、操作瀏覽器、跑終端機,雲端模式可延續任務,並把本地生活經驗包成專家與技能。公開查證有限,本文重點記錄其產品形狀:垂直場景 know-how + agent 工作台 + 可交付文件/報告/程式碼。
AI郵報轉述 Sam Altman 用手機 prompt 讓 ChatGPT 規劃 9 人週末旅行並生成全端網站。公開可查證來源有限,因此本文把它視為產品方向訊號:AI 從回答問題走向為一次性任務生成臨時工具,競爭焦點從「能不能做」轉向「能不能穩定重現」。
Block Buzz 是 self-hostable agent workspace,不只是 Slack clone。它用 signed event log / Nostr relay 思路,把人、agent、repo、workflow、review approval 放在同一套可稽核空間;Apache-2.0,但仍屬高速變動早期專案。
oneday 的 Threads 用 ATM 與手機銀行比喻工程師面對 AI 的位置:ATM 取代銀行櫃員的部分任務,但真正讓櫃員需求下降的是手機銀行讓許多臨櫃任務變得不再必要。對工程師也是如此,短期 AI 可能像 ATM,提升寫碼效率;長期若產品入口與使用者行為改變,會像 iPhone 一樣讓既有任務消失。本文整理成工程師/軟體公司策略:不要只站在被自動化的任務上,要站到問題定義、系統整合、業務入口、信任與責任邊界。
AI 郵報 Threads 與原文整理一週 AI Agent 相關訊號:Codex 週活躍用戶破千萬但相對 ChatGPT 週活躍 9 億仍小;Unlimited-OCR 33 億參數、32K context、MIT 授權;Gemini 3.6 Flash / 3.5 Flash-Lite / 3.5 Flash Cyber 的 token 與多模態主張;MCP session ID 管理朝無狀態設計;Natural 挑戰 Stripe 的 agent payment;Kimi K3 開放權重;紐約州用 AI 清查法規。本文把它整理成 Agent 普及缺口清單,所有 benchmark/數字以 AI 郵報/來源宣稱呈現,未重跑驗證。
Threads 討論 agent 上網搜尋到底用 OpenAI 內建 web_search 還是 Google Custom Search API。實測重點是:web_search 可以讓模型搜尋並 open_page 看頁面,但可讀文字轉換可能丟掉只有 icon、沒有 anchor text 的 href;Google Custom Search JSON API 只回搜尋結果 metadata,且官方文件顯示 2027-01-01 停止服務、目前不開放新客戶。本文整理最實用架構:web_search 負責找候選與判斷,fetchPage 讀原始 HTML 抽 href / metadata / JSON-LD,GCS 或替代搜尋 API 只當 fallback。
Threads 以 Claude 操作鼎新 ERP 的案例切入:應付憑單自動產出、進貨核價比對、退貨扣款勾稽、發票掃描辨識,讓月結從 10 天縮到 2 天。但文章提醒,ERP / 財務流程裡 AI 的每個動作,在稽核眼中都是需要授權依據與紀錄的交易。查證 ERP Master 完整文章後,本文整理 AI 代理內控五支柱:身分與授權、風險分級、職能分離、軌跡與版本、監控與回測,並加上 ERP 導入 checklist。
Threads 轉述 Can Bölük / Stencil 的 /prewalk:昂貴 frontier model 先深入閱讀、建立 todo、並完成第一個 edit,再把完整軌跡交給便宜模型接手。核心洞察是 coding agent 的 token 成本主要在閱讀而非寫入;傳統 /plan 只交接摘要會讓便宜模型重讀整個 repo,反而可能更貴。搜尋結果與相關 repo 轉述 Stencil SWE-Bench Pro 實驗主張:保留約 92–97% frontier pass rate、成本約減半,特定設定下成本降 41%、速度 1.9×。
Threads 分享把 x.com URL 改成 xcancel.com,可讓 AI 更容易讀公開 X tag、list、推文並做趨勢摘要。查證 XCancel about page 可回 200,HTML metadata 顯示 Nitter 類 frontend;但搜尋/使用者頁可能回 503,因此它適合當免登入、免 JS 的快速讀取 fallback,不適合作為穩定 API、大量爬取或正式產品資料源。正式需求仍應評估 X 官方 API / Hosted X MCP。
Dustin GMAT 分享一個 Claim-Evidence Hook:當模型宣稱已驗證、已測試、已實測,或宣稱找不到、不存在、查無時,hook 會檢查本輪 session 是否真的有相應工具 / 指令證據;沒有就要求拿出證據、回去驗證或降級成「尚未驗證」。查證 Claude Code hooks 官方文件後,本文整理 Stop / PreToolUse / PostToolUse 等事件如何支撐這種 guard,並翻成 Athena / Hermes 可用的 execution ledger + claim classifier + evidence matcher 架構。