載入中...
載入中...
美團 LongCat-Video-Avatar-1.5 以 MIT 釋出,支援 audio-text-to-video、audio-image-text-to-video 與 video continuation。官方 model card 強調 Whisper-Large 音訊編碼、長影片身份一致性、8-step inference、480P/720P、真人/動漫/動物與多角色場景;補充應用方向包括 AI 家教、配音流程、會說話的 coding agent 與遊戲 NPC,但互動式產品仍需低延遲 agent runtime。
HumanLayer 的 show-me skill 讓 coding agent 用 diff、call tree、file tree、Mermaid 或小型 HTML artifact 解釋當前改動,減少長篇 claudesepeak,讓使用者更快驗證成果與下下一步。
danyuchn/iso-24495-skill 把 ISO 24495-1:2023 plain language 四原則做成 Claude Code skill,並加入繁體中文技術層;它和 ASD-STE100 的差別是 ISO 管邏輯與結構,ASD 管文法與受控用字。
Modal 官方宣布 Kimi K3 by Moonshot 已上 Shared API,採 OpenAI 相容介面與 token-based pricing;Starter 方案頁與 llms.txt 均確認每月 $30 免費額度。這篇整理可試用價值、超額扣款風險、Workspace Budget / billing guardrail 與 BigIntTech PoC 使用方式。
RAGU 把 GraphRAG 的知識圖譜建構拆成兩階段萃取、DBSCAN 去重、LLM 濃縮與 Leiden 社群偵測;論文聲稱 7B Meno-Lite 在知識圖譜建構上相對 Qwen2.5-32B 有 +12.5% harmonic mean,GraphRAG-Bench Medical 證據召回最高 0.84。適合作為「管線內 LLM 不必越大越好」的架構訊號,但仍需以實際語料重測。
Kai Chen 分享用 Claude 先讀 60 頁區域代理合約,整理「必看的 6 條」與「對甲方不利的隱藏地雷」,再交給律師確認。查證 Claude PDF support 確實支援 PDF 分析,但留言區集中提醒:AI 摘要不能替代律師法律意見,也不一定降低律師成本;較穩健做法是要求原文引用、頁碼、風險等級與待問律師清單。
Threads 貼文分享 threejsassets 免費 GLB 資產與可直接交給 Agent 的 Three.js 載入 prompt;查證後整理資產數量、Free Commercial License、下載 caveat,以及可落地到 BigIntTech demo 的改良版 SOP。
Threads 分享 GitHub 開源專案 AI Team OS,以及作者改寫成 Hermes Agent 原生版的 AI 開會實驗:不同 AI 角色各自研究、辯論,再由主席收斂結論。原 repo CronusL-1141/AI-company 已實查為 MIT、Claude Code native 的 multi-agent team operating system,README 主張具備 agent templates、structured meetings、Six Thinking Hats、DACI、pipeline workflows、dashboard 與 MCP tools。對一人公司最有價值的不是萬字報告,而是把孤獨決策改成多視角檢查;風險則是品質控制、錯誤互相強化與主席收斂機制。
INSIDE 報導 2026 FusionNext 年會現場對談,將企業導入 AI 的痛點拆成三層:第一是跨越人心與組織本位主義,避免大量 AI 試點卡在 Pilot Purgatory;第二是治理資料孤島與底層數據,否則高階模型只會 Garbage in, Garbage out;第三是面對 AI Agent 帶來的 prompt injection、權限越界與合規風險,建立企業級 AI、零信任、guardrail 與 supervisor agent。核心結論是:AI 不是買最貴模型就能變現,而是企業能否重整資料、流程、商業模式與安全治理。
Threads 貼文推薦 GenericAgent(GA),主張它比 Hermes、OpenClaw 等主流 Agent 更適合極簡派與長駐運維:核心迴圈約 100 行、9 個原子工具、任務後自動結晶 SOP/技能樹,並在技術報告中宣稱可降低 token 與任務時間。實際檢查 GitHub 後,GenericAgent repo 採 MIT License、約 13k stars,技術報告 repo 未附 LICENSE。此工具值得研究的是「把成功軌跡壓縮成可重用 SOP」的方向,但 benchmark 數字仍應視為作者報告,需要以自己的任務集重測。
中國開發者透過灰色「中轉站」以官方一折甚至更低價格使用 Claude token;真正風險不只價格,而是代理可降級模型、灌量、保存 prompt 與程式碼,並削弱模型公司的存取管制。
Threads 貼文介紹 arXiv 論文《Steganography Without Modification: Hidden Communication via LLM Seeds》:LLM 推論中的 PRNG seed 可能成為隱寫通道,讓秘密訊息透過看似正常的生成文字被還原。本文整理其原理、風險場景與防禦啟示。
CabLate 的 Threads 討論指出 Codex 在 UI/UX 上容易資訊量過大、操作不直覺、很愛列舉;留言補充可用 Claude Design/Claude Code、Gemini/Antigravity、Open Design、先產生參考圖再交給 coding agent。重點是:UI 判斷力不是把元素排整齊,而是知道何時刪減、分層與打破規則。
這篇 Threads 把腦機介面、神經訊號採樣、PB/EB 級科學資料、矽光子與 AI 可解釋性串在一起。重點不是簡單判斷 Neuralink 是否落後,而是看見前沿科學正在被儲存、通訊、實驗動物成本與模型不可解釋性共同限制。
BlockTempo 文章整理 Claude Fable 5 自我改進代理系統的 14 步框架。本文抽取可長期複用的系統設計重點:自我改進不是模型自我更新權重,而是模型周圍的工作流、驗證者、記憶、狀態檔、Skills、例行排程與回饋迴圈逐步複利;並映射到 Hermes / Claude Code 類 agent 工作流的落地做法。
一則 Threads 貼文介紹 AMD Ryzen AI Halo:128GB unified memory、可支援最高 200B 參數模型、Windows/Linux 與 ROCm。本文整理官方規格、它對本地 AI 推理與原型開發的意義,以及與雲端 GPU、CUDA 生態、Mac Studio / NVIDIA DGX Spark 類設備相比的採用邊界。
一則 Threads 把 Claude Max、DSPy、Mem0、CrewAI、SkillOpt 串成「公司第二大腦」30 天導入方案。可取之處是把 AI 使用從個人工具提升到組織資產;但更務實的做法是先定義可沉澱的工作流與驗收資料,再選推理、記憶、協調與技能優化層。
Andrew 的 Threads 長文指出:Whisper 逐字稿是半成品,常有人名、專有名詞、同音異字、口頭重複與結巴問題;若直接拿去餵 AI,後續問答會被低品質資料污染。建議先用高階模型 cleanup;線上會議則用 Vexa 類 meeting bot 取得講者標記。
Threads 貼文拆解以 Gemini Embedding、Pinecone、OpenRouter 與 Claude Code 建置多模態 RAG 的做法。官方資料可核對:Gemini Embedding 2 會將 text、images、video、audio、documents 映射到 single embedding space;Gemini API File Search 則新增 multimodal support、custom metadata、page-level citations。實務重點是 retrieval recall、metadata 設計、citation 可追溯性與資料生命週期。
Vaibhav Srivastav 提供的 prompt 把 Codex 從「每次重新聽指令的工具」推向「能回顧 session、memory、rollout summary 與 Chronicle,主動找出可封裝重複流程的協作者」。核心方法是先列候選清單,再只建立高信心、範圍窄、可驗證且未被現有資產涵蓋的 skill、custom subagent 或 automation。
Anam 主打 real-time AI avatars:persona 由 face、voice、LLM、system prompt 組成,透過 STT→LLM→TTS→face generation 形成可插嘴、可互動的數位人。這類產品的重點不是取代 HeyGen 生成影片,而是把 voice agent 加上一張即時反應的臉。
Hermes Agent v0.14.0 Foundation Release 官方 release note 顯示:808 commits、633 PRs、215 位社群貢獻者,重點不只是新功能,而是把安裝、代理整合、OAuth provider、本地 OpenAI-compatible proxy、Teams/LINE/SimpleX、prompt cache 與 lazy dependencies 一起推向可用基礎設施。
AssemblyAI Voice Agent API 主打單一 WebSocket、speech in / speech out、約 1 秒端到端延遲、JSON Schema tool calling 與每小時 4.50 美元定價。對語音 Agent 產品而言,核心取捨是:用整合式管線換更快上線與較低維運,或自組 ASR/LLM/TTS 換更高可控性。
Moonshot AI 的 Kimi K2.6 官方技術文確認了 Agent Swarm、長時程 coding、300 個 sub-agents 與 4,000 coordinated steps 等方向。可保存的重點不是單一 benchmark 輸贏,而是 agent 系統正在從「一個模型回答」走向「多代理平行執行與調度」。