載入中...
載入中...
Threads 討論 Kimi K3 2.8T / 896 experts 上架後,Hugging Face 社群快速出現 GGUF、llama.cpp 與 vision 支援。本文查證 moonshotai/Kimi-K3 與 Unsloth GGUF model card,整理 MXFP4、Q4/Q8 體積差與部署 caveat。
Angus 電科技的 Threads 介紹 B站創作者「一兄弟」以 Hugging Face speech-to-speech、Silero VAD、Whisper/Parakeet 類 STT、llama.cpp、本地 TTS 拼出純本地語音陪伴 Demo。查證 Hugging Face speech-to-speech:Apache-2.0、PyPI 0.2.11、GitHub 約 6,551 stars / 880 forks,README 定位為低延遲、模組化 VAD→STT→LLM→TTS pipeline,提供 OpenAI Realtime-compatible WebSocket API。RTX 3060 / 15GB 顯存等數字保留為 Threads/B站 Demo 宣稱,仍需實測延遲、中文效果與安全邊界。
Thor Lin 推薦 Huihui-ThinkingCap-Qwen3.6-27B-abliterated 作為 24GB 顯卡可跑的免費本地模型。核心訊號不是單純 tok/s,而是 ThinkingCap 微調把 reasoning token 大幅縮短;作者文章 claims GSM8K 從 3,175 到 648、MTP 從 27.6 到 38.6 tok/s。HF 頁面可驗證 bottlecapai、huihui-ai、mradermacher GGUF 三層模型存在,license tag 為 apache-2.0;性能數字仍應視為作者/模型卡 claim,未重跑。
Threads 貼文整理 2026 年本地 LLM / LocalLLaMA 社群對 MTP 與 DSpark 的討論。本文補充 arXiv 2607.05147 與 GitHub/PR 驗證,說明 Multi-Token Prediction、DSpark semi-autoregressive drafter、confidence-scheduled verification 的差異與落地 caveat。
Gemma 4 QAT GGUF 的價值不只在量化,而是在把多模態、長上下文與本機推論推到一般筆電/消費級 GPU 可測的範圍;新增 12B Instruct 在 16GB 顯卡、LM Studio、256K context 的社群實測補充。
Threads 討論 RTX 4060 8GB + 32GB DDR5 筆電跑 Qwen 35B A3B 長上下文的案例。耐人尋味的不是「小顯卡能跑大模型」,而是本地 LLM 的瓶頸正在轉向 KV cache、量化、RAM 頻寬、OS 與 mmap/mlock 等系統調校。
NVIDIA Nemotron 3 Nano Omni 把文字、圖片、影片、音訊、OCR、語音轉錄、GUI 理解與工具調用整合成單一 30B-A3B MoE 模型,已可透過 LM Studio、Ollama、llama.cpp、vLLM、SGLang 等路徑使用;真正重點不是「又一個模型」,而是企業級本地多模態 Agent 的部署門檻正在下降。
Hugging Face CTO 用 Qwen3.6-27B、llama.cpp 與 Pi coding agent 在 MacBook Pro 上跑本地 coding agent,體感接近 Claude Opus;這代表開源本地模型在日常 coding 任務上的護城河差距正在變淺,但仍要留意公開 codebase、速度與第三方驗證限制。