insanely-fast-whisper:本地 Whisper 轉錄加速工具,重點不是 TensorRT 而是 Transformers / Flash Attention
TechRitual 介紹 insanely-fast-whisper 作為 Whisper 語音轉文字加速工具;官方 GitHub 可核對它是 Vaibhavs10 維護的本地 CLI,核心堆疊為 Transformers、Optimum 與 flash-attn。官方 benchmark 稱 A100 上可用 Whisper large-v3 於 98 秒內轉錄 150 分鐘音訊;但原文提到 TensorRT 與 MIT 授權需修正:GitHub repo 顯示 Apache-2.0,PyPI metadata 顯示 MIT。
這是什麼
insanely-fast-whisper 是一個 opinionated CLI,用本地機器跑 Whisper / Distil-Whisper 轉錄。官方 README 描述它由 Hugging Face Transformers、Optimum 與 flash-attn 驅動;可用 pipx 安裝,直接對音訊檔或 URL 做轉錄。
音訊留在本機或自管環境,不必交給雲端 ASR API,適合會議、客服、內部錄音等敏感資料場景。
官方 benchmark 稱在 NVIDIA A100 80GB 上,Whisper large-v3 搭配 fp16、batching 24、Flash Attention 2,可在約 1 分 38 秒轉錄 150 分鐘音訊。
基本用法是 pipx install insanely-fast-whisper 後執行 insanely-fast-whisper --file-name <audio-or-url>。
CLI options 包含 chunk / word timestamp,也可搭配 HF token 與 pyannote diarization model 做 speaker diarization。
官方可核對資訊
| 項目 | 核對結果 |
|---|---|
| GitHub |