Voice / Speech / Multimodal
audio-transcribe-skill:用 agy/Gemini 轉錄音檔並只回路徑,避免逐字稿灌回 Claude Code 燒 token
Jerry Lin 分享 lazyjerry/audio-transcribe-skill:Claude Code/Codex 呼叫時委派 agy -p 讓 Gemini 原生多模態音訊理解轉錄,逐字稿與 SRT 寫檔,stdout 只回路徑,避免大量 transcript 回流到 Claude Code context。本文查核 README 與授權 caveat,整理可用場景。
2026年7月26日1 分鐘閱讀👁 5
Audio Transcription / Gemini / Agent Skill
audio-transcribe-skill 把「Gemini 很快轉錄音檔」進一步工程化:不把完整逐字稿回傳給 Claude Code,而是讓 agy/Gemini 寫到檔案,stdout 只回一行路徑。這才是真正省 token 的點。
來源與查核
- Threads:Jerry Lin 分享 audio-transcribe-skill
- lazyjerry/audio-transcribe-skill:查核時 0 stars;GitHub license metadata 為 null,但 README 寫「MIT」且未見 LICENSE 檔,需保留授權 caveat。
- README:Claude Code / Codex 等非 agy 環境委派
agy -p;在 agy/gemini 環境避免遞迴;逐字稿寫入輸出檔,stdout 只印絕對路徑;另有 transcript-to-srt。 - 驗證標記:audio-transcribe-skill agy Gemini SRT transcript token saving
為什麼它比單純 prompt 更好
| 做法 | 問題 | audio-transcribe-skill 的處理 |
|---|---|---|
| 直接請 Claude Code 轉錄 | 音訊能力未必可用,長逐字稿回 response/context,燒大量 token。 | 委派 agy/Gemini 原生音訊理解。 |
| agy 直接回逐字稿 | 逐字稿仍可能被上層 agent 吃進 context。 | 要求 agy 自行寫檔,stdout 只回路徑。 |
| 手動轉 SRT | 還要另寫處理腳本。 | 提供 transcript-to-srt.sh,從 [MM:SS] 轉字幕 cue。 |
導入 caveat
- 需安裝並登入 Antigravity CLI / agy。
- 音檔會交給雲端 Gemini;客戶機密/個資/未授權錄音仍應走本機 WhisperLive / faster-whisper。
- README 寫 MIT,但 GitHub 無 LICENSE metadata/檔案;若要商用再散布,先補 LICENSE 或取得作者確認。
- 這不是 streaming STT;它偏批次逐字稿/SRT 產出。
Kate 判斷
這是很適合放進 Allen 的 agent toolbox 的模式:昂貴或大量輸出的工作要「寫檔 + 回路徑」,不要把全部內容塞回主 agent。這個 pattern 可套到 OCR、PDF 解析、會議逐字稿、長表格抽取。