video-production-skill:把 YouTube 教學影片產線包成 AI Agent Skill | Allen 知識庫 | Allen 知識庫AI Agent / Media Production
video-production-skill:把 YouTube 教學影片產線包成 AI Agent Skill
speechlab0210 開源 video-production-skill,將蝦說 AI 頻道實際產出 40+ 支影片的流程整理成 AI agent 可讀的 SKILL.md 與 9 個腳本:腳本、投影片、ElevenLabs TTS、Whisper ASR 驗證、FFmpeg 組裝、字幕對齊與封面,MIT 授權。它不是一鍵生成器,而是把可驗證的影片製作 SOP 交給 Claude Code、Codex、Gemini CLI 等 agent 執行。
2026年7月15日4 分鐘閱讀👁 5
AI Agent / Video Production
video-production-skill:把一整套 YouTube 教學影片產線交給 AI Agent
小金(speechlab0210 / 蝦說 AI)把自己做 YouTube 影片的流程開源成 video-production-skill。重點不是「AI 影片生成器」,而是 AI agent 可讀的作業程序 + 可執行腳本:從旁白腳本、手繪風投影片、TTS 配音、Whisper 回譯驗證、FFmpeg 組裝、字幕對齊到封面,全部變成一套可重複執行的 pipeline。
Kate 判斷:這類 skill 很值得 Allen 收。它展示了「把創作者手藝變成 agent 操作規格」的方向:真正有價值的不是單一工具,而是把每一步品質 gate、踩坑經驗與腳本封裝起來,讓 agent 不會每次重新發明爛流程。
來源訊號
- Threads 作者:小金
@speechlab0210。
- 原文稱:平常做 YouTube 影片的手繪風投影片、旁白配音、字幕自動對齊、封面、發音逐字校對,全部打包成一個 skill。
- GitHub:speechlab0210/video-production-skill。
- GitHub metadata 實查:MIT License、主語言 JavaScript、建立於 2026-07-03;查詢時約 70 stars、20 forks。
它是什麼,不是什麼
| 不是 | 而是 |
|---|
| 一鍵式 AI 影片生成器 | 給 AI coding agent 讀的影片製作 SOP + 腳本工具箱 |
| 只靠文字 prompt 產影片 | script → slides → TTS → ASR verification → FFmpeg assembly → subtitles → cover |
| 保證內容一定好看 | 保證工程品質:聲音對字、字幕對聲、投影片可讀、影片可播放 |
| 只適用某個 agent | Claude Code、Codex、Gemini CLI、Cursor 等可跑指令的 agent 都可照 SKILL.md 執行 |
Pipeline 結構
- 讀
references/teaching-style.md 與 references/narration-style.md,建立教學與旁白品質規則。
- 寫
narration.json:一張投影片對一段旁白,強制檢查數量一致。
- 產投影片:可走 gpt-image-2 手繪風,或 HTML + Playwright screenshot。
逐張視覺檢查:中文字亂碼、裁切、手機可讀性都要看。ElevenLabs TTS 配音,並用 Whisper ASR 回譯驗證相似度,預設門檻 0.85。FFmpeg 組裝成 video.mp4,檢查 audio bitrate 與抽 frame 驗證畫面。產字幕:Whisper timestamps + 原稿文字,避免 ASR 錯字直接進字幕。產封面:16:9、pad 不 crop,避免 YouTube 自動 frame 當縮圖。先 unlisted/private 上傳,確認播放、縮圖、字幕再公開。Repo 內容
| 路徑 | 用途 |
|---|
SKILL.md | 主流程、checklist、每一步的地雷與品質 gate。 |
scripts/slides_gen.py | 用 gpt-image-2 產手繪風教學投影片。 |
scripts/screenshot.js | HTML 投影片用 Playwright 截圖。 |
scripts/tts_with_asr.js | ElevenLabs TTS + Whisper ASR 驗證迴圈。 |
scripts/assemble.js | FFmpeg 將投影片與音訊組成影片。 |
scripts/gen_subtitles.js | 產生對齊字幕:用 Whisper timing,但顯示原稿。 |
scripts/pad_and_burn.js | 投影片 padding 與字幕 burn-in。 |
scripts/cover_gen.py | 產 YouTube 封面。 |
references/lessons-learned.md | 40+ 支影片累積的事故報告:API key、字幕漂移、silent audio、字太小等。 |
依賴與成本
- Node.js ≥ 18:大部分腳本,HTML 截圖需 Playwright。
- Python ≥ 3.9:gpt-image-2 投影片 / 封面生成、rescore。
- FFmpeg + FFprobe:影片組裝與品質檢查。
- ELEVENLABS_API_KEY:TTS 配音。
- OPENAI_API_KEY:Whisper ASR 驗證 + gpt-image-2 生圖。
- README 估算:一支 10 張投影片、5 分鐘影片,大約 10–15 次 gpt-image-2 生圖、10–20 次 TTS、20–30 次 Whisper 轉錄。
安裝 / 使用方式
Claude Code
git clone https://github.com/speechlab0210/video-production-skill.git .claude/skills/video-production
Codex CLI
Clone 到專案裡,並在 AGENTS.md 加上:
Before any video production task, read video-production-skill/SKILL.md and follow it exactly, including the mandatory checklist.
其他 agent
在 task prompt 明確要求先完整讀 video-production-skill/SKILL.md,不要讓 agent 自己發明流程。
最值得偷師的工程原則
- 每一步都有品質 gate:投影片視覺檢查、TTS ASR 驗證、ffprobe audio bitrate、frame extraction、上傳後 thumbnail 檢查。
- 字幕顯示用原稿,不用 ASR 輸出:Whisper 的中文轉錄可能錯,但時間戳通常可靠。
- 不要追求 100% 自動化:它把重複工程交給 agent,但仍要求人 / agent 做視覺與播放驗證。
- 事故知識產品化:
lessons-learned.md 比腳本還珍貴,因為它把「曾經炸過」的點寫成可避免的 checklist。
- 繁中是一等公民:破音字、字幕寬度、TTS 標點、手機可讀性都針對中文內容調過。
對 Allen / BigIntTech 的可用性
- 內容產線:可作為 BigIntTech 內部教學、產品說明、知識庫影片化的 agent workflow 參考。
- Skill authoring 範本:非常適合拆解「好 skill 怎麼寫」:完整 SKILL.md、scripts、references、config-example、lessons-learned。
- 商業產品啟發:比起賣一個影片生成工具,更像賣「可驗證的內容產線代理」。
- 可接 LifeOps / KB:未來可把 Allen KB 文章轉成短教學影片,但要先補品牌口吻、旁白品質與封面模板。
導入 caveat
- MIT 授權的是 repo 程式與文件;ElevenLabs、OpenAI、生圖素材與影片平台仍有各自條款與成本。
- 內容品質不由 skill 保證;旁白寫作與選題仍需要 agent 能力與人工審稿。
- 若用 cloned voice,必須確認聲音授權與揭露 AI 生成。
- 如果要上 YouTube,Google 自動化登入常被擋;需用已登入瀏覽器或手動/既有 upload 流程。
來源