claude-real-video:讓 LLM 真的看見影片畫面,而不只是讀 YouTube 字幕稿
claude-real-video 是 HUANGCHIHHUNGLeo 開源工具,MIT、Python、PyPI 可安裝。它用 scene-change detection + sliding-window dedup 抽取真正變化的關鍵影格,搭配字幕或 Whisper transcript,輸出 frames、MANIFEST 與 transcript,讓 Claude/ChatGPT/Gemini 等 LLM 能讀到影片的視覺內容。適合教學、demo、簡報、操作影片與研究資料整理,也可做成 Claude Code skill。
claude-real-video 解的是一個很實際的問題:很多 AI 工具其實沒有真的看影片,只是讀 YouTube 字幕稿。對教學影片、產品 demo、投影片錄影、操作 walkthrough 來說,畫面常常比字幕更重要。
這個工具的做法不是每隔 N 秒硬截一張圖,而是用 scene-change detection 抓畫面真的變化的關鍵影格,再用 sliding-window dedup 去掉重複畫面,最後搭配字幕或 Whisper transcript,整理成 LLM 可讀的一包資料。
GitHub 核對
- Repo:
HUANGCHIHHUNGLeo/claude-real-video - Language:Python
- License:MIT
- GitHub description:Let Claude (or any LLM) actually watch a video — scene-aware, deduplicated frames + transcript, from a URL or local file. Runs locally, MIT.
- 安裝:
pip install claude-real-video - 系統需求:
ffmpeg/ffprobe;若要轉錄需 Whisper extra。
它輸出什麼
crv "https://www.youtube.com/watch?v=..."
# → crv-out/frames/*.jpg
# → crv-out/transcript.txt
# → crv-out/MANIFEST.txt
也可以用 --grid 把影格打包成 contact sheets,讓模型讀連續畫面序列,而不是一堆散落截圖。