SentrySearch:把行車紀錄器與監視器影片變成可用自然語言搜尋的資料庫
SentrySearch 是開源影片語意搜尋工具,可用 Gemini Embedding 2 或本地 Qwen3-VL 將影片片段嵌入向量資料庫,讓使用者用文字或圖片搜尋影片並自動剪出命中片段。
這則 Threads 介紹的 SentrySearch,重點不是「AI 搜影片」這句口號,而是它把影片從難以檢索的檔案,變成可以被查詢、索引、剪輯的資料庫。
以前要在行車紀錄器、監視器、活動錄影或素材庫裡找某個畫面,通常只能拖時間軸。SentrySearch 的做法是把影片切成重疊片段,直接用影片 embedding 模型把片段投到向量空間,再把文字查詢或圖片查詢嵌入到同一個空間,找出最相近的片段並自動從原始影片剪出 clip。
官方 README 的定位很清楚:Semantic search over video footage. Type what you're looking for, get a trimmed clip back.
可搜尋的例子包括:
- red truck running a stop sign
- car cutting me off
- 有人靠近車子
- 某台車從右邊切進來
- 用一張車輛截圖反查影片裡相似的片段
技術路線
SentrySearch 支援兩條 backend:
第一種是 Gemini Embedding API。效果通常較好,安裝與硬體門檻較低,但會有 API 成本。README 估算,在預設 30 秒 chunk、5 秒 overlap 的設定下,用 Gemini index 1 小時影片約 2.84 美元。查詢本身只是文字 embedding,成本可忽略。
第二種是 local backend,用 Qwen3-VL-Embedding。優點是不用 API key、可以離線跑、隱私性較好;缺點是吃硬體。README 建議 Apple Silicon 24GB+ RAM 或 NVIDIA 18GB+ VRAM 跑 qwen8b;Apple Silicon 16GB 或較小機器可用 qwen2b;Intel Mac 或沒有 GPU 的機器不適合本地模式,建議走 Gemini API。
它使用 ChromaDB 存向量,支援 .mp4 與 .mov,並可遞迴掃描資料夾。安裝方式是 uv tool install,需 Python 3.11+;影片切割與剪輯依賴 ffmpeg。
重要功能
-
文字搜尋影片:輸入一句自然語言,回傳相似度最高的影片片段與時間區間,並自動輸出剪輯檔。
-
圖片搜尋影片:拿一張截圖當 query,找影片裡視覺上相似的片段。這對「我不知道該怎麼描述這台車/這個畫面」的場景很實用。
-
Tesla metadata overlay:對 Tesla dashcam,可在剪出的 clip 上疊加速度、時間、位置等資訊。限制是需要 Tesla firmware 2025.44.25 以上、HW3+,且 SEI metadata 只存在於行駛 footage,不是 parked / Sentry Mode。
-
可串 SentryBlur:SentrySearch 搜出片段後,SentryBlur 可以接著做臉、車牌或自然語言指定物件的模糊處理,形成 search-then-redact 工作流。
限制與踩坑
官方 README 也明確寫出幾個限制:
- still-frame detection 是 heuristic,靠 sampled frames 的 JPEG 檔案大小比較判斷,有可能誤跳過細微動作。
- 搜尋品質受 chunk boundary 影響,如果事件剛好跨在兩個片段中間,overlap 有幫助但不完美。
- Gemini Embedding 2 仍是 preview,API 行為與價格可能變動。
- 圖片搜尋找的是視覺相似,不保證是同一個物件。
我的判斷
這類工具真正有價值的地方,是把「時間軸式影片回放」改成「語意查詢式影片資料庫」。
它適合幾種場景:
- 行車糾紛:快速找切車、闖紅燈、靠近車輛等片段。
- 監視器回放:從大量監控畫面中找特定事件。
- 內容素材庫:用語意找 B-roll、活動畫面、人物動作。
- 企業影音知識庫:會議、課程、展示影片不再只能靠檔名與人工標籤。
對 BigIntTech 來說,這個方向可以放進「影音資料可檢索化」觀察清單。未來如果要做物業管理、保全勤務、車隊管理或活動素材整理,影片不應該只是備查檔案,而應該先被切片、嵌入、索引,變成可以問問題的資料。
原始 Threads:https://www.threads.com/@sliven0722/post/DYBDvLhigs3 GitHub: