NVIDIA LocateAnything:VLM 定位從逐 token 生成改成平行出框
整理 NVIDIA LocateAnything 與 Parallel Box Decoding:它不是單純下一代 YOLO,而是把視覺語言定位中的 bounding box / point 當成原子單位平行預測,改善 VLM grounding 的速度與幾何一致性。
多數 VLM 把 2D 框框座標序列化成文字 token,例如 x1、y1、x2、y2 一個個生成。這既慢,也容易破壞框框幾何結構。LocateAnything 改成一次預測完整 box / point。
它不是單純「下一代 YOLO」。YOLO 是高速 closed/open-set detector 路線;LocateAnything 是 vision-language grounding,重點在自然語言描述、GUI 元素、文件版面、OCR 文字區域與 point-based localization。
它代表 multimodal agent 的感知層正在變快:如果模型能更快、更準地把「畫面中的那個按鈕/那段文字/那個紅帽子的人」定位出來,GUI agent、機器人、文件解析、資料標註都會更可用。
核心技術:Parallel Box Decoding(PBD)
傳統 VLM grounding 常見做法,是把 bounding box 寫成一串 token,再由語言模型逐 token 生成。問題在於:框框本質上是幾何結構,四個座標彼此相關;但 token-by-token decoding 會把它拆成獨立序列,造成兩個瓶頸:
座標必須依序產生,前一個 token 沒出來,下一個 token 不能開始。當圖片裡有很多目標,延遲會累積。
x1、y1、x2、y2 被拆開生成,模型可能產生格式不規則或幾何不一致的座標。PBD 把一個框或點視為 box-aligned atomic unit,整組一起出。
LocateAnything 的做法是:輸入圖片與自然語言 query,由 vision encoder 保留高解析 spatial detail,再由 Qwen2.5 decoder 系列架構生成 box-aligned block-level predictions。Fast Mode 使用 MTP 平行預測;Slow Mode 使用 NTP / autoregressive 解碼;Hybrid Mode 預設先快,遇到格式異常或空間歧義再退回慢速重解碼。
官方數字與條件
| 項目 | 官方來源整理 | 解讀 |
|---|---|---|
| 模型 | LocateAnything-3B,base model 包含 Qwen2.5-3B-Instruct 與 MoonViT-SO-400M |