AI Tools
OpenAI Realtime 語音模型拆成三個 SKU:對話、即時翻譯、串流轉錄各自產品化
整理 OpenAI 新一批 Realtime 語音 API:gpt-realtime-2、gpt-realtime-translate、gpt-realtime-whisper。重點不是單純語音升級,而是語音互動被拆成可計量、可替換、可組合的 API 基礎設施。
2026年5月10日2 分鐘閱讀👁 5
OpenAI / Realtime Voice API
OpenAI 這次不是只升級語音,而是把語音 stack 拆成三個可組合的 API SKU
Threads 原文整理 OpenAI 推出三款語音模型:GPT-Realtime-2、GPT-Realtime-Translate、GPT-Realtime-Whisper。可保留下來的重點是:語音代理不再是單一「語音模式」,而是被拆成對話推理、即時翻譯、串流轉錄三層,產品可以按任務替換與計價。
gpt-realtime-2
定位為主力語音對話模型。原文提到 Big Bench Audio 從 81.4% 到 96.6%,多輪指令跟隨從 34.7% 到 48.5%,並強調更自然的停頓提示、工具呼叫透明化、128K 上下文與可調 reasoning effort。
gpt-realtime-translate
定位為即時語音翻譯。相關討論指出支援 70+ 輸入語言與 13 種輸出語言,適合跨境客服、國際教育、直播口譯與多語會議。
gpt-realtime-whisper
定位為串流語音轉文字,也就是邊說邊轉錄。官方模型頁已出現 gpt-realtime-whisper,相關討論提到價格約 $0.017/分鐘,適合會議記錄、課程字幕、客服錄音與語音搜尋。
真正的產品訊號:OpenAI 正在把語音能力水電化。對話、翻譯、轉錄可以分開計價、分開延展、分開替換;產品團隊不必把所有語音需求都塞進同一個模型,而可以依任務選不同模型。
| 模型 | 主要用途 | 產品場景 | 設計重點 |
|---|---|---|---|
| gpt-realtime-2 | 語音對話與 voice-to-action | 語音 Agent、客服、行程查詢、工具操作 | 低延遲、可打斷、多輪上下文、工具呼叫狀態透明 |
| gpt-realtime-translate | 即時口譯 | 跨國會議、直播、教育、旅遊客服 | 語言覆蓋、延遲、口吻保留、輸出語言限制 |
| gpt-realtime-whisper | 串流 STT | 字幕、會議記錄、客服質檢、語音搜尋 | 成本、準確度、標點、speaker diarization 後處理 |
如果做語音 Agent:先測 gpt-realtime-2 的中斷處理、工具呼叫提示與長上下文任務,而不是只聽聲音自然度。
如果做多語服務:翻譯模型應獨立評估輸入/輸出語言覆蓋,避免把翻譯任務硬塞進通用對話模型。
如果做記錄系統:串流 Whisper 的價值在「即時可用文字流」,後續仍需摘要、章節、speaker 分離與敏感資訊處理。