微軟發布三款 MAI 模型:Transcribe-1、Voice-1、Image-2 全面切入語音與生成式 AI
微軟發布三款 MAI 模型:Transcribe-1、Voice-1、Image-2 全面切入語音與生成式 AI
title: 微軟發布三款 MAI 模型:Transcribe-1、Voice-1、Image-2 全面切入語音與生成式 AI date: 2026-04-07 source: https://www.koc.com.tw/archives/637780 category: articles tags:
- 微軟
- MAI
- 語音辨識
- TTS
- 圖像生成
- Microsoft Foundry
- OpenAI created: 2026-04-07 updated: 2026-04-07
微軟發布三款 MAI 模型:Transcribe-1、Voice-1、Image-2 全面切入語音與生成式 AI
概要
微軟一口氣發布三款自研 MAI 模型,包含語音轉文字的 MAI-Transcribe-1、文字轉語音的 MAI-Voice-1,以及圖像生成的 MAI-Image-2,並同步開放給開發者透過 Microsoft Foundry 使用。這不只是一次模型更新,更是微軟在 2025 年重談與 OpenAI 合約後,開始更明確推進自研模型與平台能力的訊號。
- 原文:https://www.koc.com.tw/archives/637780
- 引述資料來源:https://microsoft.ai/news/today-were-announcing-3-new-world-class-mai-models-available-in-foundry/
- 相關背景:微軟在 2025 年與 OpenAI 重談合作條款後,獲得更大空間發展自有前沿模型
三個模型的重點
1. MAI-Transcribe-1:主打多語語音轉文字
- 文中引用數據稱,在 FLEURS 多語言基準中,前 25 大語言平均 WER 3.9%
- 文中聲稱整體表現勝過 Whisper-large-v3、Gemini 3.1 Flash、ElevenLabs Scribe v2、GPT-Transcribe 等模型的多數對照項目
- 支援 MP3、WAV、FLAC 等格式,最高 200MB
- 定價約 每小時語音 0.36 美元
- 說話者分離、上下文偏置、串流功能為即將推出
2. MAI-Voice-1:主打高速 TTS
- 官方描述可在 1 秒內生成 60 秒語音
- 強調長段落語音生成時仍能維持說話者音色與特徵一致
- 可透過幾秒語音樣本建立自訂 voice profile
- 已被用於 Copilot Audio Expressions
- 定價約 每 100 萬字元 22 美元
3. MAI-Image-2:主打商用圖像生成
- 已在 Arena.ai 圖像生成排行榜進入前三
- 微軟表示相較前代,在相同品質下生成速度提升至少 2 倍
- 可處理自然光影、膚色、材質、圖表與圖片中文字
- 已支撐 Copilot 圖像生成能力
- 定價約:文字輸入 每 100 萬 token 5 美元;圖像生成 每 100 萬 token 33 美元