100毫秒延遲的即時串流轉錄

微軟MAI部門在10月1日推出MAI-Transcribe-2-Streaming,這是其首款自研即時串流語音轉錄模型。它支援60種語言並具備持續自動語言偵測功能,收到音訊後約100毫秒就能開始輸出初步轉錄內容。與傳統批次處理不同,此模型會在音訊持續傳入時同步產生可修正的部分轉錄,再逐步確認最終文字。這種機制讓語音代理人能在使用者尚未說完時就開始推理或呼叫工具,大幅縮短互動等待時間。對於即時字幕、語音輸入等應用而言,延遲表現與準確度的平衡是核心競爭力,微軟此次將自研能力延伸至即時串流場景,直接對標OpenAI、Google等業者的現有方案。

準確度與延遲的雙料冠軍

根據Artificial Analysis的即時串流語音辨識評測,MAI-Transcribe-2-Streaming在最終轉錄與部分轉錄結果的準確度均排名第一。在準確度與延遲的綜合評估中,該模型也位居前段,顯示其能兼顧高準確度與低延遲。這意味著開發者不必在「快」與「準」之間做取捨,即可部署於高要求的即時語音應用。微軟先前已推出MAI-Transcribe-2語音轉錄模型,此次升級版將即時串流能力納入自研體系,強化其在語音代理人生態系中的技術主權。

語音合成與計費細節

同天更新的MAI-Voice-2.1與MAI-Voice-2.1-Flash皆支援23種語言與26個地區,可讓同一組合成聲線跨語言輸出,並在不同語言間維持一致的說話者特徵。兩款模型也支援以數秒參考音訊複製特定聲音。MAI-Voice-2.1著重語音品質與自然度,適合內容製作與長篇語音生成;MAI-Voice-2.1-Flash則針對語音助理、客服等低延遲即時應用最佳化,速度更快且價格較低。計費方面,MAI-Transcribe-2-Streaming今年底前優惠價為每小時音訊0.54美元;MAI-Voice-2.1與Flash依輸入文字量計費,每100萬個字元分別為22美元與15美元。技術迭代的速度,正在重新定義即時語音互動的門檻與邊界。