先看证据
微软发布的不是一个更快的录音转写器
Microsoft AI于2026年10月1日发布了MAI-Transcribe-2-Streaming,这是该公司的首款流式语音转文字模型,也是9月发布的批处理模型MAI-Transcribe-2的实时版本。它面向的不是用户说完后再上传音频的离线转写,而是语音代理、实时字幕和听写这类对等待时间敏感的场景。模型支持60种语言,并能持续自动判断语言,而不是只在会话开始时做一次语言选择。
这次发布值得技术负责人重新审视的地方,在于转写结果不再只是对话结束后的记录。模型可以在说话仍在继续时输出partial,随后随着更多上下文到达不断修订,最后提交稳定的final。只要中间结果足够可靠,代理就有机会把“听见一句话”与“开始采取行动”放在同一个时间窗口里。
partial为什么会改变语音代理的控制回路
传统语音代理通常要等到语音活动结束、转写完成,才把文本交给大模型或工具调用层。这种流程容易形成一条串行链路:先等待用户说完,再识别,再推理,最后执行。MAI-Transcribe-2-Streaming的设计则把链路拆开,代理可以先根据partial开始准备推理,必要时提前调用工具,再用后续文本修正判断。
这里的关键不是partial出现得早,而是它是否会频繁推翻前面的理解。材料给出的结果是,首个partial的词错误率与final同为2.5%,首个partial在停语后0.12秒返回,final则为0.13秒。这个结果意味着模型在评测条件下几乎没有要求代理在“速度”和“等完整上下文”之间二选一,但它并不意味着所有业务都可以无条件依据每一个中间词立即执行不可逆操作。
榜首成绩很强,但数字的计时边界同样重要
Artificial Analysis的AA-WER Streaming榜单把MAI-Transcribe-2-Streaming列为38个模型中的第1名。评测使用约8小时音频,构成为AA-AgentTalk占50%、VoxPopuli占25%、Earnings22占25%。在这一测试中,final是2.5% WER、停语后0.13秒,first partial也是2.5% WER、停语后0.12秒。
对比数据说明它处在准确率和速度的有效前沿,但不是所有维度都占优。Grok Voice Transcribe 2.0的结果为2.7% WER和0.49秒,Muse Voice Transcribe为3.1%和0.16秒,Cartesia Ink-2则以0.07秒返回final,却有4.0% WER。更需要保留判断的是,AA的延迟从SileroVAD检测到的停语时刻开始计算,因此这些数字不能直接当作从麦克风采集、网络传输、服务排队到应用首字显示的完整端到端延迟。
微软卖的是接入路径,而不只是模型分数
MAI-Transcribe-2-Streaming提供两条主要接入路径。已经采用OpenAI Realtime兼容WebSocket的应用可以使用Realtime API,另一条是由Azure Speech SDK处理连接管理、重试和音频流传输。两条路径都返回中间结果和最终结果,模型还可通过MAI Playground、Vercel和Azure Voice Live使用,LiveKit支持则被列为即将推出。
这套分发方式解释了为什么微软没有把价格压到最低。流式转写的引导价为每小时0.54美元,折算为每1000分钟9美元,明显高于材料列出的xAI每小时0.20美元和Meta每小时0.18美元,也大致接近Google的估算价格。批处理版MAI-Transcribe-2每小时只需0.10美元,说明这不是单纯的模型升级,而是微软为持续连接、实时返回和开发者接入支付并定价的一套服务能力。
生产决策要看长连接,而不是只看榜单
对于客服、会议助手和语音控制,最直接的应用变化是把“用户说完再处理”改成“边听边准备”。连续自动语言检测也可能减少跨语言会话中的配置工作,微软还在同一天发布了MAI-Voice-2.1和MAI-Voice-2.1-Flash,后者可以与转写模型组成完整的语音输入输出回路。可是,代理系统真正要验证的并不是一次短音频上的榜单排名,而是长连接中partial如何修订、语言切换是否稳定,以及工具调用如何处理不确定文本。
当前版本仍处于公开预览,没有SLA,也没有开放权重。材料没有说明流式说话人分离能力,60种语言的准确率是否均衡也尚未由给定数据证明,微软关于“出字速度比最近竞争对手快2倍”的说法同样属于其内部测试结论。更稳妥的工程判断是:先把partial用于可撤销的准备动作,把final或业务侧确认作为不可逆操作的门槛,并在真实语料上分别记录首字延迟、修订率、语言切换表现和每小时成本,再决定是否替换现有识别服务。