158 6721 8818

0574-27676908

新闻动态

新闻动态

Meta 发布首个实时音频感知 AI 模型,支持 20 余人分轨转写

作者:宁波海曙光信电子科技有限公司 浏览: 发表时间:2026-09-02 14:22:10

Meta 发布首个实时音频感知 AI 模型,支持 20 余人分轨转写

作者:IT之家 

 9 月 2 日消息,科技媒体 9to5Mac 昨日(9 月 1 日)发布博文,报道称 Meta 公司推出 Muse Voice Transcribe,这是其首个实时音频感知模型。

开发者可通过 Meta Model API 调用该能力,定价为每 1000 分钟音频 3 美元(现汇率约合 20.2 元人民币),等同每小时 0.18 美元(现汇率约合 1.2 元人民币)

该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。

注:“流式”就是边说边转写,模型不必等整段音频说完才出结果,而是会一小段一小段持续输出文字,所以延迟更低,适合实时听写、会议记录、通话字幕。

Muse Voice Transcribe 可在包含 20 余名说话者的录音中分离不同发言者,还能识别说话是否结束,从而自动确定一段输入的边界。

模型训练覆盖 70 余种语言,其中 25 种语言在发布时完成验证。该模型支持长度超过 1 小时的音频,也支持句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置,提高特定语言、术语或场景下的识别效果。

在技术方面,Meta 为兼顾实时响应和识别准确度,引入名为自适应延迟(adaptive delay)的动态决策机制。系统不会为所有词语采用固定的速度与准确度取舍,而是针对每个词判断需要额外接收多少音频后再输出识别结果。

对于较容易识别的语音,系统可更快提交转写结果。对于发音不清、术语较多或语境复杂的词语,系统会调用更多前后文音频信息。这种机制旨在兼顾。

Meta 称,截至 2026 年 9 月 1 日,Muse Voice Transcribe 位列 Artificial Analysis 流式语音转文本排行榜第 1 名。



   


Meta 发布首个实时音频感知 AI 模型,支持 20 余人分轨转写
Meta 推出首款实时音频感知模型 Muse Voice Transcribe,支持流式实时转写,可区分 20 余人说话人,覆盖 70 余种语言,25 种已完成验证。采用自适应延迟机制平衡速度与识别精度,支持长音频与多语言切换,可通过 Model API 调用,该模型当前位居流式语音转文本排行榜首位。
长按图片保存/分享
0

产品中心

产品中心

快速导航

联系我们

手机:158 6721 8818(微信)

电话:0574-27676908

地址:海曙区东渡路29号8楼D01

版权所有© 2025 宁波海曙光信电子科技有限公司   浙ICP备14008261号 

版权所有© 2025 宁波海曙光信电子科技有限公司   浙ICP备14008261号 

客服中心
手机号
158 6721 8818(微信)
服务热线
0574-27676908
上班时间
周一到周五
E-mail地址
9090683@qq.com
添加微信好友,详细了解产品
使用企业微信
“扫一扫”加入群聊
复制成功!
添加微信好友,详细了解产品
我知道了