最新!阿里云升级语音实时识别大模型Fun-ASR-Realtime。
该模型为流式识别模型,识别准确率接近离线模型,首字延迟在百毫秒级别,支持16种方言和30种语言。在7月2日结束的影视飓风“重返荒岛”100小时直播中,实时字幕由Fun-ASR-Realtime全程提供,共识别出六万多条字幕、132万字。同期,离线模型Fun-ASR-Flash也已上线,两款模型均可在阿里云百炼使用。
首字百毫秒响应,长句尾字延迟低
语音识别模型分为离线和实时两类。离线模型可一次性处理录好的音频,准确度更高;实时模型边录边识,需兼顾准确率和速度,适用于直播字幕、会议实时转写、客服通话等场景。
Fun-ASR-Realtime首字时延控制在百毫秒级别,长句尾字输出延迟也较低。以“重返荒岛”100小时直播为例,多人两岛互动、说话人频繁切换,观众可即时看到嘉宾发言字幕。
具备上下文理解能力,可实时纠错
Fun-ASR-Realtime面向泛Context(包含历史对话上下文和实时热词)进行了专项强化。例如直播中嘉宾说出的“夜鹭”最初被误识为“叶鹿”,模型通过上下文“观鸟的朋友应该知道”后立即纠正。
● Fun-ASR-Realtime可识别16种方言和30种语言。在八大方言区16种方言识别测评中,平均字符准确率为88.62%。其中上海话准确率92.41%,苏州话89.21%,温州话82.74%。模型还针对泰语等东南亚多语言场景进行了专项优化,识别准确率提升约20%。
16种方言识别测试结果(CER为字符错误率,1-CER为字符准确率)
● 在5类工业中文和英文场景测评中,覆盖复杂背景、远场嘈杂及带口音场景,Fun-ASR-Realtime平均字符准确率分别为88.42%和91.58%。
工业场景语音识别测评结果
离线模型Fun-ASR-Flash近期也已上线。在评测平台Artificial Analysis上,Fun-ASR-Flash(榜单名为"Fun-realtime-ASR-preview")错字率为1.7%,位列全球第一。