OpenAI 发布新语音系统「Whisper 」，英文识别能力可接近人类水平

OpenAI Whisper 语音系统

2022/09/23 15:08

作者 | 黄楠

编辑 | 陈彩娴

9月21日，OpenAI 发布了一个名为「Whisper 」的神经网络，声称其在英语语音识别方面已接近人类水平的鲁棒性和准确性。

「Whisper 」式一个自动语音识别（ASR）系统，研究团队通过使用从网络上收集的68万个小时多语音和多任务监督数据，来对其进行训练。

训练过程中研究团队发现，使用如此庞大且多样化的数据集可以提高对口音、背景噪音和技术语言的鲁棒性。

此前有不同研究表明，虽然无监督预训练可以显著提高音频编码器的质量，但由于缺乏同等高质量的预训练解码器，以及特定于数据集中的微调协议，因此在一定程度上限制了模型的有效性和鲁棒性；而在部分有监督的方式预训练语音识别系统中，其表现会比单一源训练的模型呈现出更高的鲁棒性。

对此，在「Whisper 」中，OpenAI 在新数据集比现有高质量数据集总和大几倍的基础上，将弱监督语音识别的数量级扩展至68万小时；同时，研究团队还演示了在这种规模下，所训练模型在转移现有数据集的零射击表现，可消除任何特定于数据集微调的影响，以实现高质量结果。

图注：方法概述

在许多不同的语音处理任务中训练一个序列到序列的转换器模型，包括多语言语音识别、语音翻译、口头语言识别和语音活动检测；所有任务都表示为要由解码器预测的标记序列，允许单一模型取代传统语音处理管道的不同阶段；多任务训练格式使用一组特殊的标记，作为任务指定者或分类目标

Whisper 架构采用一种简单的端到端方法，通过编码器-解码器 Transformer 来实现：输入音频被分成30秒的块，转换成 log-Mel 频谱图后传递到编码器。解码器可预测相应的文本标题，并与特殊标记混合，由这些标记指导单个模型执行诸如语言识别、短语级时间戳、多语言语音转录和英语语音翻译等任务。