モジラがオープンソースの音声認識モデルとデータセットをリリース

Chris Duckett （CNET News）翻訳校正：湯本牧子吉武稔夫（ガリレオ）

2017-12-01 12:22

　Mozillaは、音声認識プロジェクト「Common Voice」で、2万人から収集した40万件近い録音を含むコレクションをリリースした。一般に公開されている音声データセットとしては2番目に大規模だという。

　コレクションの音声サンプルは、MozillaのCommon Voiceプロジェクトから取得したものだ。Common Voiceでは、「iOS」アプリまたはウェブサイトを通じてユーザーが自分の音声を提供できる。このプロジェクトの狙いは、大規模な公開データセットを作成することで、より優れた音声対応アプリケーションを実現することだ。

マイクロソフトの音声認識システム、「人と同等」レベルに到達

　Mozillaで新興技術担当シニアバイスプレジデントを務めるSean White氏は、ブログ記事で「商用のサービスがほとんどない理由の1つは、データが不足しているためだ」と述べている。

　「新興企業や研究者、あるいは音声対応技術を開発したいと考えている人なら誰でも、機械学習アルゴリズムの訓練に利用できる高品質の録音データを必要としている。そうした人々が現時点で利用できるのは、ごく限られたデータセットだけだ」（White氏）

　現在、コレクションは英語に対応したものとなっているが、2018年前半に他の言語にも拡大する計画だ。

　Mozillaはさらに、中国のインターネット大手Baidu（バイドゥ）の取り組みをベースにしたオープンソースの音声認識モデル「Project DeepSpeech」をリリースした。音声データセット「LibriSpeech」を用いた際の誤認識率は6.5％で、DeepSpeechの認識精度は人間のレベルに近づいているという。