Common Voice

Common Voice（コモンボイス）は、音声認識ソフトウェアの開発のための無料データベース作成を目的にして、Mozillaによって立ち上げられたクラウドソーシングプロジェクトである。このプロジェクトは、ボランティアによって支えられている。ボランティアは、自らのマイクを用いてサンプル文を読み上げた音声を録音し、また他のユーザーが録音した音声の正確性の検証も行う。録音された音声は、パブリックドメインライセンスCC0の下で利用可能な音声データベースに集められる。このライセンスによって、開発者は何らの制限や使用料等なしに、データベースを音声認識アプリケーションに利用することができる。非公式のAndroidアプリが利用可能である。

目的

Common Voiceは、多様性に富む音声サンプルを提供することを目的としている。Mozillaのカタリナ・ボルヒェルト（Katharina Borchert）によると、既存のプロジェクトの多くは、公共のラジオから作成されたデータセットを用いていた。ラジオの出演者には男性や標準的な発音の話者が多いため、女性の声であったり、特徴的な発音や訛りを持つ人々の声の標本数が少ない偏ったデータセットになりがちであった。