kodama-ja-streaming-small
英語のストリーミング音声認識モデル moonshine-streaming-small を日本語化した、日本語ストリーミング ASR モデルです。
概要
英語のストリーミング音声認識モデル moonshine-streaming-small(約 1.4 億パラメータ)を日本語化し、日本語ストリーミング ASR「kodama-ja-streaming-small」として Hugging Face で公開しました。配布形式は ONNX / ORT で、3 つのグラフ(エンコーダ、cross_kv_prefill、デコーダ)に分けています。ライセンスは Apache-2.0 です。
担当
ReazonSpeech v2 の全データ(約 35,000 時間)を 2 エポック使って日本語化の学習を行い、ONNX への変換と評価、公開までを担当しました。
技術的なポイント
オフライン RTF(CPU)は 0.19、最初の部分結果までは約 1.1 秒と記事に記録しています。詳しい評価は記事を参照してください。