話し終わり判定モデルの日本語化(Easy Turn / FastTurn)
発話の終わりを 4 状態で判定するターン検出モデル Easy Turn と FastTurn の日本語モデルを作成しました。
概要
音声対話で「話し終わったか」を判定するターン検出モデルの日本語版を 2 種類作りました。どちらも発話を Complete(完了)、Incomplete(継続)、Backchannel(相づち)、Wait(待って)の 4 状態に分類します。Easy Turn の日本語モデルは Whisper-Medium のエンコーダ、アダプタ、Qwen2.5-0.5B-Instruct の構成で、FastTurn の日本語モデルは nemotron-3.5-asr-streaming-0.6b のエンコーダと Qwen3-0.6B の構成です。
担当
学習データの用意(ReazonSpeech、J-CHAT、TalkBank に加え、Irodori-TTS で作った合成データ)、学習、評価、公開までを担当しました。
技術的なポイント
Easy Turn 日本語モデルは RTX 4090 で遅延 P50 が 111.6ms、FastTurn 日本語モデルはエンコーダと判定器を合わせて P95 が 110.2ms と記事に記録しています。Easy Turn 日本語モデルのライセンスは CC BY-NC-SA 4.0 です。



