J-Moshi-ext の追加学習
日本語 full-duplex 対話モデル J-Moshi-ext に、特定の声と口調を追加学習しました。
概要
日本語の full-duplex 対話モデル J-Moshi-ext(7.5B)に、声と口調を追加学習する実験です。まず TTS を追加学習して合成対話データを作り、その対話データで J-Moshi-ext を学習しました。声の追加学習の後、口調(お嬢様口調)を追加する 2 段階目の学習も行いました。
担当
合成対話データの生成、DeepSpeed ZeRO-3 を使った学習、評価、結果の記事化までを担当しました。
技術的なポイント
声の追加学習では、声質は部分的に近づいた一方で発音の明瞭さが落ちたことを、記事に正直に記録しています。


