yousan

← Works 一覧へ

J-Moshi-ext の追加学習

日本語 full-duplex 対話モデル J-Moshi-ext に、特定の声と口調を追加学習しました。

時期
技術
Full-duplex dialogue, J-Moshi-ext, DeepSpeed, Fine-tuning

概要

日本語の full-duplex 対話モデル J-Moshi-ext(7.5B)に、声と口調を追加学習する実験です。まず TTS を追加学習して合成対話データを作り、その対話データで J-Moshi-ext を学習しました。声の追加学習の後、口調(お嬢様口調)を追加する 2 段階目の学習も行いました。

担当

合成対話データの生成、DeepSpeed ZeRO-3 を使った学習、評価、結果の記事化までを担当しました。

技術的なポイント

声の追加学習では、声質は部分的に近づいた一方で発音の明瞭さが落ちたことを、記事に正直に記録しています。

リンク