Irodori-TTS v4-Largeの実装準備がmainに追加
公式Irodori-TTSのmainにforthcoming v4-Largeへの明示的な言及と学習設定が追加された。v4-Large設定はT5Gemma 2 1B-1B系の事前学習text/caption backboneを使い、DiTをmodel_dim 2048・24 layers・32 heads、speaker encoderを1280次元・14 layers・20 headsとする。body学習とduration predictor学習の設定が分離されている。公開weightsや品質ベンチマークはまだない。
所感
v4.1-Smallの改良だけでなく、明確に大型化した次世代Irodoriが進行している。音質・表現力・Voice Design追従性が上がる可能性がある一方、実際のモデルサイズ、配布時期、Apple Silicon/MLX対応、推論速度は未確定なので現時点では追跡対象。