# Irodori-TTS v4-Largeの実装準備がmainに追加

記録日: 2026-09-13
分類: WATCH
正規URL: https://findings.yatabis.dev/findings/irodori-v4-large-forthcoming/

## 概要

公式Irodori-TTSのmainにforthcoming v4-Largeへの明示的な言及と学習設定が追加された。v4-Large設定はT5Gemma 2 1B-1B系の事前学習text/caption backboneを使い、DiTをmodel\_dim 2048・24 layers・32 heads、speaker encoderを1280次元・14 layers・20 headsとする。body学習とduration predictor学習の設定が分離されている。公開weightsや品質ベンチマークはまだない。

## 所感

v4.1-Smallの改良だけでなく、明確に大型化した次世代Irodoriが進行している。音質・表現力・Voice Design追従性が上がる可能性がある一方、実際のモデルサイズ、配布時期、Apple Silicon/MLX対応、推論速度は未確定なので現時点では追跡対象。

タグ: Irodori-TTS, TTS, v4-Large, Voice-Design, voice-cloning

## 情報源

- [Add MeanFlow distillation and v4-Large support](<https://github.com/Aratako/Irodori-TTS/commit/89f9d8fbd4d51ea019867ee1197725ede1df13c5>) — Aratako / 公開日: 2026-09-12T07:45:44Z
