А как это будет стыковаться с развитием модели Декодера ? Стыкуется так: --декодер - это как струны и смычок скрипки - которые генерируют звуки - декодер генерирует из слов чувства, образы, мысли --другие компоненты модели текста - это как пальца зажимающие лады/струны - более тонко оранжируют чувства, образы, мысли
Теперь тренировки этих моделей будут совмещены ? Модель декодера по-прежнему необходимо отрабатывать. Модель текста необходимо разрабатывать, включая и софт.