ПОСЛЕЗАВТРА
В Amazon создали крупнейшую модель синтеза речи

Разработчики искусственного интеллекта из Amazon AGI (подразделение, занимающееся разработкой т.н. «сильного» ИИ) объявили о создании крупнейшей модели преобразования текста в речь (TTS), имеющей наибольшее число параметров и обученной на крупнейших наборах данных. Результаты их работы были предварительно опубликованы на портале arXiv.
Сообщается, что новая модель, получившая название BASE TTS («Большая адаптивная TTS-модель потокового синтеза с эмерджентными возможностями»), содержит 980 млн. параметров и была обучена на 100 тыс. часах записанной речи (в основном на английском языке). BASE TTS также оказалась знакома с некоторыми фразами и выражениями на других языках. Отличительной особенностью новой модели является ее эмерджентность, т.е. способность выходить на более высокий уровень интеллекта, не связанный с возможностями входящих в нее элементов. В ходе разработки выяснилось, что выход на более высокий уровень интеллекта произошел при использовании набора данных среднего размера, содержащего 150 млн. параметров. Помимо прочего создатели отмечают способность модели работать с составными существительными и пунктуацией, определять эмоциональный окрас текста и паралингвистику, а также задавать вопросы с правильным акцентом в предложении.
По словам разработчиков, BASE TTS не будет выпущена для публичного пользования из-за опасений неэтичного применения. Вместо этого новую модель задействуют в качестве обучающего приложения и для повышения качества систем синтеза речи в целом.