Каждый поставщик публикует данные о задержке, и ни один из них не измеряет одно и то же в одном и том же месте. Вместо повторения чисел, которые невозможно воспроизвести, на этой странице объясняется, что архитектурно устанавливает время до первого звука и дает вам...
Каждый поставщик публикует данные о задержке, и ни один из них не измеряет одно и то же в одном и том же месте. Вместо повторения чисел, которые невозможно воспроизвести, на этой странице объясняется, что архитектурно устанавливает время до первого звука, и предоставляется сценарий, который получает номер для вашего региона, вашего текста и вашей сети.
Время до первого звука — единственный показатель задержки.
Общее время синтеза практически не имеет значения, если вы ведете потоковую передачу, поскольку воспроизведение начинается, как только поступает первый фрагмент, а остальная часть генерируется, пока слушатель все еще слышит начало. Что имеет значение, так это задержка перед началом звука и гарантия того, что генерация опережает воспроизведение.
Второе условие имеет название: коэффициент реального времени, время генерации, деленное на продолжительность звука. Значение RTF, равное 0,3, означает, что для синтеза одной секунды речи требуется 300 мс, поэтому буфер заполняется в три раза быстрее, чем опустошается, и вы никогда не будете заикаться. Значение RTF выше 1,0 означает, что звук поступает медленнее, чем воспроизводится, и слушатель слышит паузы, независимо от того, насколько быстрым был первый фрагмент.
Что это устанавливает
Авторегрессия против нет. Нынешнее поколение выразительных TTS во многом представляет собой авторегрессионную модель на основе токенов нейронных аудиокодеков.