Большинство пояснений по созданию видео с помощью искусственного интеллекта останавливаются на фразе «введите подсказку, получите видео», что верно точно так же, как «нажмите «компилировать», получите исполняемый файл» является верным и бесполезным, если вы пытаетесь понять, почему та или иная модель создания видео с помощью искусственного интеллекта ...
Большинство объяснений по созданию видео с помощью ИИ останавливаются на фразе «введите подсказку, получите видео», что верно так же, как «нажмите кнопку компиляции, получите исполняемый файл» — это действительно точно и бесполезно, если вы пытаетесь понять, почему одна модель создания видео с помощью ИИ ведет себя совершенно иначе, чем другая, или почему данные о стоимости и производительности для этого материала выглядят так, как они выглядят, когда вы действительно их измеряете.
Этот пост еще на один уровень углубляет тему создания видео с помощью искусственного интеллекта. Это технический анализ того, как на самом деле работает текущая архитектура генерации видео с помощью искусственного интеллекта, в сочетании с реальными данными, полученными в результате тестирования этих систем в реальных сценариях использования в производстве рекламы, которые большинство объяснительных материалов полностью пропускают.
Что на самом деле делает модель генерации видео с помощью искусственного интеллекта
На уровне архитектуры большинство современных моделей генерации видео с помощью ИИ представляют собой системы, основанные на диффузии, расширенные во временном измерении. Модель диффузии текста в изображение учится обращать шумовой процесс в одном кадре. Модель генерации видео должна выполнять тот же процесс шумоподавления, сохраняя при этом согласованность между десятками или сотнями последовательных кадров, что представляет собой значительно более сложную задачу оптимизации, и именно по этой причине генерация видео отстает.