В то время как модели искусственного интеллекта, преобразующие текст в видео, такие как Sora от OpenAI, быстро трансформируются на наших глазах, они изо всех сил пытались создавать метаморфические видеоролики. Имитировать прорастание дерева или распускание цветка для систем искусственного интеллекта сложнее, чем создавать видеоролики других типов, поскольку это требует знания физического мира и может сильно варьироваться.
Но теперь эти модели сделали эволюционный шаг.
Ученые-компьютерщики из Университета Рочестера, Пекинского университета, Калифорнийского университета в Санта-Крузе и Национального университета Сингапура разработали новую модель преобразования текста в видео с помощью искусственного интеллекта, которая извлекает знания по физике реального мира из замедленных видеороликов. Команда описывает свою модель MagicTime в статье, опубликованной в журнале IEEE Transactions по анализу шаблонов и машинному интеллекту.
"Искусственный интеллект был разработан для того, чтобы попытаться понять реальный мир и смоделировать происходящие действия и события", - говорит Джинфа Хуан, аспирантка под руководством профессора Джибо Ло с факультета компьютерных наук Рочестерского университета, оба из которых входят в число авторов статьи. "MagicTime - это шаг к искусственному интеллекту, который может лучше имитировать физические, химические, биологические или социальные свойства окружающего нас мира".
Предыдущие модели создавали видеоролики, которые обычно имели ограниченное движение и плохие вариации. Чтобы обучить модели искусственного интеллекта более эффективно имитировать метаморфические процессы, исследователи разработали высококачественный набор данных из более чем 2000 покадровых видеороликов с подробными подписями.
В настоящее время версия MagicTime для U-Net с открытым исходным кодом генерирует двухсекундные клипы размером 512 на 512 пикселей (со скоростью 8 кадров в секунду), а сопутствующая архитектура диффузионного трансформатора расширяет это до десятисекундных клипов. Модель может быть использована для моделирования не только биологических метаморфоз, но и строящихся зданий или выпечки хлеба в духовке.
Но в то время как созданные видеоролики визуально интересны, а с демонстрацией может быть интересно играть, исследователи рассматривают это как важный шаг на пути к более сложным моделям, которые могли бы предоставить ученым важные инструменты.
"Мы надеемся, что когда-нибудь, например, биологи смогут использовать генеративное видео для ускорения предварительного изучения идей", - говорит Хуан. "В то время как физические эксперименты остаются необходимыми для окончательной проверки, точное моделирование может сократить циклы итераций и уменьшить количество необходимых реальных испытаний".
Комментарии