Orkas Orkas
Главная Блог Исследования
Исследования

Vidu S2 против PixVerse R2: два пути к видео в реальном времени

Обе модели генерируют видео, пока вы смотрите, и принимают новые инструкции прямо по ходу. Если читать статью о S2 и отчёт о R2 параллельно, они сходятся в каркасе, расходятся в пяти решениях — обучение, дрейф, память, скорость и управление — и раскрывают очень разный объём информации.

Offline video generation denoises every frame of a clip together; real-time models such as Vidu S2 and PixVerse R2 generate block by block, play each block as soon as it is ready, and apply new input to the next block
Офлайн-модели очищают от шума весь ролик сразу; модели реального времени, такие как Vidu S2 и PixVerse R2, генерируют видео поблочно и воспроизводят каждый блок, как только он готов. Схема Orkas.

В этом месяце с разницей в неделю вышли две модели видео в реальном времени. Vidu S2 от ShengShu заработала 15 сентября, а PixVerse анонсировала PixVerse R2 22 сентября. S2 создана для цифровых персонажей в прямом эфире и для смены стиля видеопотока прямо во время воспроизведения. R2 называет себя моделью мира в реальном времени: по сцене можно двигаться клавишами WASD, а текст, референсы и звук меняют то, что произойдёт дальше.

Обе команды опубликовали, как они это сделали: S2 — в статье на arXiv, R2 — в техническом отчёте на сайте PixVerse. Мы прочитали их параллельно. Они сходятся в каркасе, расходятся в пяти проектных решениях и раскрывают очень разный объём информации. В этой статье разобраны все три пункта, но победителя мы сознательно не называем: эти модели ни разу не сравнивали в одном и том же тесте.

Если вы делаете видео Реальное время нужно для живых сценариев. Готовому видео по-прежнему нужен рабочий процесс. Агент VideoStudio в Orkas планирует монтаж, генерирует кадры и собирает их вместе — с видеомоделями, которые предоставляет Orkas, или с вашим собственным API-ключом.
Скачать Orkas — бесплатно

Что меняет реальное время

Большинство видеомоделей работают офлайн. Все кадры ролика очищаются от шума вместе, за десятки шагов, и ничего не видно, пока не готов весь ролик. Всё, что вам нужно, должно быть в промпте до начала генерации.

Модель реального времени переворачивает эту схему. Она делит видео на блоки — несколько кадров плюс соответствующий отрезок звука — и генерирует их по порядку. Каждый блок получает лишь несколько шагов шумоподавления и воспроизводится, как только готов. Блок видит то, что было до него, но никогда не видит того, что будет после; именно это и означает поблочная причинность. Новая инструкция попадает в следующий блок.

Такая схема создаёт три проблемы, и почти каждое решение ниже отвечает на одну из них:

  • Ошибки накапливаются. Каждый блок опирается на блоки, которые сгенерировала сама модель, поэтому маленькая ошибка передаётся всему, что идёт следом.
  • История должна быть ограниченной. Поток может идти бесконечно; если хранить все прошлые блоки, каждый новый будет обходиться дороже.
  • Бюджет времени беспощаден. При 25 кадрах в секунду на кадр приходится 40 миллисекунд.

S2 и R2 приходят к одному каркасу: поблочно-причинной авторегрессионной диффузионной модели, которая генерирует видео и звук вместе. Различия — в том, как её обучают, удерживают в стабильном состоянии, снабжают памятью, ускоряют и дают людям ею управлять.

Две системы

Vidu S2 (ShengShu Technology совместно с Университетом Цинхуа) — это две модели. S2-Avatar — цифровой персонаж в прямом эфире в 720p при 25–42 FPS; у S1 было 540p. Посреди эфира ему можно дать новое референсное изображение — чашку, куртку, пляж, — и персонаж берёт предмет, надевает вещь или переходит в новую сцену; он умеет и танцевать. S2-Editing в реальном времени меняет стиль входящего видеопотока — более 50 стилей, виртуальная примерка, замена человека и фона, — сохраняя исходное движение. В статье также исследуется стереовывод для VR-гарнитур.

PixVerse R2 — одна модель, рассчитанная на интерактивные миры. Во время работы в неё могут поступать четыре вида ввода — текст, мультимодальные референсы, звук и действия вроде WASD, — и каждый обновляет состояние мира, а не только текущий кадр. Игровой движок PixVerse уже работает на R2; публичная демонстрация сосредоточена на перемещении и промптах.

Решение 1: как обучается модель

Модели реального времени не обучают с нуля. Обычно отправная точка — сильная офлайн-генеративная модель, которую затем переделывают, чтобы она работала причинно и за несколько шагов. Здесь отчёты расходятся заметнее всего.

S2 устроена как эстафета. Сначала предобучается двунаправленная аудиовидеомодель, затем её дообучают с Diffusion-DPO, улучшая точность, выразительность, движение и синхронизацию звука с изображением. Внимание переводится в поблочно-причинный режим и обучается на смеси чистой и зашумлённой истории (решение 2). Затем Self-Replay Forcing дистиллирует модель до нескольких шагов, обучая её на собственных выходах, а финальный этап оптимизации предпочтений для потоковой генерации (Streaming NFT) настраивает причинную модель. Аватар и редактирование обучаются как отдельные модели.

R2 сохраняет единую основу. Omni Causal AR — причинная модель, которую непрерывно предобучают на коротких клипах, длинных видео, мультимодальных данных и траекториях взаимодействия. Затем Real-Time Acceleration дистиллирует эту же модель для работы в реальном времени: ученик инициализируется из неё, а учитель строится на ней. Формулировка отчёта — «ускорять, а не переучивать».

Vidu S2PixVerse R2
Отправная точкаДвунаправленная модель, дообученная с Diffusion-DPOНепрерывно предобучаемая причинная модель
Путь к реальному времениПоблочно-причинная адаптация → Self-Replay Forcing → оптимизация предпочтений для потокаПрямая дистилляция той же модели
МоделиОтдельные модели для аватара и редактированияОдна модель для всех типов ввода

В отчёте R2 распространённый подход изображён как пятиэтапная эстафета, и утверждается, что при каждой передаче теряется часть возможностей. Если читать прямо, конвейер S2 имеет именно такую многоэтапную форму, а главное улучшение приходится на последний этап. Ни одна из команд не опубликовала эксперимент, сравнивающий два пути, поэтому вопрос, какой из них лучше масштабируется, остаётся открытым.

Решение 2: как не дать потоку «уплыть»

Дрейф — характерный сбой потокового видео: цвет постепенно смещается, лицо медленно превращается в чужое, и в конце концов кадр разваливается. Причина в том, что при обучении модель видит чистую историю, а при инференсе — только собственный несовершенный выход.

Обе команды начинают с одного и того же решения. Они смешивают Teacher Forcing, при котором модель опирается на чистую реальную историю и сохраняет качество, и Diffusion Forcing, при котором история зашумлена до случайного уровня. Шум стирает мелкие детали, но сохраняет композицию и движение, поэтому модель учится опираться на структуру, а не доверять каждому пикселю прошлого.

Но зашумлённая реальная история — всё же не то же самое, что собственные ошибки модели, поэтому каждая команда добавляет второй слой.

S2: Self-Replay Forcing. Сначала модель генерирует длинный отрезок точно так же, как при инференсе, не сохраняя градиенты. Затем окно этой траектории заново зашумляется поблочно и прогоняется повторно за один причинный проход с градиентами; обучение идёт с функцией потерь дистилляции DMD и перцептивной функцией потерь. Поскольку повторно прогоняемые блоки находятся в одном вычислительном графе, градиенты проходят через границы блоков — модель узнаёт, как один блок влияет на следующий, — без обратного распространения через исходную генерацию.

R2: Error Bank. Типичные состояния сбоя, возникшие при генерации, сохраняются и воспроизводятся при обучении вместе с обычной историей, чтобы модель научилась восстанавливаться, когда отклонение уже попало в мир. Во внутренней поэтапной оценке PixVerse метрика долгосрочного дрейфа яркости снизилась с 0,201 до 0,129, то есть на 35,8%; улучшились 20 из 29 длинных последовательностей, а паразитное движение уменьшилось во всех пяти образцах без движения.

Эти подходы не конкурируют, а дополняют друг друга. Self-Replay Forcing обучается на том, в чём ошибается текущая модель; Error Bank раз за разом отрабатывает сбои, которые стоит запомнить.

Решение 3: ограниченная память

Обе модели навсегда сохраняют несколько начальных блоков как якорь (sink), держат скользящее окно из недавних блоков, а остальное отбрасывают, поэтому стоимость нового блока не растёт с длиной потока. Обе также удерживают позиционные координаты в диапазоне, который встречался при обучении, — в S1 это называется перепозиционированием RoPE, в R2 — относительным временным RoPE, — так что длинная сессия никогда не выводит позиции за пределы распределения.

S2 опирается на TwinCache из S1: каждый прошлый блок кэшируется дважды — в зашумлённом и в чистом виде. Промежуточные шаги шумоподавления читают зашумлённую копию, которая передаёт общее движение и работает как фильтр нижних частот против накопления артефактов; последний шаг читает чистую копию и восстанавливает детали. S2 распределяет это по двум своим этапам: основная сеть (backbone) читает сильно зашумлённый кэш, а Refiner — слабо зашумлённый кэш высокого разрешения.

R2 разделяет память по временным масштабам: Sink Memory — для идентичности, окружения, стиля и правил мира; Rolling History — для недавнего движения, позы и камеры; а Object KV Cache сжимает состояние объектов, которое ещё понадобится позже.

Это разделение отражает сами продукты. Цифровой персонаж должен оставаться тем же человеком. Мир же должен ещё и помнить, что в нём происходило, — предмет, который вы положили, выбор, который вы сделали.

Решение 4: откуда берётся скорость

Обе используют разреженное внимание и дистилляцию до нескольких шагов, но вкладывают усилия в разные места.

S2 делает ставку на системную инженерию и подробно её описывает. Внимание для каждого слоя выбирается из SageAttention, SpargeAttention и разреженно-линейного внимания, причём самые агрессивные приближения достаются наименее чувствительным слоям. Линейные слои выполняются как поблочные матричные умножения W8A8. Соседние операторы объединяются в ядра Triton/CUDA и воспроизводятся через CUDA Graphs. На нескольких GPU используется контекстный параллелизм в стиле Ulysses с квантованной передачей данных, а в конвейере редактирования VAE-кодировщик, основная сеть, Refiner и декодер делят GPU на общей временной шкале. Разрешение обеспечивается основной сетью низкого разрешения плюс одношаговым латентным Refiner до 720p.

R2 делает ставку на саму модель. Поблочно-разреженное внимание выучивается во время обучения и достигает разреженности более 90%. Дистилляция следует Decoupled DMD — следование управляющему сигналу и соответствие учителю оптимизируются как отдельные цели — плюс состязательное слагаемое из DMD2 для сохранения реалистичности. Разрешение растёт по пирамиде: один-два этапа низкого разрешения задают композицию, движение и камеру, а последний этап высокого разрешения добавляет текстуру. Выходное разрешение и частоту кадров R2 отчёт не указывает.

Решение 5: как люди ею управляют

S2 оборачивает модель в VLM-агента. Агент относит каждое референсное изображение к одному из типов — предмет в руках, фон или одежда — и пишет промпт для каждого сегмента: идентичность, выражение лица, взгляд, поза, действие и предметы в руках, сохраняя всё, что пользователь не просил менять. После генерации он просматривает кадры по порядку, решает, завершено ли действие, выполнено наполовину или пошло не так, и пишет следующий промпт с учётом этого. Для надевания и снятия аксессуаров промпты описывают и движение, и итоговое состояние, поэтому надетая обратно шляпа так и остаётся на голове. В режиме редактирования выравненное по кадрам внимание позволяет каждому выходному кадру читать только исходный кадр того же момента, так что движение и ритм точно совпадают с входным видео.

R2 встраивает в модель единый интерфейс ввода. Текст, референсы, звук, действия и сгенерированные агентами управляющие сигналы попадают в один и тот же работающий мир. Длина блока подстраивается под активный сигнал управления в пределах ограничения: нажатие клавиши получает короткие блоки для быстрой реакции, а целое событие или отрезок звука — более длинные, чтобы сохранить связность. Поверх модели игровой движок PixVerse добавляет слой агентов, который синхронизирует состояние игровых правил и сгенерированную сцену.

Что раскрывает каждый отчёт

Прежде чем сравнивать цифры, стоит сравнить, что вообще опубликовано.

Vidu S2PixVerse R2
ФорматСтатья на arXivТехническая статья на сайте PixVerse
Разрешение и частота кадров720p, 25–42 FPSНе указаны
Число параметров и сквозная задержкаНе указаныНе указаны
Публичные бенчмаркиОдин для аватаров, четыре для редактированияНет; только внутренняя оценка
ВесаНе опубликованы; есть APIНе опубликованы

На StreamAV-Bench в собственной оценке S2 занимает первое место по всем девяти приведённым метрикам среди 14 систем: согласованность звука и изображения 0,353 против 0,272 у лучшей альтернативы, ошибка синхронизации 0,617 против 0,648. Некоторые разрывы — в третьем знаке после запятой: согласованность объекта 0,998 против 0,997. Опубликованные цифры R2 — снижение дрейфа на 35,8% и разреженность внимания выше 90%, при которой, по словам отчёта, сохраняются четыре внутренних показателя качества, но самих оценок не приводится.

Прямого сравнения нет. Статья о S2 сравнивает модель с предыдущим поколением — PixVerse R1, а R2 вышла позже.

Что это значит, если вы делаете видео с помощью агентов

Мы делаем настольное приложение, в котором работу выполняют агенты, и видео — одна из задач, которые им поручают. Из этих отчётов можно вынести две вещи.

Во-первых, граница между живым и готовым видео становится чётче. Модели реального времени созданы для сценариев, которые продолжают реагировать, — персонажей, игр, потока, стиль которого меняется во время воспроизведения. Но большая часть работы авторов по-прежнему заканчивается файлом. В Orkas VideoStudio превращает исходные материалы и задание в монтаж, который можно проверить, а когда кадр нужно сгенерировать, использует офлайн-модели: генерацию видео, которую предоставляет Orkas, или ваш собственный ключ для Seedance 2.0, Hailuo 2.3, Vidu Q3 Pro, Kling 3.0 Turbo, Veo 3.1 или Runway Gen-4.5. Ни S2, ни R2 сейчас внутри Orkas не работают.

Во-вторых, управляющий слой S2 — это цикл агента: написать промпт, сгенерировать, посмотреть на кадры, решить, что делать дальше. Такую же форму имеет любой агент, работающий с генеративной моделью, в реальном времени или нет, — и значительная часть результата зависит от этого цикла, а не только от весов.

Что мы из этого выносим

Каркас устоялся: поблочно-причинная авторегрессионная диффузия, совместная генерация видео и звука, чистая и зашумлённая история, sink и окно, дистилляция семейства DMD, разреженное внимание, сначала низкое разрешение. S2 и R2 различаются тем, куда они вкладывают усилия: эстафета точечных исправлений против единой основы, дистиллированной один раз; on-policy-повтор против банка ошибок; системная инженерия против выученной разреженности.

Оба документа стоит прочитать целиком: статью о Vidu S2 — ради подробностей обучения и развёртывания, а отчёт о PixVerse R2 — ради аргумента о том, как масштабировать модель реального времени, не переучивая её.

Если вам нужно готовое видео, а не прямой эфир, страница агентного видеомонтажа VideoStudio показывает, как Orkas превращает исходные материалы в монтаж, который можно проверить.