Orkas Orkas
Início Blog Pesquisa
Pesquisa

Vidu S2 vs PixVerse R2: dois caminhos para o vídeo em tempo real

Os dois geram vídeo enquanto você assiste e aceitam novas instruções no meio da transmissão. Lidos lado a lado, o artigo do S2 e o relatório do R2 concordam no esqueleto, divergem em cinco escolhas — treino, desvio, memória, velocidade e controle — e divulgam quantidades muito diferentes.

Offline video generation denoises every frame of a clip together; real-time models such as Vidu S2 and PixVerse R2 generate block by block, play each block as soon as it is ready, and apply new input to the next block
Modelos offline removem o ruído de um clipe inteiro de uma vez; modelos em tempo real como o Vidu S2 e o PixVerse R2 geram bloco a bloco e exibem cada bloco assim que fica pronto. Diagrama do Orkas.

Dois modelos de vídeo em tempo real foram lançados com uma semana de diferença neste mês. O Vidu S2, da ShengShu, entrou no ar em 15 de setembro, e a PixVerse anunciou o PixVerse R2 em 22 de setembro. O S2 foi construído em torno de personagens digitais ao vivo e de reestilizar um fluxo de vídeo enquanto ele é exibido. O R2 se apresenta como um modelo de mundo em tempo real: uma cena que você percorre com WASD enquanto textos, referências e áudio mudam o que acontece a seguir.

As duas equipes publicaram como fizeram — o S2 em um artigo no arXiv, o R2 em um relatório técnico no site da PixVerse. Lemos os dois lado a lado. Eles concordam no esqueleto, divergem em cinco escolhas de projeto e divulgam quantidades muito diferentes de informação. Este post cobre os três pontos e, de propósito, não aponta um vencedor: os dois nunca foram medidos no mesmo teste.

Se você faz vídeo Tempo real é para experiências ao vivo. Vídeos finalizados ainda precisam de um fluxo de trabalho. O agente VideoStudio do Orkas planeja a edição, gera as tomadas e monta o vídeo — com modelos de vídeo gerenciados pelo Orkas ou com a sua própria chave de API.
Baixar o Orkas — grátis

O que muda com o tempo real

A maioria dos modelos de vídeo é offline. Todos os quadros de um clipe são limpos de ruído juntos, ao longo de dezenas de passos, e nada aparece até o clipe inteiro ficar pronto. Tudo o que você quer precisa estar no prompt antes de a geração começar.

Um modelo em tempo real inverte isso. Ele divide o vídeo em blocos — alguns quadros mais o trecho de áudio correspondente — e os gera em ordem. Cada bloco recebe só alguns passos de remoção de ruído e é exibido assim que fica pronto. Um bloco enxerga o que veio antes, mas nunca o que vem depois; é isso que significa causal por blocos. Uma nova instrução entra no bloco seguinte.

Esse formato cria três problemas, e quase todas as escolhas abaixo respondem a um deles:

  • Os erros se acumulam. Cada bloco é condicionado a blocos que o próprio modelo gerou, então um pequeno erro é herdado por tudo o que vem depois.
  • O histórico precisa ter limite. Um fluxo pode durar indefinidamente; guardar todos os blocos anteriores tornaria cada novo bloco mais caro.
  • O orçamento de tempo é implacável. A 25 quadros por segundo, cada quadro tem 40 milissegundos.

O S2 e o R2 chegam ao mesmo esqueleto: um modelo de difusão autorregressivo e causal por blocos, que gera vídeo e áudio juntos. As diferenças estão em como cada um é treinado, mantido estável, dotado de memória, acelerado e controlado pelas pessoas.

Os dois sistemas

O Vidu S2 (ShengShu Technology com a Universidade Tsinghua) são dois modelos. O S2-Avatar é um personagem digital ao vivo em 720p e 25–42 FPS, acima dos 540p do S1. Dá para entregar a ele uma nova imagem de referência no meio da transmissão — uma xícara, uma jaqueta, uma praia — e o personagem pega o objeto, veste a peça ou entra na cena; ele também dança. O S2-Editing reestiliza em tempo real um fluxo de vídeo recebido — mais de 50 estilos, provador virtual, troca de pessoa e de cenário — mantendo intacto o movimento original. O artigo também explora saída estéreo para óculos de realidade virtual.

O PixVerse R2 é um único modelo voltado a mundos interativos. Quatro tipos de entrada podem chegar enquanto ele roda — texto, referências multimodais, áudio e ações como WASD — e cada um atualiza o estado do mundo, não só o quadro atual. O motor de jogos da PixVerse já roda sobre o R2; a demonstração pública se concentra em movimento e prompts.

Escolha 1: como o modelo é treinado

Modelos em tempo real não são treinados do zero. O ponto de partida habitual é um forte prior gerativo offline, depois convertido para rodar de forma causal e em poucos passos. É aqui que os dois relatórios discordam mais abertamente.

O S2 faz um revezamento. Um modelo bidirecional de áudio e vídeo é pré-treinado e depois ajustado com Diffusion-DPO para fidelidade, expressão, movimento e sincronia entre áudio e imagem. A atenção passa a ser causal por blocos e é treinada com uma mistura de histórico limpo e histórico com ruído (escolha 2). Em seguida, o Self-Replay Forcing destila o modelo para poucos passos enquanto ele treina sobre as próprias saídas, e uma etapa final de preferência para streaming (Streaming NFT) ajusta o modelo causal. Avatar e edição são treinados como modelos separados.

O R2 mantém uma única base. O Omni Causal AR é um modelo causal pré-treinado continuamente com clipes curtos, vídeos longos, dados multimodais e trajetórias de interação. Depois, o Real-Time Acceleration destila esse mesmo modelo para uso ao vivo: o aluno é inicializado a partir dele e o professor é construído sobre ele. A frase do relatório é "acelerar, não reaprender".

Vidu S2PixVerse R2
Ponto de partidaModelo bidirecional ajustado com Diffusion-DPOModelo causal pré-treinado continuamente
Caminho até o tempo realAdaptação causal por blocos → Self-Replay Forcing → ajuste de preferência para streamingDestilar diretamente o mesmo modelo
ModelosModelos separados de avatar e de ediçãoUm modelo para todos os tipos de entrada

O relatório do R2 desenha a abordagem comum como um revezamento em cinco etapas e argumenta que cada passagem perde parte da capacidade. Lido de forma direta, o pipeline do S2 tem esse formato em várias etapas, com a principal melhoria na última. Nenhuma das equipes publicou um experimento comparando os dois caminhos, então ainda não se sabe qual escala melhor.

Escolha 2: impedir que o fluxo se desvie

O desvio é a falha típica do vídeo em streaming: a cor vai mudando, um rosto aos poucos vira outra pessoa e, no fim, o quadro se desfaz. Isso acontece porque o treino mostra ao modelo um histórico limpo, enquanto na inferência ele só vê a própria saída imperfeita.

As duas equipes partem da mesma correção. Elas misturam Teacher Forcing, que condiciona ao histórico real e limpo e protege a qualidade, com Diffusion Forcing, que condiciona a um histórico com ruído em nível aleatório. O ruído apaga os detalhes finos, mas preserva composição e movimento, e o modelo aprende a se apoiar na estrutura em vez de confiar em cada pixel do passado.

Histórico real com ruído ainda não é o mesmo que os erros do próprio modelo, então cada equipe acrescenta uma segunda camada.

S2: Self-Replay Forcing. Primeiro o modelo gera um trecho longo exatamente como faria na inferência, sem guardar gradientes. Uma janela dessa trajetória recebe ruído de novo, bloco a bloco, e é reproduzida em uma única passagem causal com gradientes, treinada com uma perda de destilação DMD mais uma perda perceptual. Como os blocos reproduzidos ficam no mesmo grafo de computação, os gradientes atravessam as fronteiras entre blocos — o modelo aprende como um bloco molda o seguinte — sem retropropagar pela geração original.

R2: Error Bank. Estados de falha representativos da geração são armazenados e reproduzidos no treino junto com o histórico normal, para que o modelo aprenda a se recuperar depois que um desvio já entrou no mundo. Na avaliação interna de etapa da PixVerse, uma métrica de desvio de brilho de longo prazo caiu de 0,201 para 0,129, uma redução de 35,8%; 20 de 29 sequências longas melhoraram, e o movimento espúrio diminuiu nas cinco amostras sem movimento.

Os dois se complementam em vez de competir. O Self-Replay Forcing treina sobre o que o modelo atual erra; o Error Bank treina repetidamente as falhas que vale a pena lembrar.

Escolha 3: uma memória com limite

Os dois mantêm alguns blocos iniciais permanentemente como âncora (um sink), mantêm uma janela deslizante de blocos recentes e descartam o resto, de modo que o custo de um novo bloco não cresce com a duração do fluxo. Os dois também mantêm as coordenadas de posição dentro da faixa vista no treino — o S1 chama isso de reposicionamento de RoPE, o R2 de RoPE temporal relativo —, então uma sessão longa nunca empurra as posições para fora da distribuição.

O S2 parte do TwinCache do S1, em que cada bloco anterior é armazenado duas vezes: uma com ruído, outra limpa. Os passos intermediários de remoção de ruído leem a cópia com ruído, que carrega o movimento geral e funciona como um filtro passa-baixa contra o acúmulo de artefatos; o último passo lê a cópia limpa para recuperar os detalhes. O S2 divide isso entre suas duas etapas: o backbone lê um cache com muito ruído, e o Refiner, um cache de alta resolução com pouco ruído.

O R2 separa a memória por escala de tempo: Sink Memory para identidade, ambiente, estilo e regras do mundo; Rolling History para movimento, pose e câmera recentes; e um Object KV Cache que comprime o estado dos objetos que ainda vai importar mais adiante.

A divisão espelha os produtos. Um personagem digital precisa continuar sendo a mesma pessoa. Um mundo também precisa lembrar o que aconteceu nele — o objeto que você largou, a escolha que você fez.

Escolha 4: de onde vem a velocidade

Os dois usam atenção esparsa e destilação em poucos passos. Mas concentram o esforço em lugares diferentes.

O S2 aposta em engenharia de sistemas e documenta tudo. A atenção é escolhida camada por camada entre SageAttention, SpargeAttention e atenção esparsa-linear, com as aproximações mais agressivas nas camadas menos sensíveis. As camadas lineares rodam como multiplicações de matriz W8A8 por bloco. Operadores vizinhos são fundidos em kernels Triton/CUDA e reproduzidos com CUDA Graphs. Em várias GPUs, usa paralelismo de contexto no estilo Ulysses com comunicação quantizada, e, no pipeline de edição, o codificador VAE, o backbone, o Refiner e o decodificador compartilham as GPUs em uma linha do tempo comum. A resolução vem de um backbone em baixa resolução mais um Refiner latente de um passo até 720p.

O R2 aposta no modelo. A atenção esparsa por blocos é aprendida durante o treino e passa de 90% de esparsidade. A destilação segue o Decoupled DMD — seguir o sinal de controle e reproduzir o professor são otimizados como objetivos separados — mais um termo adversarial vindo do DMD2 para manter o realismo. A resolução segue uma pirâmide: uma ou duas etapas em baixa resolução definem composição, movimento e câmera, e uma etapa final em alta resolução acrescenta a textura. O relatório não informa a resolução nem a taxa de quadros de saída do R2.

Escolha 5: como as pessoas o controlam

O S2 envolve o modelo em um agente VLM. O agente classifica cada imagem de referência como objeto na mão, cenário ou roupa e escreve um prompt para cada segmento, cobrindo identidade, expressão, olhar, pose, ação e objetos segurados, preservando tudo o que o usuário não pediu para mudar. Depois da geração, revisa os quadros em ordem, avalia se a ação terminou, ficou pela metade ou deu errado e escreve o próximo prompt de acordo. Para colocar ou tirar acessórios, os prompts descrevem o movimento e o estado final, então um chapéu recolocado continua na cabeça. No modo de edição, a atenção alinhada por quadro faz cada quadro de saída ler apenas o quadro de origem do mesmo instante, de modo que movimento e ritmo coincidem exatamente com a entrada.

O R2 embute uma única interface de entrada no modelo. Texto, referências, áudio, ações e controles gerados por agentes entram todos no mesmo mundo em execução. O tamanho do bloco acompanha o controle ativo, até um limite: um toque de tecla recebe blocos curtos, para responder rápido, e um evento inteiro ou um trecho de áudio recebe blocos mais longos, para manter a coerência. Acima do modelo, o motor de jogos da PixVerse adiciona uma camada de agentes que mantém sincronizados o estado das regras do jogo e a cena gerada.

O que cada relatório divulga

Antes de comparar números, compare o que foi publicado.

Vidu S2PixVerse R2
FormatoArtigo no arXivPost técnico no site da PixVerse
Resolução e taxa de quadros720p, 25–42 FPSNão informado
Parâmetros e latência ponta a pontaNão informadoNão informado
Benchmarks públicosUm de avatar, quatro de ediçãoNenhum; só avaliação interna
PesosNão liberados; API disponívelNão liberados

No StreamAV-Bench, o S2 fica em primeiro lugar nas nove métricas relatadas entre 14 sistemas, em sua própria avaliação: alinhamento entre áudio e imagem de 0,353, contra 0,272 da melhor alternativa, e erro de sincronia de 0,617, contra 0,648. Algumas margens estão na terceira casa decimal — a consistência do personagem é 0,998 contra 0,997. Os números publicados do R2 são a redução de 35,8% no desvio e a esparsidade de atenção acima de 90%, que, segundo o relatório, preserva quatro dimensões internas de qualidade, sem apresentar as notas.

Não há comparação direta. O artigo do S2 compara com o PixVerse R1, a geração anterior, e o R2 foi lançado depois dele.

O que isso significa se você faz vídeo com agentes

Construímos um aplicativo de desktop em que agentes fazem o trabalho, e vídeo é uma das tarefas que as pessoas entregam a eles. Duas coisas destes relatórios valem para esse uso.

Primeiro, a linha entre vídeo ao vivo e vídeo finalizado está ficando mais nítida. Modelos em tempo real são feitos para experiências que continuam respondendo — personagens, jogos, um fluxo reestilizado enquanto toca. A maior parte do trabalho de criadores ainda termina em um arquivo. No Orkas, o VideoStudio transforma material bruto e um briefing em uma edição revisável e, quando uma tomada precisa ser gerada, usa modelos offline: geração de vídeo gerenciada pelo Orkas ou a sua própria chave para Seedance 2.0, Hailuo 2.3, Vidu Q3 Pro, Kling 3.0 Turbo, Veo 3.1 ou Runway Gen-4.5. Nem o S2 nem o R2 rodam dentro do Orkas hoje.

Segundo, a camada de controle do S2 é um ciclo de agente: escrever o prompt, gerar, olhar os quadros, decidir o próximo passo. É o mesmo formato de qualquer agente que trabalha com um modelo gerativo, em tempo real ou não — e boa parte do resultado depende desse ciclo, não só dos pesos.

O que levamos disso

O esqueleto se estabilizou: difusão autorregressiva causal por blocos, vídeo e áudio gerados juntos, histórico limpo mais histórico com ruído, um sink e uma janela, destilação da família DMD, atenção esparsa e baixa resolução primeiro. O que separa o S2 e o R2 é onde cada um investe esforço — um revezamento de correções pontuais contra uma base destilada uma única vez, reprodução on-policy contra um banco de falhas, engenharia de sistemas contra esparsidade aprendida.

Vale ler os dois por inteiro: o artigo do Vidu S2, pelos detalhes de treino e de serviço, e o relatório do PixVerse R2, pelo argumento sobre escalar um modelo em tempo real sem reaprendê-lo.

Se você precisa de vídeos finalizados em vez de transmissões ao vivo, a página de edição de vídeo com agentes do VideoStudio mostra como o Orkas leva o material bruto até uma edição revisável.