Pular para o conteúdo principal

Muse Realtime Avatar: embodiment em cerca de 870 ms

· 2 min para ler
gui
Capa do conteúdo: Muse Realtime Avatar: embodiment em cerca de 870 ms

O acontecimento

Em 23 de setembro de 2026 a Meta Research apresentou Muse Realtime Avatar, embodiment que anima mídia de referência a partir do mesmo stream de speech VQs do Muse Realtime Voice. Um DiT áudio-driven gera chunks causais de vídeo 448x768 a 25 fps, carregando latents recentes para continuidade de aparência e maneirismos.

Serving: destilação teacher para student (cerca de 120 NFE para 2; cerca de 60x), KV cache persistente, batching latency-aware, QAT 4-bit e CUDA Graphs. Latência reportada cerca de 870 ms (fim do turno do usuário até o primeiro byte voz+vídeo). Até 12 sessões concorrentes de vídeo por GB200 (cerca de 8x vs baseline BF16). Watermark Meta Video Seal sem latência extra. Em call nativo, raters preferiram Muse vs Runway Characters e HeyGen LiveAvatar na maioria das dimensões.

Por que importa

Distinto de Muse Secure VM (edição 02): não é sandbox consumer, é stack de inferência realtime e embodiment. Para produtos de agent com presença visual, o contrato deixa de ser gerar clip e passa a ser sessão conversacional contínua.

Aplicabilidade prática

  • Avalie se o caso precisa de avatar live ou se voz e tools bastam.
  • Trate watermark e política 18+ como checklist de produto, não afterthought.
  • Estude o padrão de destilação e KV cache se você serve vídeo causal próprio.
  • Não assuma que todos os demos do blog estão no app Muse.

Limitações e incertezas

Não rodei o sistema. Preferência de raters e números de latência/concurrency são os da Meta. Comparativos comerciais usam call nativo de cada vendor; harnesses diferem. Muse é 18+.

Fontes originais