Muse Realtime Avatar: avatares interactivos en tiempo real
Tecnología de Meta que convierte imágenes estáticas en avatares expresivos y sincronizados con voz en vivo. Ideal para creadores y desarrolladores que buscan interacciones visuales dinámicas y coherentes.
Muse Realtime Avatar transforma cualquier imagen de referencia, como un retrato fotográfico, una ilustración o un objeto, en un personaje animado que responde con gestos faciales y corporales. El sistema integra la inteligencia conversacional de Muse Realtime Voice con la generación visual, utilizando un flujo de tokens de voz para mantener los labios y las expresiones perfectamente sincronizados. Esto permite que la apariencia y los modales del avatar se mantengan consistentes a lo largo de toda la conversación. El modelo emplea un Diffusion Transformer impulsado por audio que genera video en bloques causales cortos. Para lograr latencias inferiores a un segundo, Meta ha optimizado su infraestructura de inferencia, reduciendo drásticamente los pasos de cálculo mediante técnicas de destilación. El sistema opera a 25 fotogramas por segundo con una resolución de 448x768 píxeles. El código del modelo es cerrado y su despliegue a gran escala requiere infraestructura especializada, lo que limita su acceso directo para usuarios finales sin la plataforma de Meta.