Gemini 3.8 Live with Live Avatar: Presencia visual en tiempo real
Modelo multimodal de Google DeepMind que integra video y audio en diálogos conversacionales. Diseñado para empresas que buscan agentes virtuales con avatares personalizados, expresiones naturales y sincronización labial precisa en múltiples idiomas.
Gemini 3.8 Live with Live Avatar combina la generación de video de baja latencia con el diálogo en vivo para ofrecer una experiencia conversacional más natural. El sistema procesa entradas visuales y de audio simultáneamente, generando respuestas con expresiones faciales dinámicas y sincronización labial precisa. Esto permite a las empresas mejorar sus servicios de atención al cliente y realizar recorridos interactivos más accesibles. Una característica clave es la ejecución asíncrona de herramientas, que permite al modelo realizar llamadas a herramientas y obtener datos en segundo plano sin interrumpir el flujo del diálogo. Esto facilita el manejo de tareas complejas mientras se mantiene la presencia continua del avatar. Además, la función admite la sincronización de voz a voz en 97 idiomas, adaptando dinámicamente la sincronización labial y las expresiones sin perder la fidelidad del video. La plataforma ofrece una biblioteca de avatares preestablecidos y permite la creación de avatares personalizados a partir de imágenes de referencia para mantener la identidad de marca. Esta opción de personalización está disponible actualmente solo mediante listas de autorización empresarial. El acceso se realiza a través de Gemini Enterprise, y todo el contenido generado incluye la marca de agua SynthID para garantizar la transparencia y la detección de material creado por IA.