Imagina que estás soldando una placa base mientras una pantalla te observa. La IA que hay al otro lado no solo ve lo que haces: entiende el ritmo de tu trabajo. Cuando te detienes a pensar, no interrumpe. Cuando cometes un error, lo detecta. Cuando llega el momento de pasar al siguiente paso, habla. No antes. No después. En el momento justo.
Eso es exactamente lo que muestra la demostración que Tavus publicó el 1 de octubre. En el vídeo, un usuario llamado Sagar está soldando una placa mientras el AI, al otro lado de la pantalla, le guía paso a paso. En un momento dado, Sagar deja de hablar y se concentra en su tarea. El AI no se apresura a llenar el silencio. Sabe cuánto tiempo ha pasado, en qué punto del proceso está y cuándo debe intervenir.
Para un humano, esta coordinación es tan natural que ni siquiera la notamos. Pero para una IA, es un salto enorme.
Los asistentes de voz y los avatares digitales actuales, en su gran mayoría, esperan a que el usuario termine de hablar para responder. Interpretan el silencio como una señal de que les toca a ellos. Basta con que hagas una pausa breve para que te interrumpan.
Griffin, el nuevo modelo de Tavus, cambia las reglas del juego.
¿Qué es Griffin y por qué se llama “Modelo de Interacción Humana”?
Tavus, la empresa con sede en San Francisco fundada en 2020 por Hassaan Raza y Quinn Favret, ha presentado Griffin como el primer Modelo de Interacción Humana (Human Interaction Model, HIM). La definición es ambiciosa: un modelo diseñado específicamente para comprender y generar interacción cara a cara en tiempo real.
No se trata de un simple generador de vídeo ni de un chatbot con cara. Griffin es un modelo video-a-video full-duplex. El término “full-duplex” proviene del mundo de las telecomunicaciones y describe la capacidad de transmitir y recibir simultáneamente. Aplicado a la conversación, significa que ambos interlocutores pueden hablar al mismo tiempo, reaccionar en tiempo real, interrumpirse, asentir, solaparse. Como en una charla real.
La versión presentada es Griffin-Lite, una vista previa de investigación que aún no está disponible para el público general. La versión completa llegará más adelante.
El problema que Griffin resuelve: la tiranía del turno de palabra
Para entender la magnitud del avance, hay que comprender cómo funcionan los sistemas actuales de avatares digitales en tiempo real. La industria ha relied históricamente en arquitecturas en cascada:
- Reconocimiento de voz (ASR): convierte el audio del usuario en texto.
- Modelo de lenguaje (LLM): genera una respuesta textual.
- Síntesis de voz (TTS): convierte el texto en audio.
- Modelo de renderizado: anima el rostro y los labios del avatar para que coincidan con el audio.
Tavus misma utilizó este enfoque durante años. Su sistema anterior combinaba tres modelos: Phoenix-4.5 para el renderizado, Sparrow-2 para gestionar el ritmo de la conversación y Raven-1 para la percepción multimodal.
El problema, como Tavus admite abiertamente en su documentación técnica, es que cada transferencia entre módulos añade latencia y pierde información. Los matices del tono de voz se desvanecen al convertirse en texto. El sistema no puede asentir mientras el otro habla ni interrumpir con naturalidad. El resultado es que el usuario acaba adaptándose a la máquina: habla más despacio, simplifica su vocabulario, evita los silencios incómodos.
Como señaló Hassaan Raza en el anuncio: “La IA se ha vuelto muy inteligente, pero la gente sigue teniendo que comunicarse según los hábitos de la máquina.”
La solución de Griffin: un sistema end-to-end sin turnos rígidos
Griffin abandona la arquitectura en cascada y apuesta por un sistema unificado de extremo a extremo donde percepción, decisión y generación ocurren en paralelo. El desarrollo ha estado liderado por el equipo de investigación de Tavus, con Ioannis Patras (profesor en la Universidad Queen Mary de Londres) y Maja Pantic (profesora de computación afectiva y conductual en el Imperial College de Londres) como cabezas visibles. Pantic dirigió anteriormente investigación en IA en Meta. Según Tavus, los artículos académicos de su equipo acumulan más de 90.000 citas.
El sistema se compone de dos grandes bloques:
1. El motor de modelado conversacional continuo
Este motor recibe simultáneamente señales de audio y vídeo del usuario. En lugar de esperar a que termine una frase para responder, evalúa el estado de la conversación en “microrrondas” de menos de un segundo. En cada una de ellas decide qué hacer:
- Hablar.
- Seguir escuchando.
- Ceder el turno.
- Asentir o hacer sonidos de acompañamiento.
- Mantenerse en silencio.
La salida no es solo qué decir, sino cómo decirlo: el momento exacto, la postura corporal, la expresión facial, los gestos, la emoción y el tono de voz.
2. El motor de generación de audio y vídeo
Este bloque convierte esas señales de control en voz e imagen en tiempo real.
En audio, Tavus ha desarrollado un códec propio llamado Tavec. Comprime audio a 48 kHz en una representación latente continua (40 valores por fotograma, 100 fotogramas por segundo) sin usar libros de códigos discretos. El decodificador es estrictamente causal y puede generar y reproducir con paquetes de tan solo 10 milisegundos. Sobre esta representación, un Transformer de difusión autorregresivo genera la voz. Basta con unos 10 segundos de audio de referencia para clonar una voz.
En vídeo, se utiliza un generador de difusión autorregresivo de pocos pasos combinado con un decodificador VAE. Con una sola foto de referencia, el sistema produce vídeo a 720p y 25 fotogramas por segundo. Cada representación latente corresponde a 8 fotogramas (320 milisegundos de vídeo) y solo requiere 3 pasos de difusión para renderizarse en tiempo real. El modelo también recibe señales de control sobre gestos, mirada y emoción. No genera solo una cara: el cuerpo y el fondo se renderizan fotograma a fotograma.
Para evitar que la imagen se degrade o se desvíe en conversaciones largas, Tavus emplea un entrenamiento de destilación en tres fases: primero Distribución Matching Distillation (DMD), luego teacher forcing y finalmente self-forcing.
Los números: latencia, calidad y rendimiento
Según los datos publicados por Tavus, en una NVIDIA H100 la latencia media desde la entrada de audio hasta la salida de vídeo es de 0,43 segundos, menos de la mitad que la mejor solución publicada hasta ahora. En modo de vídeo guiado solo por audio, Griffin lidera tres métricas de calidad de imagen —DOVER, FID y THEval— entre cinco sistemas comparados, y queda segundo en sincronización labial (LSE-C).
Evaluación en VideoFDB
El benchmark VideoFDB, publicado por NVIDIA en mayo de 2026, es el primero dedicado a agentes de diálogo audiovisual full-duplex. Sus materiales provienen de videollamadas reales: 237 fragmentos de conversaciones entre dos personas, que cubren 11 categorías de comunicación no verbal como evitación de mirada, pausas, asentimientos y cambios de turno. Tiene dos pistas: generación y percepción, ambas evaluadas por un LLM según reglas objetivas.
Resultados en generación:
| Modelo | Puntuación |
|---|---|
| Griffin-Lite | 3,83 |
| Gemini 2.5 + Anam (cascada) | 2,80 |
| Humano (referencia) | 3,92 |
En el desglose, Griffin-Lite obtiene 4,40 en “resonancia emocional entre dos personas”, superando incluso la referencia humana (4,14). Pero en “adecuación de señales no verbales” obtiene 2,83, por debajo del humano (3,18). La diferencia principal está en la velocidad de respuesta: la mediana de Griffin-Lite es de 1.892 milisegundos, frente a los aproximadamente 900 milisegundos de una persona real.
Resultados en percepción:
| Modelo | Puntuación |
|---|---|
| Humano (referencia) | 4,20 |
| Griffin-Lite | 3,73 |
| MiniCPM-o 4.5 (open source) | 3,40 |
| Gemini 3.1 Flash Live | 2,84 |
| gpt-realtime (OpenAI) | 2,75 |
La prueba de Turing visual: 48 % de engaño
El dato más llamativo proviene de un estudio propio de Tavus. Reclutaron a 54 personas desde una plataforma de investigación independiente. Solo se les dijo que mantendrían una videollamada de 1 minuto con otra persona para hablar de lo que más esperaban este año. Al terminar, rellenaban un cuestionario de valoración subjetiva. La última pregunta era: “¿En algún momento pensaste que la otra persona podría no ser humana?”
26 de los 54 participantes (48 %) creyeron que su interlocutor era una persona real. En el mismo test, la generación anterior del sistema solo engañó al 2,4 % (1 de 41).
Entre quienes pensaron que era humano, la confianza media fue del 79 %. Entre quienes detectaron que era una IA, la confianza media fue del 81 %. Tavus señala además que la mayoría de quienes sospecharon lo hicieron en los primeros 20 segundos.
Aunque el propio Tavus reconoce las limitaciones del estudio: fue realizado íntegramente por la empresa, con una muestra reducida, llamadas de solo un minuto y sin grupo de control con humanos reales.
Más allá del test: las demostraciones que muestran el potencial
Tavus ha publicado varias demostraciones que ilustran lo que hace especial a Griffin:
- La soldadura: el AI observa, espera y guía sin interrumpir. Sabe cuánto tiempo ha pasado y en qué paso está el usuario.
- La noticia del ascenso: el usuario comparte que le han ascendido. El avatar Vanessa reacciona con expresión y sonido antes de que termine la frase. Ambos se solapan brevemente. La conversación fluye sin cortes.
- “Simón dice”: el AI solo hace el gesto cuando se pronuncia la frase “Simón dice”. Si el usuario omite la fórmula, lo señala al instante. Juega con las reglas, no solo con las palabras.
- El cubo de Rubik: mientras el usuario gira el cubo, el AI sigue los cambios y responde. Si el usuario se detiene a pensar, el AI espera en silencio.
Estos ejemplos no son trucos de feria. Cada uno demuestra una capacidad diferente: percepción visual continua, comprensión del contexto temporal, lectura de reglas implícitas, gestión del silencio y respuesta multimodal en tiempo real.
¿Por qué no está disponible aún? El dilema ético y regulatorio
Griffin-Lite no está abierto a los más de 150.000 desarrolladores y empresas que usan la plataforma de Tavus, entre los que se incluyen Amazon, Mayo Clinic y Salesforce. Solo un grupo reducido de testers de confianza tiene acceso. La versión completa llegará más adelante.
La razón es doble. Por un lado, Tavus quiere asegurarse de que el modelo está listo. Por otro, hay un obstáculo legal importante: el artículo 50 de la Ley de IA de la Unión Europea, en vigor desde el 2 de agosto de 2026, exige que los sistemas de IA que interactúan directamente con personas informen claramente al usuario de que no es humano.
Y aquí está la paradoja: cuanto mejor es Griffin imitando a una persona, más fácil es que alguien olvide que está hablando con una máquina. Tavus afirma que está desarrollando una función de “divulgación segura” (notificación obligatoria de identidad) y colaborando con organizaciones de seguridad en IA. Una vez resueltos estos problemas de cumplimiento, Griffin se lanzará “pronto”, aunque aún no hay fecha ni precios confirmados.
La trayectoria de Tavus: de vídeos personalizados a la conversación total
Para entender cómo una empresa ha llegado hasta aquí, conviene repasar su historia.
Tavus nació en 2020 dentro de Y Combinator. Su primer producto estaba dirigido a equipos de ventas y marketing: los comerciales grababan un vídeo base y el sistema sustituía automáticamente el nombre del cliente, la empresa y otros datos para generar vídeos personalizados a escala. Meta y Salesforce fueron algunos de sus primeros clientes.
En marzo de 2024, cerró una Serie A de 18 millones de dólares liderada por Scale Venture Partners. Su modelo Phoenix ya era capaz de generar un gemelo digital a partir de 2 minutos de vídeo.
En noviembre de 2025, llegó la Serie B de 40 millones de dólares, liderada por CRV con participación de Sequoia Capital y Y Combinator. La financiación acumulada alcanzó unos 70 millones de dólares. En ese momento, Tavus ya había pivotado hacia la conversación en vídeo en tiempo real.
Griffin representa la culminación de ese giro estratégico: pasar de generar vídeos a mantener conversaciones.
Implicaciones: qué significa todo esto
Para la industria de los avatares digitales
Griffin marca un antes y un después. Hasta ahora, los avatares conversacionales eran en su mayoría “turnistas”: esperaban, procesaban, respondían. Griffin demuestra que es posible un modelo continuo, paralelo y reactivo. Eso obliga al resto de la industria a repensar sus arquitecturas.
Para los benchmarks
VideoFDB se consolida como el estándar para evaluar agentes de diálogo audiovisual full-duplex. Que Griffin-Lite lidere la pista de generación con 3,83 puntos, frente a los 2,80 de una solución basada en Gemini 2.5, establece una referencia clara.
Para la ética y la regulación
La prueba de Turing visual de Tavus —48 % de personas engañadas— plantea preguntas incómodas. ¿Es aceptable que una IA sea indistinguible de un humano? ¿Cómo se garantiza el consentimiento informado? ¿Qué pasa con la suplantación de identidad? La Ley de IA europea ya ha puesto el primer marco, pero la tecnología avanza más rápido que la regulación.
Para los usuarios
A corto plazo, Griffin-Lite solo estará disponible para unos pocos. Pero las capacidades que demuestra —esperar, observar, reaccionar, interrumpir con naturalidad— anticipan un futuro en el que hablar con una IA será, por fin, como hablar con una persona. Y eso cambia todo: la educación personalizada, la formación de empleados, la asistencia técnica en tiempo real, el acompañamiento terapéutico.
Aplicaciones previstas
Tavus ha esbozado algunos de los usos que imagina para Griffin:
- Tutoría uno a uno: un AI que ve lo que el estudiante escribe, escucha sus dudas y adapta el ritmo de la explicación.
- Ensayo de conversaciones difíciles: empleados que practican cómo pedir un aumento, dar retroalimentación negativa o gestionar un conflicto.
- Asistencia técnica en vivo: el escenario de la soldadura. Un AI que observa lo que haces y te guía paso a paso sin interrumpir cuando no toca.
Estos casos comparten un rasgo común: requieren presencia continua, percepción multimodal y timing perfecto. No basta con responder preguntas; hay que estar ahí, como estaría un humano.
Conclusión
Griffin no es perfecto. Su tiempo de respuesta (1,9 segundos) sigue siendo el doble que el de una persona (0,9 segundos). Su puntuación en adecuación de señales no verbales (2,83) está por debajo de la humana (3,18). Y su prueba de Turing, aunque impresionante, tiene limitaciones metodológicas evidentes.
Pero el hecho de que casi la mitad de los participantes en un test creyeran estar hablando con una persona real durante una videollamada de un minuto es un hito. Y no es un hito aislado: es la culminación de años de trabajo en percepción multimodal, generación en tiempo real y modelado conversacional.
Tavus ha plantado una bandera. Griffin es el primer modelo que se presenta como “Modelo de Interacción Humana”, y los resultados, aunque preliminares, respaldan la ambición. La conversación con IA ya no se trata solo de qué dice, sino de cómo lo dice, cuándo lo dice y qué hace mientras tanto.
El test de Turing clásico medía la capacidad de una máquina para hacerse pasar por humano en una conversación escrita. Griffin propone una versión actualizada: el test de Turing visual, en vivo, cara a cara, con silencios, gestos y solapamientos. Y por primera vez, un modelo lo ha superado. Casi.
Lo que viene después depende de cómo Tavus resuelva el equilibrio entre realismo y transparencia. Porque cuanto más humano parece Griffin, más importante es que sepamos que no lo es.
Descubre más desde CIBERED
Suscríbete y recibe las últimas entradas en tu correo electrónico.

