Griffin-Lite: la IA que busca pasar un “test de Turing” en videollamadas

Tavus afirma que su modelo Griffin-Lite logró que casi la mitad de un grupo creyera hablar con una persona real en videollamadas de un minuto. La prueba y la arquitectura full‑duplex abren debate sobre protocolos, métricas y riesgos para empresas y usuarios.

Por Redaccion TD
Griffin-Lite: la IA que busca pasar un “test de Turing” en videollamadas

Qué presentó Tavus y por qué llamó la atención

Tavus ha dado a conocer Griffin-Lite, una versión preliminar de investigación de su modelo audiovisual que genera rostro, voz y respuestas en tiempo real. En un experimento con 54 participantes, tras conversar un minuto con el sistema, 26 personas —el 48%— dijeron creer que su interlocutora era una persona real. La compañía sostiene que ese resultado equivale a superar un “test de Turing en vídeo”, aunque la afirmación requiere matices importantes.

El experimento: diseño y limitaciones

Los participantes fueron reclutados por una plataforma de investigación independiente y se les informó que hablarían durante un minuto sobre aquello que esperan con ilusión para el año. No se les dijo desde el inicio que podían estar conversando con una IA; la pregunta de si el interlocutor era humano o no se planteó al final, después de valorar naturalidad, confianza y fluidez.

En una prueba previa del sistema de la compañía, sólo 1 de 41 participantes había respondido que la otra persona era humana, lo que Tavus usa como comparación. Sin embargo, hay que recordar que el planteamiento original del test de Turing (1950) pedía comunicación por escrito para evitar pistas físicas como rostro o voz. No existe un protocolo único y reconocido para un “Video Turing Test”, por lo que resultados entre estudios no son directamente comparables.

Comparaciones relevantes en la literatura reciente

Un antecedente cercano es un estudio publicado en PNAS (mayo de 2026) que usó un test de Turing con tres participantes: cada interrogador conversó por escrito durante cinco minutos, a la vez, con una persona y con un modelo. Con instrucciones adicionales para asumir una personalidad humana, GPT‑4.5 fue identificado como humano el 73% de las veces; sin esas instrucciones la cifra fue 36%. Esos resultados subrayan cómo el protocolo —duración, medio de comunicación, instrucciones al modelo— cambia radicalmente la medida de “indistinguibilidad”.

¿Qué hace distinto a Griffin‑Lite? La arquitectura full‑duplex

La novedad que destaca Tavus es la capacidad full‑duplex del sistema: mientras el modelo genera voz y vídeo, continúa escuchando y observando, revaluando la conversación en intervalos menores a un segundo. Eso le permite comportamientos típicos de una interacción humana en vivo: asentir mientras la otra persona habla, interpretar pausas sin asumir que terminó el turno, aceptar interrupciones y reaccionar ante objetos mostrados frente a la cámara.

Además, las decisiones conversacionales alimentan de manera integrada la generación de voz, expresión facial, mirada y gestos, buscando coherencia multimodal en tiempo real. Esa sincronía entre contenido verbal y señales no verbales es clave para que la experiencia resulte más convincente.

Evaluación externa: NVIDIA y el benchmark VideoFDB

Para situar capacidades, NVIDIA incluyó Griffin‑Lite en VideoFDB, un benchmark formado por 237 fragmentos de videollamadas reales y 11 dinámicas conversacionales. Las rúbricas se puntúan de 0 a 5 mediante un juez automatizado basado en un modelo de lenguaje. En las tablas publicadas, Griffin‑Lite lidera en percepción con 3,73 (referencia humana 4,20) y en generación con 3,83 (referencia humana 3,92).

NVIDIA subraya algo relevante: pese a esos resultados, los sistemas evaluados todavía quedan por debajo de la referencia humana en naturalidad conversacional. Es decir, a nivel medible el avance es notable, pero no equiparable al comportamiento humano en todas las dimensiones.

Estado comercial y usos propuestos

Tavus ya comercializa herramientas para crear lo que llama PALs (agentes audiovisuales), que se pueden integrar vía API, construir sin código con PAL Maker o desarrollar a medida para empresas. La compañía plantea usos en ventas, formación y atención al cliente. No obstante, Griffin‑Lite es por ahora una versión de investigación disponible solo para testers seleccionados; Tavus no la ofrece aún a clientes y dice que en el futuro lanzará una versión más potente.

Implicaciones para empresas y tomadores de decisión en América Latina

Para organizaciones en Latinoamérica, estos avances traen oportunidades y riesgos concretos:

  • Oportunidades: agentes audiovisuales más naturales pueden mejorar la experiencia en soporte, capacitación y ventas remotas, reduciendo fricción y agilizando procesos. Integraciones con CRM y centros de contacto pueden beneficiarse de interacciones más ricas.
  • Riesgos: la capacidad de hacer que una IA parezca humana en videollamadas plantea desafíos de transparencia, consentimiento y reputación. En mercados donde la confianza personal y la relación directa son clave, el uso inadecuado puede generar rechazo o problemas legales.

Los responsables de producto y compliance deben evaluar políticas claras sobre divulgación (aviso al usuario cuando interactúa con una IA), control de calidad y trazabilidad de las interacciones, además de considerar implicaciones regulatorias que pueden variar entre países latinoamericanos.

Ética y medidas de mitigación

Tavus reconoce la doble cara del avance: las mismas funciones que mejoran naturalidad pueden llevar a engaños. La compañía afirma que trabaja en funciones de aviso para identificar el uso de agentes sintéticos y en controles de seguridad. Eso coincide con la línea general de la industria: combinar innovación con mecanismos de transparencia y límites al uso.

Para organizaciones, esto significa implementar prácticas mínimas como etiquetas claras en interacciones automatizadas, registro y auditoría de conversaciones y protocolos para manejo de datos sensibles. También es recomendable diseñar experiencias híbridas que permitan escalar con IA sin suplantar decisiones críticas o sustituyendo la responsabilidad humana.

Conclusión

Griffin‑Lite muestra avances interesantes en llevar la indistinguibilidad a videollamadas en tiempo real gracias a su arquitectura full‑duplex y a la integración de señales multimodales. Sin embargo, las afirmaciones de haber “superado un test de Turing en vídeo” deben tomarse con cautela: los protocolos difieren del test clásico de Turing y no hay un estándar único para evaluaciones audiovisuales.

Para líderes y profesionales en Latinoamérica, la lección práctica es equilibrar potencial y prudencia. Estas tecnologías pueden mejorar experiencias y eficiencia, pero su adopción responsable requiere transparencia, controles y evaluación del impacto en confianza y cumplimiento normativo.

(Notas: todos los datos citados corresponden a la publicación y los benchmarks reportados por Tavus y NVIDIA en el material original.)

Fuente original: Xataka IA