Durante 60 segundos, 26 personas hablaron por videoconferencia con alguien que no existía.
Le contaron qué esperaban del año. Le miraron a los ojos. Le vieron sonreír, dudar, asentir. Y al colgar estaban convencidas de haber charlado con otro ser humano.
No lo era. Era Griffin, el nuevo avatar conversacional de Tavus, un laboratorio de inteligencia artificial con sede en San Francisco que el jueves 1 de octubre anunció haber superado el primer test de Turing en vídeo.
El test de Turing, propuesto por el británico Alan Turing en 1950, plantea una pregunta práctica en lugar de una filosófica: si una máquina conversa de forma que un interlocutor humano no puede distinguirla de otra persona, ¿debemos atribuirle inteligencia? Turing lo llamó originalmente el “juego de imitación”.
Según la compañía, 26 de 54 participantes, el 48 %, tomaron a su modelo por una persona. Su sistema anterior solo había engañado a uno de 41.
En pocas horas, el dato circulaba por X. El método, bastante menos.
La demostración, difundida en varios fragmentos, sorprende tanto como impresiona: el avatar escucha, observa lo que pasa a su alrededor, interrumpe y responde mientras su interlocutor todavía está hablando.
Sale airoso de pruebas pensadas para desenmascararlo, como pedirle que levante el pulgar, y hasta se permite comentarios espontáneos que nadie le ha pedido, como criticar el jersey de quien tiene enfrente.
Un test de Touring a ciegas
Los participantes fueron reclutados a través de una plataforma de investigación. Se les dijo que conversarían con otra persona sobre un asunto trivial: qué esperaban del año. No se les advirtió de que su interlocutor podía ser una máquina.
La pregunta clave, si habían sospechado que hablaban con una inteligencia artificial, solo llegó al final del cuestionario. Según los datos de la propia empresa, más de la mitad reconoció que esa posibilidad ni siquiera se le había pasado por la cabeza.
Eso no es el juego de imitación que Alan Turing describió en 1950. En la formulación clásica, el evaluador sabe que uno de sus interlocutores es una máquina y su tarea consiste en desenmascararla. Sin esa sospecha, lo que se mide cambia de naturaleza.
El ensayo de Tavus no evalúa si Griffin resiste el escrutinio de alguien alerta. Mide cuánto tarda una persona en desconfiar de un rostro cuando nadie le ha dado motivos para hacerlo.
Ese escenario no se parece a un laboratorio. Se parece a una videollamada fraudulenta.
Griffin se presenta como «el primer Modelo de Interacción Humana (HIM) del mundo, una nueva clase de modelo diseñado para comprender y generar interacción humana presencial en tiempo real. Escucha mientras las personas hablan y presta atención a las expresiones y las pausas, no solo a las palabras. Griffin reúne nuestras investigaciones previas sobre percepción en tiempo real, conversación y vídeo expresivo de apariencia humana en un único sistema unificado de vídeo a vídeo».
Veinte segundos
Quienes sospecharon de Griffin lo hicieron, por lo general, en los primeros 20 segundos. A partir de ahí, las impresiones se fijaron. Los que concluyeron que hablaban con un humano –los 26 de 54– declararon, de media, un 79 % de confianza; los que acertaron, un 81 %.
Un minuto de charla intrascendente partió al grupo casi por la mitad, con ambas mitades convencidas de tener razón.
Una medición independiente apunta en la misma dirección. VideoFDB, el banco de pruebas de NVIDIA Research y David AI, no evalúa si una imagen parece real, sino cómo un sistema percibe y produce las señales de una conversación cara a cara: pausas, miradas, gestos, risas, sincronía.
Griffin encabeza la clasificación, por delante de modelos de tiempo real de OpenAI y Google. En generación obtiene 3,83 puntos sobre 5, frente a 3,92 de la referencia humana; el siguiente sistema, una combinación de un modelo de Google con un avatar de Anam, se queda en 2,80.
Con un matiz. En percepción, Tavus se compara con la versión solo de audio del modelo de OpenAI, aunque NVIDIA también evaluó la variante con vídeo. Griffin gana igualmente, pero por menos. El dato es correcto; la presentación, la más favorable para quien lo comunica.
El negocio de parecer humano
Tavus, fundada en 2020 por Hassaan Raza y Quinn Favret, ha captado unos 64 millones de dólares, 40 de ellos en una ronda liderada por CRV en noviembre de 2025.
Vende avatares conversacionales para entrevistar candidatos, formar vendedores, atender clientes o tratar con pacientes. Su negocio depende de que hablar con una cara artificial resulte cada vez menos extraño. El 48 % es, además de un resultado experimental, su argumento de venta.
La empresa parece consciente del reverso. Griffin-Lite, la versión probada, no está a la venta: Tavus afirma que antes debe reforzar su alineación y su seguridad, y solo lo ofrece a un grupo restringido de probadores.
La cautela dice mucho. Parecer humano y poder engañar no son dos capacidades distintas. Son la misma, vista desde lados opuestos.
Inspiración para los delincuentes
Lo que Tavus presenta como hito, los delincuentes ya lo explotan con herramientas bastante más toscas.
El caso más reciente lo destapó el Corriere della Sera y lo publicó Confilegal el 29 de septiembre. En febrero de 2026, Paolo Molesini, entonces presidente de Fideuram, la división de banca privada de Intesa Sanpaolo, recibió un WhatsApp que parecía de Carlo Messina, consejero delegado del grupo. Pedía canalizar con urgencia varias transferencias para no perder una operación en el extranjero.
Después llegó la llamada de confirmación. Al otro lado, aparentemente, estaba Paolo Nastasi, socio director de A&O Shearman en Italia, presentado como intermediario. Molesini lo conocía y reconoció su voz. Pero Nastasi era ajeno a todo: su voz había sido clonada con inteligencia artificial.
Salieron unos 95 millones de euros, sobre todo hacia China y Hong Kong. La rápida reacción de la entidad y de la Fiscalía de Milán, con fiscales de Lisboa coordinados por Eurojust, permitió bloquear y recuperar buena parte. Al menos 36 millones siguen sin aparecer tras convertirse en criptomonedas. Molesini no está investigado.
La voz de un profesional de confianza funcionó como segunda capa de verificación, precisamente la que recomiendan los protocolos antifraude.

El precedente de Hong Kong
Dos años antes, el engaño ya había dado el salto a la imagen. En enero de 2024, un empleado de la oficina de Hong Kong de la ingeniería británica Arup recibió una petición atribuida al director financiero de la sede londinense para ejecutar operaciones confidenciales, y al principio sospechó.
Lo que disipó sus dudas fue una videoconferencia.
Según el superintendente de la policía de Hong Kong Baron Chan, todas las personas que vio en esa reunión eran falsas.
Como parecían las reales, el empleado ordenó 15 transferencias por 200 millones de dólares de Hong Kong a cinco cuentas locales, unos 25,6 millones de dólares estadounidenses.
El último eslabón
La secuencia es elocuente. En Milán bastó una voz conocida. En Hong Kong, un vídeo verosímil. Ahora añádase una cara capaz de sostener una conversación en tiempo real, reaccionar a las preguntas y superar los primeros 20 segundos de sospecha.
Nada indica que Tavus tenga relación alguna con estos fraudes. Pero la tecnología que hoy se presenta como hito suele acabar, tarde o temprano, al alcance de cualquiera.
En la Unión Europea, el artículo 50 del Reglamento de Inteligencia Artificial obliga a que los sistemas que interactúan con personas físicas les informen de que tratan con una máquina, salvo que resulte evidente. La norma, sin embargo, solo obliga a quien la cumple. Los delincuentes no avisan.
Para quien diseñe el próximo fraude del CEO, el problema dejará de ser imitar al directivo. Bastará con elegir a cuál.
La factura de la desconfianza
Al otro lado, la tarea se complica de forma proporcional.
Durante décadas, ver y oír a alguien fue la prueba de identidad más intuitiva que existía. Esa prueba se está quedando sin valor. Si una voz puede clonarse y una cara puede conversar, bancos, despachos, empresas y administraciones tendrán que levantar sistemas de verificación cada vez más sofisticados para que una orden legítima pueda distinguirse de una fabricada.
Llamadas de vuelta por canales independientes. Contraseñas pactadas de antemano. Autorizaciones que exijan la firma de varias personas. Herramientas capaces de detectar si quien aparece en pantalla está realmente vivo. Certificados que acrediten el origen de cada imagen y cada sonido. Y, sobre todo, personal formado para desconfiar precisamente de lo que parece más fiable.
Todo eso tiene un coste. En dinero, en tiempo y en fricción. Cada capa de seguridad añadida ralentiza operaciones que antes se cerraban con una llamada. Y obliga a algo que hasta ahora parecía impensable: tratar como sospechoso por defecto a quien nos habla con la cara y la voz de un colega.
El caso de Intesa apunta, además, a que la tecnología no bastará. Lo que permitió recuperar parte del dinero no fue un detector, sino la rapidez de la entidad y la cooperación judicial entre países. Donde el rastro llegó a las criptomonedas, la recuperación quedó en manos de comisiones rogatorias de resultado incierto.
Los buenos tendrán que ganar todas las veces. A los delincuentes les basta con acertar una.
Griffin no ha superado el test de Turing. Ha superado otro, quizá más relevante: el test de la confianza, ese que nadie nos anuncia y que empieza cada vez que una cara aparece en una pantalla y damos por hecho que detrás hay alguien.
Esta vez, quien diseña el examen es también quien vende la cara.