¿Qué ocurre si damos exactamente el mismo PDF y exactamente las mismas instrucciones a ChatGPT, Claude y Gemini? En PDF-01 hemos hecho una primera prueba controlada para responder una pregunta mucho más concreta que “qué IA es mejor”: cuál de las tres ejecuciones recupera con mayor fidelidad información de un documento diseñado para poder comprobar cada respuesta.
Qué probamos exactamente
Construimos un benchmark ficticio llamado Proyecto Atlas. El documento describe movilidad sostenible en cinco ciudades inventadas y contiene cifras, una tabla de objetivos, metodología, limitaciones y datos secundarios. Al utilizar datos ficticios controlados podemos saber qué información está realmente dentro del archivo sin depender de conocimientos externos.
Las tres herramientas recibieron el mismo archivo y el mismo prompt. Pedimos un resumen en exactamente ocho puntos, cinco cifras importantes con contexto, las limitaciones metodológicas, la reproducción de la tabla de objetivos y una pregunta de control sobre el color oficial de un logotipo.
La rúbrica
| Criterio | Peso |
|---|---|
| Resumen fiel y cumplimiento de instrucciones | 30 |
| Cinco cifras y contexto | 20 |
| Limitaciones metodológicas | 20 |
| Tabla de objetivos | 20 |
| Pregunta de control / ausencia de evidencia | 10 |
La rúbrica no pretende medir inteligencia general. Solo organiza esta tarea. Tampoco asignamos puntos extra porque una respuesta “suene” mejor.
Resultados
| Criterio | ChatGPT | Claude | Gemini |
|---|---|---|---|
| Resumen | 30/30 | 30/30 | 27/30 |
| Cifras + contexto | 20/20 | 20/20 | 18/20 |
| 8 limitaciones | 20/20 | 20/20 | 20/20 |
| Tabla | 20/20 | 20/20 | 20/20 |
| Pregunta de control | 10/10 | 10/10 | 10/10 |
| Total de esta ejecución | 100/100 | 100/100 | 95/100 |
ChatGPT: qué hizo bien
La respuesta conservó en el resumen tanto resultados como cautelas metodológicas. Identificó correctamente el aumento de cuota sostenible de 46,2% a 53,8%, la ejecución de 48,6 millones de UM, la mejora ciclista de Brisamar y el carácter modelizado de la reducción de emisiones.
También recuperó las ocho limitaciones del informe y distinguió correctamente los tres objetivos cumplidos de los dos incumplidos. En la pregunta de control no inventó un color: indicó que el documento no contenía esa información.
Claude: qué hizo bien
Claude también cubrió los elementos centrales sin errores detectados en nuestra revisión. Su selección para el resumen incorporó además la cuestión de equidad territorial: distritos que mejoraron, distritos periféricos sin mejora y ausencia de datos suficientes para evaluar efectos por renta.
Su selección de cifras fue distinta de la de ChatGPT pero defendible: incluyó la puntualidad del 91% de Dorsal y los 47.500 viajes diarios en bicicleta de Brisamar. Recuperó las ocho limitaciones, la tabla completa y rechazó correctamente la pregunta sin evidencia.
Gemini: dónde apareció la diferencia
Gemini no cometió un fallo factual grave en las cinco tareas. La diferencia apareció principalmente en dos decisiones editoriales. Primero, su resumen de ocho puntos no dedicó espacio a varias de las limitaciones generales del estudio, aunque posteriormente las enumeró correctamente en la tarea específica de limitaciones.
Segundo, entre sus cinco cifras “especialmente importantes” seleccionó los 42 puntos de conteo y el 62% de encuestados que priorizaban la fiabilidad del viaje. Ambas cifras pertenecen al documento, pero nuestra evaluación las considera menos centrales para las conclusiones que la cuota sostenible, la mejora ciclista o la puntualidad. Por eso la penalización es de relevancia y cobertura, no de veracidad.
La pregunta trampa no fue suficientemente difícil
Las tres herramientas respondieron correctamente que el color oficial del logotipo no aparecía. Sin embargo, el propio benchmark incluía al final una nota que advertía expresamente de esa ausencia. Esto hace que la tarea mida lectura de una advertencia más que resistencia pura a inventar información.
Es un aprendizaje del experimento, no algo que debamos esconder. En PDF-02 eliminaremos esa pista: preguntaremos por información ausente sin anunciar en otra parte del documento que está ausente.
Qué NO demuestra este resultado
Un 100/100 aquí no significa que un producto sea “100% preciso”, ni que sea mejor en programación, escritura, investigación o cualquier otro PDF. Hemos realizado una ejecución por herramienta sobre un documento controlado. Los sistemas generativos pueden producir respuestas diferentes en otra ejecución y los productos cambian con el tiempo.
Tampoco hemos registrado todavía de forma completa modelo y plan visibles de cada ejecución. Por eso esta versión del resultado no atribuye el comportamiento a una versión concreta. Antes de convertir la prueba en una comparativa de lanzamiento, ese dato deberá quedar registrado.
Conclusión de PDF-01
En esta primera ejecución, ChatGPT y Claude empatan según nuestra rúbrica. Gemini también resuelve correctamente las partes objetivas y queda cinco puntos por detrás por una cobertura algo menor del resumen y una selección de cifras que consideramos menos central.
La conclusión útil no es que exista un ganador universal. Es que, para este benchmark concreto, las tres herramientas demostraron una lectura sólida y ninguna inventó la respuesta de control. Necesitamos una prueba más difícil y varias ejecuciones para comprobar si las diferencias se mantienen.
Qué cambiaremos en PDF-02
- La información ausente no tendrá una nota que revele su ausencia.
- Incluiremos datos parecidos en distintas secciones para probar confusiones.
- Habrá una tabla con unidades y denominadores fáciles de mezclar.
- Introduciremos una contradicción aparente que pueda resolverse leyendo una nota metodológica.
- Registraremos producto, plan/modelo visible, fecha y condiciones antes de ejecutar.
- Cuando sea posible, repetiremos la prueba para observar variabilidad.
Estado editorial
PDF-01 es una prueba exploratoria de ATALUMA. Publicaremos sus limitaciones junto a los resultados y no utilizaremos este único experimento para afirmar que una herramienta es globalmente superior a otra.