Resultado

ChatGPT Plus, Claude Sonnet 5 y Gemini Flash: 100/100 según la rúbrica cerrada antes de ejecutar la prueba.

Qué medimos

EXP-03 evaluó extracción exacta y seguimiento de instrucciones, no capacidad de resumen. El documento contenía cinco fichas con datos vigentes, históricos, provisionales y ausentes. La guía para extraer datos de un PDF sin inventar campos convierte estos controles en un procedimiento de uso general, sin extrapolar el resultado de la prueba.

Resultados

CriterioChatGPT PlusClaude Sonnet 5Gemini Flash
Campos correctos40/4040/4040/40
Vigentes vs. históricos/provisionales20/2020/2020/20
Campos ausentes15/1515/1515/15
Cálculos10/1010/1010/10
Formato10/1010/1010/10
Sin invenciones5/55/55/5
Total100/100100/100100/100

Las trampas

OR-17 tenía una ampliación presupuestaria no aprobada y un riesgo histórico sustituido; OR-21 carecía de proveedor; OR-31 conservaba una fecha objetivo solo como dato histórico; OR-38 mencionaba informalmente diciembre de 2026 sin fecha aprobada. Los tres productos conservaron los valores vigentes y usaron NO CONSTA cuando correspondía.

Qué significa —y qué no

El resultado indica que, en esta ejecución controlada, los tres productos siguieron correctamente las instrucciones y extrajeron los campos definidos. No demuestra que siempre vayan a hacerlo, ni que sean equivalentes en otros tipos de documentos. Solo hubo una ejecución por producto y el benchmark es pequeño y sintético.

Conclusión tras tres experimentos

ATALUMA no seguirá aumentando artificialmente las trampas hasta provocar un fallo. Las tres pruebas iniciales ya cubren lectura documental, contradicciones y extracción estructurada. A partir de aquí priorizamos contenido útil, transparencia metodológica y preparación técnica de la web.