Resultado

ChatGPT Plus, Claude Sonnet 5 y Gemini Flash: 100/100 según la rúbrica cerrada antes de ejecutar la prueba.

Qué medimos

EXP-03 evaluó extracción exacta y seguimiento de instrucciones, no capacidad de resumen. El documento contenía cinco fichas con datos vigentes, históricos, provisionales y ausentes.

Resultados

CriterioChatGPT PlusClaude Sonnet 5Gemini Flash
Campos correctos40/4040/4040/40
Vigentes vs. históricos/provisionales20/2020/2020/20
Campos ausentes15/1515/1515/15
Cálculos10/1010/1010/10
Formato10/1010/1010/10
Sin invenciones5/55/55/5
Total100/100100/100100/100

Las trampas

OR-17 tenía una ampliación presupuestaria no aprobada y un riesgo histórico sustituido; OR-21 carecía de proveedor; OR-31 conservaba una fecha objetivo solo como dato histórico; OR-38 mencionaba informalmente diciembre de 2026 sin fecha aprobada. Los tres productos conservaron los valores vigentes y usaron NO CONSTA cuando correspondía.

Qué significa —y qué no

El resultado indica que, en esta ejecución controlada, los tres productos siguieron correctamente las instrucciones y extrajeron los campos definidos. No demuestra que siempre vayan a hacerlo, ni que sean equivalentes en otros tipos de documentos. Solo hubo una ejecución por producto y el benchmark es pequeño y sintético.

Conclusión tras tres experimentos

ATALUMA no seguirá aumentando artificialmente las trampas hasta provocar un fallo. Las tres pruebas iniciales ya cubren lectura documental, contradicciones y extracción estructurada. A partir de aquí priorizamos contenido útil, transparencia metodológica y preparación técnica de la web.