Qué medimos
EXP-03 evaluó extracción exacta y seguimiento de instrucciones, no capacidad de resumen. El documento contenía cinco fichas con datos vigentes, históricos, provisionales y ausentes.
Resultados
| Criterio | ChatGPT Plus | Claude Sonnet 5 | Gemini Flash |
|---|---|---|---|
| Campos correctos | 40/40 | 40/40 | 40/40 |
| Vigentes vs. históricos/provisionales | 20/20 | 20/20 | 20/20 |
| Campos ausentes | 15/15 | 15/15 | 15/15 |
| Cálculos | 10/10 | 10/10 | 10/10 |
| Formato | 10/10 | 10/10 | 10/10 |
| Sin invenciones | 5/5 | 5/5 | 5/5 |
| Total | 100/100 | 100/100 | 100/100 |
Las trampas
OR-17 tenía una ampliación presupuestaria no aprobada y un riesgo histórico sustituido; OR-21 carecía de proveedor; OR-31 conservaba una fecha objetivo solo como dato histórico; OR-38 mencionaba informalmente diciembre de 2026 sin fecha aprobada. Los tres productos conservaron los valores vigentes y usaron NO CONSTA cuando correspondía.
Qué significa —y qué no
El resultado indica que, en esta ejecución controlada, los tres productos siguieron correctamente las instrucciones y extrajeron los campos definidos. No demuestra que siempre vayan a hacerlo, ni que sean equivalentes en otros tipos de documentos. Solo hubo una ejecución por producto y el benchmark es pequeño y sintético.
Conclusión tras tres experimentos
ATALUMA no seguirá aumentando artificialmente las trampas hasta provocar un fallo. Las tres pruebas iniciales ya cubren lectura documental, contradicciones y extracción estructurada. A partir de aquí priorizamos contenido útil, transparencia metodológica y preparación técnica de la web.