Cómo probamos herramientas de IA en ATALUMA
Queremos que una comparación sea comprensible y reproducible. Por eso separamos documentación oficial, pruebas editoriales y conclusiones.
1. Definimos una tarea concreta
No probamos “qué IA es mejor” en abstracto. Elegimos una capacidad concreta —por ejemplo, leer un PDF, detectar una contradicción o extraer datos estructurados— y definimos qué esperamos medir.
2. Igualamos las condiciones
Dentro de un mismo experimento utilizamos el mismo material, las mismas instrucciones y criterios equivalentes. Si una diferencia de plan, versión o función puede afectar al resultado, debe quedar indicada.
3. Fijamos la rúbrica antes de puntuar
Los criterios relevantes se deciden antes de revisar la respuesta final. Esto reduce el riesgo de adaptar la puntuación al resultado que “parece mejor”.
4. Conservamos evidencia
Los experimentos publicados enlazan protocolo y resultados. Cuando utilizamos documentos ficticios para una prueba, lo decimos expresamente para que el lector no confunda los datos de test con hechos reales.
5. Separamos exactitud, cobertura y formato
Una respuesta puede ser correcta pero incompleta; otra puede cubrir más puntos pero cometer una invención. Cuando la prueba lo requiere, esos errores no pesan igual.
6. No forzamos un ganador
Un empate es un resultado válido. Una diferencia pequeña en una tarea tampoco demuestra que una herramienta sea superior en todos los usos.
7. Reconocemos variabilidad y límites
Los modelos cambian, pueden responder de forma distinta entre ejecuciones y sus funciones dependen de plan, región o fecha. Las conclusiones se limitan a las condiciones observadas.
8. Actualizamos cuando cambia lo importante
Las fichas documentales incluyen fecha de revisión cuando resulta útil. Los experimentos históricos se conservan como fotografía de una prueba concreta y no se reescriben para fingir que se realizaron con una versión posterior.
Qué significan nuestras etiquetas
Ficha documental verificada: información contrastada con fuentes del proveedor, pero no necesariamente probada por ATALUMA.
Prueba editorial propia: ATALUMA ha ejecutado una tarea definida y documenta sus resultados y limitaciones.
Pendiente de prueba editorial propia: conocemos y documentamos la herramienta, pero no presentamos experiencia de uso como si ya existiera.