Metodología

Cómo probamos herramientas de IA en ATALUMA

Queremos que una comparación sea comprensible y reproducible. Por eso separamos documentación oficial, pruebas editoriales y conclusiones.

1. Definimos una tarea concreta

No probamos “qué IA es mejor” en abstracto. Elegimos una capacidad concreta —por ejemplo, leer un PDF, detectar una contradicción o extraer datos estructurados— y definimos qué esperamos medir.

2. Igualamos las condiciones

Dentro de un mismo experimento utilizamos el mismo material, las mismas instrucciones y criterios equivalentes. Si una diferencia de plan, versión o función puede afectar al resultado, debe quedar indicada.

3. Fijamos la rúbrica antes de puntuar

Los criterios relevantes se deciden antes de revisar la respuesta final. Esto reduce el riesgo de adaptar la puntuación al resultado que “parece mejor”.

4. Conservamos evidencia

Los experimentos publicados enlazan protocolo y resultados. Cuando utilizamos documentos ficticios para una prueba, lo decimos expresamente para que el lector no confunda los datos de test con hechos reales.

5. Separamos exactitud, cobertura y formato

Una respuesta puede ser correcta pero incompleta; otra puede cubrir más puntos pero cometer una invención. Cuando la prueba lo requiere, esos errores no pesan igual.

6. No forzamos un ganador

Un empate es un resultado válido. Una diferencia pequeña en una tarea tampoco demuestra que una herramienta sea superior en todos los usos.

7. Reconocemos variabilidad y límites

Los modelos cambian, pueden responder de forma distinta entre ejecuciones y sus funciones dependen de plan, región o fecha. Las conclusiones se limitan a las condiciones observadas.

8. Actualizamos cuando cambia lo importante

Las fichas documentales incluyen fecha de revisión cuando resulta útil. Los experimentos históricos se conservan como fotografía de una prueba concreta y no se reescriben para fingir que se realizaron con una versión posterior.

Qué significan nuestras etiquetas

Ficha documental verificada: información contrastada con fuentes del proveedor, pero no necesariamente probada por ATALUMA.

Prueba editorial propia: ATALUMA ha ejecutado una tarea definida y documenta sus resultados y limitaciones.

Pendiente de prueba editorial propia: conocemos y documentamos la herramienta, pero no presentamos experiencia de uso como si ya existiera.

Ver experimentos reales →

0 seleccionadas
Máximo 3