LABORATORIO ATALUMA

Experimentos propios con IA

Probamos ChatGPT, Claude y Gemini con tareas iguales, una metodología visible y resultados separados por experimento.

Estado del laboratorio

3 experimentos completados. No buscamos forzar un ganador: cada prueba mide una habilidad concreta.

EXPERIMENTO 01

PDF-01 · Lectura documental básica

Completado

Qué medimos: capacidad para resumir un PDF, extraer cifras, reconocer limitaciones metodológicas y evitar inventar un dato que no aparece.

Resultado: ChatGPT 100/100 · Claude 100/100 · Gemini 95/100.

La diferencia de Gemini fue de cobertura según la rúbrica, no un error factual grave.

EXPERIMENTO 02

PDF-02 · Contradicciones, redondeos y metodología

Completado

Qué medimos: si el modelo detecta una contradicción interna, usa valores no redondeados, prioriza metodología final frente a provisional y distingue puntos porcentuales de porcentaje relativo.

Resultado: ChatGPT 100/100 · Claude 100/100 · Gemini 100/100.

Los tres detectaron correctamente la discrepancia 4/6 vs 3/6 y no inventaron el dato ausente.

EXPERIMENTO 03

EXP-03 · Extracción estructurada

Completado

Qué medimos: extracción exacta de datos, respeto por valores vigentes, campos ausentes, cálculos simples y seguimiento de un formato obligatorio.

Resultado: ChatGPT 100/100 · Claude 100/100 · Gemini 100/100.

Los tres evitaron usar datos históricos o provisionales y no rellenaron campos ausentes por intuición.

Cómo interpretar estas pruebas

Misma tarea

Usamos el mismo documento y las mismas instrucciones dentro de cada experimento.

Rúbrica previa

Los criterios se fijan antes de evaluar las respuestas.

Conclusiones limitadas

Una prueba concreta no demuestra cuál es la “mejor IA” para todo.

Ver cómo probamos →

0 seleccionadas
Máximo 3