PDF Y DATOS

Cómo extraer tablas y datos de un PDF con IA sin inventar campos

Un proceso verificable para convertir información documental en tablas, CSV o JSON sin rellenar silenciosamente los huecos.

Extraer datos no consiste en pedir un resumen. El objetivo es trasladar valores concretos desde un documento hasta una estructura definida, conservando su significado, unidad, periodo y procedencia.

El principal riesgo no siempre es una cifra claramente falsa. También puede haber columnas desplazadas, valores históricos presentados como actuales, celdas vacías convertidas en cero o campos completados mediante una inferencia plausible.

La solución es preparar el esquema antes de procesar el archivo, exigir una salida explícita para los datos ausentes y revisar cada campo importante contra el PDF original.

En pocas palabras

  • Comprueba primero si el PDF contiene texto, imágenes o una combinación de ambos.
  • Define campos, formatos y unidades antes de ver la respuesta.
  • Ordena escribir “no consta” cuando el dato no aparezca.
  • Conserva página, tabla o fragmento de respaldo.
  • Verifica cifras, periodos y columnas antes de exportar.

Por qué extraer datos es más difícil que resumir

Un resumen admite cierta reorganización. Una extracción exige correspondencia campo por campo. Si el documento dice “ingresos de 2025: 2,4 millones”, la salida debe conservar el periodo, la unidad y la escala. Escribir simplemente “2,4” destruye información necesaria.

Tablas reales, texto visual y columnas

Algunos PDF contienen una tabla estructurada; otros solo colocan palabras y cifras en determinadas coordenadas. Para una persona ambos pueden parecer iguales, pero el orden de lectura interno puede mezclar encabezados, filas o notas al pie.

Las tablas con celdas combinadas, varias páginas o encabezados repetidos necesitan especial atención. Antes de automatizar muchas filas, comprueba manualmente una muestra que incluya casos fáciles y difíciles.

Valores ausentes, históricos o contradictorios

Una celda vacía no significa necesariamente cero. Puede representar “no aplica”, “sin datos”, un valor pendiente o una categoría explicada en una nota. Del mismo modo, un informe puede incluir previsiones, resultados anteriores y cifras revisadas.

El esquema debe impedir que la salida mezcle esos estados. Si existen dos valores incompatibles, conserva ambos con su etiqueta y registra la contradicción; no elijas uno sin criterio documental.

PDF escaneado frente a texto seleccionable

Cuando el archivo es una imagen, interviene el reconocimiento óptico de caracteres. Una confusión entre 0 y O, 1 y l, comas y puntos puede cambiar el dato. La guía sobre PDF escaneado frente a PDF con texto explica cómo detectar este problema antes de continuar.

Prepara el esquema antes de procesar el PDF

Define la tabla de salida sin mirar una respuesta generada. Esto reduce la tentación de adaptar los criterios a lo que la herramienta haya producido.

ElementoQué debes definir
CampoNombre inequívoco y significado.
FormatoTexto, fecha, número, porcentaje o lista.
UnidadEuros, miles, millones, horas o porcentaje.
PeriodoAño, trimestre, fecha de corte o vigencia.
AusenciaValor fijo como “no consta”; nunca completar por intuición.
EvidenciaPágina, tabla, apartado o fragmento que permita verificar.

Añade reglas para casos ambiguos. Por ejemplo: “No calcules valores derivados salvo que exista una columna específica”, “conserva el texto original de las notas” o “si hay más de un valor para el mismo periodo, registra ambos”.

Proceso para extraer los datos

  1. Comprueba el archivo. Intenta seleccionar y buscar texto. Revisa orientación, columnas, anexos y tablas escaneadas.
  2. Delimita el alcance. Indica páginas, apartados y periodos. Evita procesar contenido irrelevante si puede confundirse con los datos objetivo.
  3. Entrega el esquema cerrado. Define columnas, tipos, unidades y orden antes de solicitar la extracción.
  4. Establece la regla de ausencia. Pide “no consta” si el dato no aparece de forma explícita y prohíbe estimarlo.
  5. Exige trazabilidad. Añade una columna de página o evidencia breve para cada fila.
  6. Separa extracción y cálculo. Primero copia los valores; después, en otra fase, realiza cálculos documentados.
  7. Revisa una muestra. Incluye valores grandes, negativos, porcentajes, notas y casos ausentes.
  8. Exporta después de validar. No conviertas a CSV o JSON definitivo hasta resolver desplazamientos y ambigüedades.

En documentos largos puede ser útil trabajar por bloques y unir las salidas después. Mantén el mismo esquema en todos los bloques y comprueba que una tabla dividida entre páginas no genere dos registros diferentes.

Cómo pedir una salida que se pueda comprobar

Tabla legible

Es adecuada para la primera revisión humana. Incluye campos de evidencia y observaciones. Evita tablas tan anchas que oculten unidades o contexto.

CSV o JSON

Son útiles para procesar resultados, pero su apariencia ordenada puede dar una falsa sensación de exactitud. Define cómo escapar comas, representar valores nulos y conservar texto con saltos de línea. Valida primero el contenido, después la sintaxis.

Una instrucción reutilizable

Puedes pedir: “Extrae únicamente los campos definidos. No deduzcas valores. Escribe ‘no consta’ cuando no haya evidencia explícita. Conserva unidad y periodo. Añade la página y un fragmento breve de respaldo. Si dos valores se contradicen, registra ambos en observaciones”.

La instrucción ayuda a fijar el contrato de salida, pero no sustituye la revisión. Las capacidades para leer archivos pueden variar según producto, formato y configuración.

Diseña también una muestra de validación antes de procesar el conjunto completo. Incluye una fila ordinaria, una con valor ausente, otra con nota al pie y una cifra con unidad o signo. Si el documento contiene varias clases de tabla, selecciona al menos un caso de cada estructura.

Compara celda por celda la muestra con el PDF. Registra el tipo de fallo: OCR, columna incorrecta, unidad perdida, periodo equivocado, cálculo no solicitado o formato inválido. Esta clasificación permite corregir el punto del flujo que falla en lugar de repetir la misma instrucción sin diagnóstico.

Cuando varias personas revisen el resultado, define una convención común. Por ejemplo, una persona puede validar contenido y otra el archivo exportado. Evita que una corrección de formato cambie decimales, fechas o valores nulos después de haber comprobado la extracción.

Conserva también una versión intermedia antes de limpiar la presentación. Así podrás distinguir un error de lectura del PDF de un cambio introducido al ordenar, convertir o importar los datos en otra aplicación.

Ejemplo práctico: un informe ficticio

Ejemplo ficticio: un informe de una asociación contiene miembros al cierre de 2024, presupuesto aprobado para 2025 y gasto real del primer trimestre. En una nota se aclara que una cifra está expresada en miles de euros.

El esquema solicitado contiene: concepto, valor, unidad, periodo, estado, página y observaciones. “Miembros” se registra con el periodo 2024; “presupuesto” se etiqueta como aprobado, no ejecutado; el gasto se conserva como dato trimestral. Si el informe no indica el gasto anual, ese campo recibe “no consta”.

Un error sería sumar o anualizar el trimestre sin que se haya solicitado y presentar la estimación como dato del informe. Si se necesita una proyección, debe hacerse después, en una columna separada, con fórmula y supuesto visibles.

Este ejemplo no representa el resultado de una herramienta real. Muestra cómo un esquema evita mezclar naturaleza, periodo y procedencia.

Qué aporta EXP-03 y cuáles son sus límites

En EXP-03, ATALUMA publicó antes de la prueba una rúbrica para distinguir datos vigentes, históricos, ausentes y cálculos con formato obligatorio. Los resultados de EXP-03 corresponden al documento, instrucciones, herramientas y condiciones registradas en ese experimento.

La prueba muestra la utilidad de cerrar la rúbrica y definir el tratamiento de datos ausentes. No demuestra que las mismas herramientas extraigan sin errores cualquier PDF, tabla, idioma o documento escaneado. Cambiar el archivo o el formato puede cambiar el resultado.

Si vas a repetir el proceso con muchos documentos, realiza una validación nueva cuando cambie la plantilla, el idioma, la calidad del escaneo o el sistema utilizado. Una muestra correcta de un formato no valida automáticamente los demás.

Errores frecuentes

  • Definir las columnas después de ver la primera salida.
  • Tratar una celda vacía como cero.
  • Perder unidades, signos o escala.
  • Mezclar datos vigentes, históricos y previstos.
  • Ignorar notas al pie y encabezados repetidos.
  • Aceptar cálculos que no aparecen en el documento.
  • Exportar cientos de filas antes de revisar una muestra.
  • No conservar página o fragmento de evidencia.
  • Subir documentos sensibles sin revisar permisos y condiciones.

Checklist final

  • ¿El PDF tiene texto utilizable o necesita OCR?
  • ¿Los campos y formatos estaban definidos antes de la extracción?
  • ¿Cada cifra conserva unidad, signo, periodo y escala?
  • ¿Los valores ausentes aparecen como “no consta”?
  • ¿Se han separado datos copiados y cálculos derivados?
  • ¿Cada registro importante tiene página o evidencia?
  • ¿He revisado filas difíciles y una muestra suficiente?
  • ¿Las contradicciones permanecen visibles?
  • ¿He revisado la privacidad del documento?

Conclusión

Una extracción fiable empieza antes de abrir la herramienta: define qué campos necesitas, cómo representarás la ausencia y qué evidencia conservarás. La estructura reduce ambigüedad; la revisión contra el PDF evita que una salida ordenada se confunda con una salida correcta.

Si tu objetivo es comprender el documento antes de estructurarlo, empieza por cómo resumir un PDF o cómo formular preguntas verificables. Antes de cargar material sensible, revisa también la guía de privacidad al subir archivos.

0 seleccionadas
Máximo 3