En pocas palabras
- Un PDF puede contener texto real, páginas como imágenes o una capa OCR defectuosa.
- Prueba a seleccionar, copiar y buscar una frase antes de analizarlo.
- Valida números, símbolos, columnas, tablas y notas contra la imagen original.
- Separa reconocimiento, revisión y análisis para saber dónde aparece el error.
Tres tipos de PDF que pueden parecer iguales
PDF con texto real
Suele proceder de Word, un editor o una publicación digital. Permite seleccionar, copiar y buscar texto, aunque el orden de lectura todavía puede fallar en columnas o diseños complejos.
Escaneo sin OCR
Cada página es una imagen. Visualmente contiene letras, pero el archivo no ofrece caracteres que una herramienta pueda extraer como texto. Necesita reconocimiento óptico de caracteres o un análisis visual compatible.
PDF con OCR defectuoso
Tiene una capa de texto, pero no coincide completamente con la imagen. Puede confundir caracteres, alterar el orden de columnas o perder signos. El asistente puede razonar correctamente sobre una transcripción que ya llegó dañada.
Cómo diagnosticar el archivo en pocos minutos
- Selecciona una frase en una página intermedia.
- Cópiala en un editor de texto y compárala con la imagen.
- Busca una palabra visible mediante el buscador del lector.
- Prueba una página con tabla, columnas o notas.
- Repite la comprobación en varias páginas: algunos PDF son mixtos.
Si no puedes seleccionar nada, probablemente sea un escaneo. Si el texto copiado aparece vacío, desordenado o con caracteres incorrectos, la capa OCR necesita revisión.
Por qué puede fallar el OCR
Números y símbolos
Revisa especialmente 0/O, 1/I/l, comas y puntos decimales, signos negativos, porcentajes, fórmulas y símbolos matemáticos. Un solo carácter puede cambiar una cifra o una condición.
Columnas y orden de lectura
Periódicos, documentos académicos y boletines pueden intercalar líneas de columnas diferentes. El resultado produce frases que nunca existieron aunque todas sus palabras aparezcan en la página.
Tablas, notas y gráficos
Las tablas pueden perder encabezados, unidades o asociación entre filas y columnas. Las notas al pie pueden aparecer fuera de contexto. Que un producto admita PDF no garantiza que interprete todos los elementos visuales del mismo modo.
Qué hacer según el tipo de PDF
Texto real
Analízalo directamente, pero comprueba estructura, tablas y una muestra de datos.
Escaneo sin OCR
Corrige orientación y calidad de imagen, aplica OCR cuando proceda y conserva el original. No pidas resumen antes de comprobar la transcripción.
OCR defectuoso
Crea una copia accesible con OCR de mejor calidad o corrige los pasajes críticos. Divide el documento por secciones lógicas si el diseño dificulta el orden de lectura.
Cómo comprobar que el contenido se leyó correctamente
Selecciona cinco datos repartidos por el documento: un nombre, una cifra, una frase, un elemento de tabla y una nota o símbolo. Pide que los localice y compara la salida con la imagen original. Si falla en información sencilla, no aumentes tu confianza para tareas más complejas.
Cuando necesites resumir, hazlo solo después de validar la entrada y utiliza el método de resumen verificable de PDF. Para datos estructurados, sigue la guía de extracción sin completar valores ausentes.
Ejemplo ficticio: tres PDF y tres diagnósticos
Este ejemplo es ficticio y no representa una prueba de ATALUMA.
- Archivo A: exportado desde Word. Permite seleccionar texto, buscar términos y copiar una tabla sencilla. Diagnóstico: texto real; revisar únicamente estructura y datos críticos.
- Archivo B: fotografías de diez páginas. No permite seleccionar ni buscar palabras. Diagnóstico: escaneo sin OCR; reconocer primero el texto y conservar las imágenes originales.
- Archivo C: boletín antiguo con OCR. Se puede copiar texto, pero «10,5 %» aparece como «I0.5 %» y las columnas se mezclan. Diagnóstico: OCR defectuoso; corregir cifras y orden antes del análisis.
Errores frecuentes
- Asumir que texto visible equivale a texto extraíble.
- Aplicar OCR y confiar en toda la salida sin muestreo.
- Pedir reconocimiento, interpretación y resumen en una sola operación.
- Ignorar columnas, gráficos, tablas, notas al pie y páginas giradas.
- Descartar el escaneo original después de crear una copia OCR.
- Atribuir al razonamiento de la IA un error que ya estaba en la entrada.
Checklist final y conclusión
- He identificado si existe una capa de texto.
- He comparado una muestra con la imagen original.
- He revisado números, símbolos, tablas y columnas.
- He separado OCR, corrección y análisis.
- Conservo el archivo original para resolver discrepancias.
La primera pregunta no es qué herramienta resume mejor, sino qué información recibe realmente. Cuando la entrada sea fiable, podrás hacer preguntas verificables al documento o aplicar el flujo de resumen correspondiente.