Por qué los PDFs se pegan mal en un chat de IA
Copias un PDF, lo pegas en ChatGPT y sale un revoltijo. Por qué pasa (columnas, orden interno, guiones) y cómo convertirlo a Markdown limpio.
El texto que copias de un PDF sale desordenado porque un PDF no guarda párrafos: guarda instrucciones para dibujar letras en unas coordenadas. El orden en que esas instrucciones están escritas dentro del archivo no tiene por qué coincidir con el orden en que tú las lees en pantalla, así que al copiar y pegar en ChatGPT o Claude aparecen columnas entrelazadas, palabras partidas y encabezados en mitad de una frase. La solución no es pelearse con el pegado, sino extraer el contenido con una herramienta que reconstruya la estructura: convertir el PDF a Markdown cuando quieras conservar títulos y tablas, o extraer el texto plano del PDF cuando solo necesites las palabras.
Qué hay realmente dentro de un PDF
PDF nació como formato de impresión, no de intercambio de datos. Su objetivo era que una página se viera idéntica en cualquier pantalla e impresora, y para eso describe la página como un lienzo: "coloca la fuente Helvetica de 11 puntos en la posición X 72, Y 640 y dibuja estos caracteres". Repetido unas cuantas miles de veces, eso es un documento.
De esa decisión de diseño se derivan todos los problemas. En el archivo no existe el concepto de párrafo, ni de columna, ni de celda de tabla, ni de nota al pie. Existen fragmentos de texto posicionados. Cuando un visor te deja seleccionar y copiar, está haciendo una reconstrucción heurística: agrupa fragmentos que están cerca, decide dónde termina una línea y adivina el orden de lectura. A veces acierta. Con un documento maquetado a dos columnas, con tablas o con notas al margen, falla.
Los seis destrozos típicos al pegar en un chat
- Orden interno distinto del visual. Muchos generadores escriben los fragmentos en el orden en que los procesó el motor de maquetación, no de arriba a abajo. Un pie de página puede aparecer pegado antes que el primer párrafo.
- Columnas entrelazadas. Es el clásico de los papers académicos y los folletos: el extractor recorre la página por bandas horizontales y te devuelve la primera línea de la izquierda, la primera de la derecha, la segunda de la izquierda… Frases que se cruzan y no significan nada.
- Guiones de corte de línea. En texto justificado, "presupuesto" puede estar guardado como "presu-" y "puesto" en líneas distintas. Al pegarlo, el modelo lee dos palabras que no existen.
- Encabezados y pies repetidos. Cada página aporta su cabecera, su número y su aviso de confidencialidad. En un documento de 40 páginas son 120 fragmentos de ruido intercalados en mitad del contenido.
- Ligaduras y caracteres raros. Las tipografías profesionales usan ligaduras: "fi", "fl" y "ffi" son un solo glifo. Si la fuente no declara bien su correspondencia con Unicode, salen como cuadraditos o desaparecen letras. Lo mismo pasa con comillas tipográficas, guiones largos y espacios finos.
- Tablas aplanadas. Una tabla es un conjunto de textos colocados en una rejilla, sin ninguna marca que diga "esto es una celda". Al copiar se convierte en una lista de valores sueltos, y cualquier pregunta sobre esos números tiene muchas papeletas de responderse mal.
Ninguno de estos problemas es un fallo de la IA. El modelo recibe exactamente lo que le has dado: una cadena de texto rota. Si le pides que resuma un contrato cuyas cláusulas llegan entrelazadas, resumirá el revoltijo.
Por qué Markdown es el formato que mejor digieren los LLMs
Un modelo de lenguaje trabaja sobre texto lineal, y necesita señales explícitas para saber qué es un título, qué es una lista y qué es una tabla. Markdown le da esas señales con un coste mínimo: una almohadilla marca jerarquía, un guion marca elemento de lista, unas barras verticales marcan columnas. Es estructura visible en el propio texto.
Frente a las alternativas, el equilibrio es claro. El texto plano no tiene ruido pero tampoco estructura: el modelo tiene que adivinar si una línea corta es un encabezado o el final de un párrafo. El HTML sí tiene estructura, pero arrastra tanto marcado —atributos, clases, etiquetas de estilo— que gasta el presupuesto de contexto en información irrelevante. Markdown se queda con la estructura y tira el ruido. Por algo es el formato en el que los propios asistentes escriben sus respuestas.
La consecuencia práctica: cuando pegas Markdown bien formado, puedes preguntar por partes concretas —"resume solo la sección 4", "compara las filas de la tabla de precios"— y el modelo sabe a qué te refieres.
Markdown o texto plano: cuál elegir
Usa la conversión a Markdown cuando el documento tenga jerarquía que importe: informes con secciones, manuales, contratos con cláusulas numeradas, cualquier cosa con tablas. Usa la extracción a texto plano cuando solo quieras las palabras: una carta, un artículo corrido, un documento del que vas a sacar datos con expresiones regulares, o cuando vayas a alimentar un sistema que hace su propio troceado.
En ambos casos, revisa el resultado antes de pegarlo. Merece la pena mirar tres cosas: que las tablas hayan mantenido sus filas, que no queden líneas con encabezados repetidos y que las palabras cortadas se hayan recompuesto. Corregir dos o tres cosas a mano cuesta menos que descubrir a mitad de una conversación que el modelo lleva veinte mensajes razonando sobre datos rotos.
Los PDFs escaneados son otra cosa
Hay un caso en el que nada de esto funciona: el PDF escaneado. Si el documento salió de una fotocopiadora o de una foto del móvil, dentro no hay texto, hay una imagen. Puedes verlo con una prueba de dos segundos: intenta seleccionar una palabra con el ratón. Si no se selecciona nada, no hay texto que extraer.
Para esos archivos hace falta OCR (reconocimiento óptico de caracteres), un proceso distinto que analiza los píxeles e infiere qué letras hay. Las herramientas de conversión de PDF de Docuboxer no hacen OCR: solo leen el texto que ya existe en el archivo. Si tu documento es un escaneo, empieza por la guía sobre cómo extraer texto de un PDF escaneado.
Por qué importa que la conversión sea local
Los documentos que más ganas tienes de pasarle a una IA suelen ser los que menos ganas tienes de subir a ningún sitio: contratos, nóminas, informes internos, historiales. Muchos conversores online procesan en su servidor, lo que significa que el archivo completo viaja y queda, aunque sea temporalmente, en una máquina ajena.
La conversión de Docuboxer se ejecuta en tu navegador con el propio motor de renderizado de PDF: el archivo nunca se sube. Eso te deja decidir qué sale de tu equipo — puedes convertir el documento entero en local y pegar en el chat solo la sección que necesitas, en lugar de entregar las cuarenta páginas. Cuando el PDF ni siquiera hace falta entero, otra opción es dividirlo antes por páginas y convertir solo el trozo relevante.
El flujo que funciona
Resumido en cuatro pasos: comprueba que el PDF tiene texto seleccionable; conviértelo a Markdown en local; revisa títulos, tablas y guiones; pega en el chat solo la parte que necesitas, con una frase de contexto delante ("esto es el capítulo 3 de un manual de instalación"). Es medio minuto de trabajo que convierte una conversación frustrante en una útil.
Preguntas frecuentes
¿Por qué al pegar un PDF en ChatGPT se mezclan las columnas?
Porque el PDF no guarda párrafos, sino fragmentos de texto con coordenadas. El orden en que están escritos dentro del archivo no tiene por qué coincidir con el orden en que los lees en pantalla. Cuando copias, el visor recorre esos fragmentos en su orden interno, así que en un documento a dos columnas puede ir saltando de una a otra línea por línea.
¿Es mejor pegar el texto o subir el PDF directamente al chat?
Subir el archivo suele dar mejor resultado que pegar una copia manual, porque el modelo aplica su propio extractor. Pero implica enviar el documento completo al servidor del proveedor, algo que puede no ser aceptable con un contrato o una nómina. Convertir a Markdown en local y pegar solo el texto te deja controlar exactamente qué sale de tu equipo.
¿Por qué los LLMs entienden mejor Markdown que el texto plano?
Porque Markdown hace explícita la estructura con muy pocos caracteres: las almohadillas marcan jerarquía de títulos, los guiones marcan listas y las barras verticales marcan tablas. El modelo no tiene que adivinar si una línea suelta es un encabezado o un párrafo, y puede citar secciones concretas cuando le preguntas por una parte del documento.
¿Qué pasa con las palabras cortadas por guiones al final de línea?
En un PDF maquetado con justificación, palabras como «presu-» y «puesto» viven en líneas distintas. Al extraer el texto se conservan como dos trozos, y el modelo puede leerlos como dos palabras inexistentes. Un buen extractor reúne esas partes al recomponer los párrafos; si el tuyo no lo hace, revisa el resultado antes de pegarlo.
¿Funciona con PDFs escaneados?
No. Un PDF escaneado es una imagen dentro de un contenedor PDF: no contiene texto que extraer, por muy nítido que se vea. Para esos documentos hace falta OCR, un proceso distinto que reconoce las letras a partir de los píxeles. Las herramientas de extracción de texto de Docuboxer no hacen OCR.
¿El documento se sube a algún servidor al convertirlo?
No. La conversión de PDF a Markdown y a texto de Docuboxer se ejecuta íntegramente en tu navegador: el archivo nunca sale de tu equipo. Es la diferencia práctica entre poder usar la herramienta con un contrato firmado y no poder usarla.
Convierte tu PDF a Markdown limpio
Títulos, listas y tablas listos para pegar en cualquier IA. En tu navegador, sin subir el archivo.
Abrir PDF a Markdown →Herramientas relacionadas
- PDF a Markdown — Conserva títulos, listas y tablas para pegar en un chat de IA.
- Extraer texto de un PDF — Texto plano, sin marcado, cuando solo quieres las palabras.
- Dividir PDF — Quédate solo con las páginas que vas a convertir.
- Lector de PDF — Abre y revisa el documento sin instalar nada.
También te puede interesar: cómo comprimir un PDF sin perder calidad.