Docuboxer
Por Sergio Alonzo Piña··7 min de lectura

Preparar documentos para ChatGPT o Claude: tokens y contexto

Cómo saber si un documento cabe en el prompt, cuánto cuesta que el modelo lo lea y qué cambiar en el archivo antes de pegarlo.

Para preparar un documento para ChatGPT o Claude hay que comprobar dos cosas antes de pegarlo: cuántos tokens tiene y si cabe en la ventana de contexto del modelo, contando también la respuesta. Si no cabe o sale caro, se convierte a Markdown, se quita lo que sobra y se vuelve a contar. Puedes hacer los tres pasos con tu archivo en el contador de tokens y en Word a Markdown. Los dos corren en tu navegador, son gratis y no suben el documento a ningún servidor.

¿Qué es un token y cuántos tiene mi documento?

Un token es el trozo de texto con el que trabaja el modelo: una palabra corta, parte de una palabra larga, un signo o un espacio. Anthropic da una regla para inglés: un token son unos 4 caracteres, o 0,75 palabras. Eso deja 1.000 palabras en unos 1.300 tokens. En español y otros idiomas con palabras más largas y acentos, el número suele subir.

La regla sirve para una idea aproximada. Para un documento concreto conviene contar de verdad. El contador de tokens usa el tokenizador real de OpenAI (o200k_base para GPT-4o, GPT-4.1 y GPT-5), así que el valor de GPT coincide con el de tiktoken. Con Claude no se puede ser exacto sin llamar a su API: Anthropic no publica el tokenizador, y avisa de que los modelos desde Claude 4.7 generan alrededor de un 30 % más de tokens que los anteriores para el mismo texto. Por eso la herramienta muestra Claude como estimación, con «≈» y un rango. Es orientativa: en código y tablas el error puede pasar del 25 %.

¿Cabe mi documento en la ventana de contexto?

La ventana de contexto es todo lo que el modelo puede tener presente a la vez: tu documento, tus instrucciones, la conversación previa y la respuesta que genera. Estas son las ventanas de los modelos más usados, según la documentación oficial consultada el 6 de octubre de 2026:

ModeloVentana de contexto
GPT-4o128.000 tokens
GPT-5400.000 tokens
GPT-4.11.047.576 tokens
GPT-5.51.050.000 tokens
Claude Haiku 4.5200.000 tokens
Claude Sonnet 5.5, Opus 5.5 y Fable 5.11.000.000 tokens

Que quepa no significa que convenga llenarla. La propia documentación de Anthropic advierte de que más contexto no es siempre mejor: al crecer el número de tokens, la precisión y la capacidad de recuperar datos del texto se degradan. Si solo necesitas una cláusula de un contrato de 200 páginas, pegar la cláusula funciona mejor que pegar el contrato.

Si te pasas del límite, la API de Claude devuelve un error 400 con el mensaje «prompt is too long». En los chats el comportamiento depende de la aplicación, que puede recortar o indexar el archivo, y no lo ves hasta que la respuesta ignora partes del documento.

¿Cuánto cuesta que el modelo lea un documento?

El coste de entrada es una multiplicación: tokens por el precio de cada millón. Con los precios de entrada publicados el 6 de octubre de 2026, un documento de 100.000 tokens cuesta 0,25 dólares en GPT-4o (2,50 dólares por millón). En Claude Haiku 4.5 (1 dólar por millón) serían unos 0,12 dólares, contando que Claude genera más tokens que GPT para el mismo texto.

Hay un detalle con GPT-5.5: cuando el prompt pasa de 272.000 tokens, OpenAI cobra el doble de entrada para toda la sesión. Un documento de 300.000 tokens cuesta 3 dólares, no 1,50. La respuesta se factura aparte, y los precios cambian con frecuencia, así que la tabla de la herramienta enlaza a cada fuente oficial.

Por qué un PDF o un Word pesan más de lo que parece

Cuando subes un PDF a Claude, cada página se procesa como texto y como imagen. Anthropic estima entre 1.500 y 3.000 tokens de texto por página, y a eso se suman los tokens de la imagen. Un PDF de 100 páginas puede pasar de 150.000 tokens de texto antes de contar las imágenes, y la API admite como máximo 600 páginas por petición (100 si el contexto de la petición es menor de un millón).

Dos consecuencias prácticas. Si solo te interesa el texto, extraerlo y pegarlo evita pagar las imágenes: la herramienta PDF a Markdown lo hace en tu navegador, y en por qué los PDFs se pegan mal en un chat de IA está explicado qué se rompe al copiar y pegar. Y si el documento es un Word, conviene pasarlo a Markdown antes de dárselo a la IA.

Markdown frente a HTML: una medición

Una tabla de Word pegada como HTML lleva etiquetas que el modelo tiene que leer una a una. Medimos con el tokenizador o200k_base de GPT una tabla de 5 filas y 3 columnas: la cabecera (Producto, Cantidad, Precio) y cuatro filas de datos (Café, 2, 45.50; Té, 10, 20; Pan, 3, 8; Leche, 6, 30). Cada fila iba en una línea, sin sangrías en el Markdown y con dos espacios de sangría en el HTML:

  • En HTML (<table>, <tr>, <th>, <td>): 128 tokens.
  • En Markdown (barras verticales y una fila separadora): 54 tokens.
  • Con tabuladores: 34 tokens.

Un bloque de cinco líneas (el título «Informe», un párrafo «Resumen con negrita.» con la palabra en negrita y una lista de dos elementos, «Uno» y «Dos») dio 40 tokens en HTML (<h1>, <p>, <strong>, <ul>, <li>) y 16 en Markdown. Son muestras pequeñas, no un promedio de documentos reales, pero la diferencia se repite porque las etiquetas HTML consumen tokens y el Markdown las sustituye por un par de símbolos. Markdown conserva además los títulos, las listas y las tablas, que es lo que ayuda al modelo a orientarse.

La herramienta Word a Markdown convierte encabezados en #, listas en viñetas, tablas en tablas GFM y conserva los enlaces. Puedes omitir las imágenes, incrustarlas o llevártelas en un ZIP, y al final te dice cuántos tokens tiene el resultado.

Paso a paso: del archivo al prompt

  1. Cuenta los tokens del documento original en el contador de tokens y mira el porcentaje de ventana de cada modelo.
  2. Convierte el archivo: un .docx pasa por Word a Markdown y un PDF con texto, por PDF a Markdown. Un PDF escaneado no tiene texto que extraer y necesita OCR. Ten en cuenta que el contador, con un PDF, cuenta solo el texto extraído: no hace OCR ni cuenta los tokens de las imágenes.
  3. Quita lo que el modelo no necesita: portadas, índices, avisos legales repetidos y firmas.
  4. Si sigue sin caber, divide el documento por encabezados y pregunta parte por parte, o pide primero un resumen de cada sección.
  5. Vuelve a contar. Deja espacio para la respuesta, porque cuenta dentro de la misma ventana.
  6. Antes de pegar nada con datos personales, decide qué sobra. Contar y convertir en tu navegador no expone el archivo, pero lo que pegues en un chat sí llega al proveedor.

Preguntas frecuentes

¿Cuántos tokens tiene una página de texto?

Una página con unas 500 palabras en inglés ronda los 650 tokens, y en español algo más. Un PDF subido a Claude cuenta entre 1.500 y 3.000 tokens de texto por página, además de la imagen de cada página, así que el mismo contenido sale más caro como PDF que como texto.

¿Qué pasa si mi documento no cabe en la ventana de contexto?

En la API de Claude se rechaza la petición con un error 400. En un chat, la aplicación puede recortar o indexar el archivo y la respuesta ignora partes. Recorta, divide por secciones o elige un modelo con ventana mayor.

¿Markdown reduce de verdad los tokens?

En nuestra medición, una tabla pasó de 128 tokens en HTML a 54 en Markdown. El ahorro depende del documento, y el modo más seguro de saberlo es contar el resultado, que la herramienta hace por ti.

¿El contador de tokens de Claude es exacto?

No. Anthropic no publica su tokenizador y el conteo exacto requiere llamar a su API con una clave. Docuboxer estima a partir del conteo de GPT y lo marca con «≈». Los modelos desde Claude 4.7 generan alrededor de un 30 % más de tokens que los anteriores.

¿Se sube mi documento a algún servidor al contar o convertir?

No. El conteo y la conversión se hacen en tu navegador, sin subir el archivo. Lo que sí sale de tu equipo es lo que pegues después en el chat de la IA.

Cuenta los tokens de tu documento

Pega el texto o sube un .docx o un PDF y compara ventana de contexto y coste de cada modelo. Gratis y sin salir de tu navegador.

Abrir Contador de tokens →

Herramientas relacionadas