Cómo pasar un PDF a texto listo para una IA

Subes un PDF al chat, esperas, y la respuesta llega floja, incompleta o directamente con un aviso de que el archivo no se puede leer. No es que el asistente sea torpe, es que el formato juega en contra. Un PDF describe el aspecto de cada página, no su orden de lectura, y buena parte del esfuerzo del modelo se va en reconstruir lo que tú ya ves con claridad. Esta guía explica por qué el texto plano funciona mejor, cómo convertir el documento sin estropear el orden y qué conviene limpiar antes de pegarlo.

Por qué el PDF se le atraganta a la IA

Un PDF guarda instrucciones de dibujo y coloca cada letra en una coordenada, sin decir en qué orden se lee nada de eso. Al extraer el texto, las columnas se entrelazan, las tablas se deshacen y los encabezados y pies se cuelan en mitad de los párrafos. Si el PDF viene de un escaneo, ni siquiera hay texto que extraer, hay una foto de cada página que exige OCR, el reconocimiento óptico que convierte la imagen en letras. Y aunque todo salga bien, el archivo cuenta contra los límites de subida del servicio y arrastra páginas enteras que no tienen que ver con tu pregunta.

Los tokens son la otra cara. Los asistentes miden el trabajo en tokens, y una regla rápida es que unos cuatro caracteres de texto vienen a ser un token. Un contrato de doce páginas se va con facilidad a los diez mil, y la mayoría no aporta nada a una consulta concreta. Menos texto es menos coste, más hueco de contexto para tu pregunta y, casi siempre, una respuesta más centrada.

Texto plano o Markdown, el formato que sí entiende

El texto plano elimina el problema de raíz, porque lo que pegas es exactamente lo que el modelo recibe, sin capas invisibles, sin metadatos y sin orden que adivinar. El Markdown añade estructura casi gratis, con títulos y listas que ayudan al modelo a orientarse por el documento igual que te ayudan a ti. Además puedes recortar, quedarte con el capítulo que importa y pegar solo eso, algo que con un archivo adjunto no es tan directo.

Qué limpiar antes de pegar

Tres cosas dan la mayor parte del beneficio. La primera, las repeticiones de página, es decir encabezados, pies y numeración que en papel orientan y en un texto corrido solo ensucian. La segunda, el relleno que no afecta a tu consulta, como anexos o cláusulas tipo, siempre que la pregunta no vaya de eso. Y la tercera, los datos personales, los tuyos y los de terceros, porque casi ninguna consulta los necesita. El método para sustituirlos sin que el texto pierda sentido lo contamos en la guía sobre subir documentos con datos a ChatGPT.

Cómo lo hace Ofusca

En Ofusca el documento no se sube a ningún servidor, y «Exportar para IA» convierte el PDF en Markdown en un solo paso. El texto sale de la capa del propio PDF o, si es un escaneo, del OCR local, cada página va bajo su propio encabezado cuando el documento tiene varias, y el diálogo muestra una estimación orientativa de tokens para que sepas cuánto vas a pegar antes de hacerlo. La vista previa es editable, así que puedes recortar lo que sobre antes de copiar o descargar el archivo. Y como el paso se hace censurando, lo tapado viaja como marcadores numerados en lugar de datos, con la opción de recuperarlos después en la respuesta del asistente.

Errores frecuentes al pasar un PDF a una IA

Preguntas frecuentes

¿Por qué la IA responde mejor si pego el texto en vez del PDF?

Porque recibe el contenido en el orden correcto y sin capas invisibles, y porque el texto justo deja más hueco de contexto para tu pregunta. Un PDF obliga al modelo a reconstruir la lectura de cada página, y en ese proceso las columnas y las tablas se degradan con facilidad.

¿Cuántos tokens ocupa mi documento?

Una regla rápida es dividir los caracteres entre cuatro. Es una estimación orientativa, cada modelo trocea a su manera y el español suele salir algo más caro que el inglés, pero sirve para comparar. Ofusca muestra ese cálculo antes de copiar o descargar el texto.

¿Y si mi PDF es un documento escaneado?

Un escaneo no tiene capa de texto, así que primero hace falta OCR. Ofusca lo ejecuta en tu navegador, sin subir el documento a ningún servidor, y el resultado sale en el mismo Markdown que con un PDF normal.

¿Markdown o texto plano a secas?

Para un fragmento corto da igual. En documentos largos el Markdown compensa, porque los títulos y las listas le dan al modelo un mapa del documento casi sin gastar tokens de más, y ese mapa se nota en la calidad de los resúmenes y las búsquedas dentro del texto.

Publicada el 6 de agosto de 2026.