Cómo pasar un PDF a texto listo para una IA
Para pasar un PDF a texto listo para una IA, extrae el contenido a Markdown y revisa el orden de lectura antes de pegarlo. Un PDF describe el aspecto de cada página y no en qué orden se lee, así que las columnas y las tablas se deshacen con facilidad.
- Lectura
- 4 min
- Publicada
- Actualizada
Subes un PDF al chat, esperas, y la respuesta llega floja, incompleta o directamente con un aviso de que el archivo no se puede leer. No es que el asistente sea torpe, es que el formato juega en contra, y buena parte del esfuerzo del modelo se va en reconstruir lo que tú ya ves con claridad. Esta guía explica por qué el texto plano funciona mejor, cómo convertir el documento sin estropear el orden y qué conviene limpiar antes de pegarlo.
Por qué el PDF se le atraganta a la IA
Un PDF guarda instrucciones de dibujo y coloca cada letra en una coordenada, sin decir en qué orden se lee nada de eso. Al extraer el texto, las columnas se entrelazan, las tablas se deshacen y los encabezados y pies se cuelan en mitad de los párrafos. Si el PDF viene de un escaneo, ni siquiera hay texto que extraer, hay una foto de cada página que exige OCR, el reconocimiento óptico que convierte la imagen en letras. Y aunque todo salga bien, el archivo cuenta contra los límites de subida del servicio y arrastra páginas enteras que no tienen que ver con tu pregunta.
Los tokens son la otra cara. Los asistentes miden el trabajo en tokens, y una regla rápida es que unos cuatro caracteres de texto vienen a ser un token. Un contrato de doce páginas se va con facilidad a los diez mil, y la mayoría no aporta nada a una consulta concreta. Menos texto es menos coste, más hueco de contexto para tu pregunta y, casi siempre, una respuesta más centrada.
Texto plano o Markdown, el formato que sí entiende
El texto plano elimina el problema de raíz, porque lo que pegas es exactamente lo que el modelo recibe, sin capas invisibles, sin metadatos y sin orden que adivinar. El Markdown añade estructura casi gratis, con títulos y listas que ayudan al modelo a orientarse por el documento igual que te ayudan a ti. Además puedes recortar, quedarte con el capítulo que importa y pegar solo eso, algo que con un archivo adjunto no es tan directo.
Qué limpiar antes de pegar
Tres cosas dan la mayor parte del beneficio. La primera, las repeticiones de página, es decir encabezados, pies y numeración que en papel orientan y en un texto corrido solo ensucian. La segunda, el relleno que no afecta a tu consulta, como anexos o cláusulas tipo, siempre que la pregunta no vaya de eso. Y la tercera, los datos personales, los tuyos y los de terceros, porque casi ninguna consulta los necesita. El método para sustituirlos sin que el texto pierda sentido lo contamos en la guía sobre subir documentos con datos a ChatGPT.
Nada de esto pide una herramienta concreta. Un PDF con capa de texto se deja copiar y pegar en cualquier editor, y desde ahí se limpian los encabezados repetidos y se sustituyen los datos con un buscar y reemplazar. Lo que no se resuelve así es un escaneo, que sin OCR no tiene texto que copiar.
Cómo lo hace Ofusca
En Ofusca el documento no se sube a ningún servidor, y «Exportar para IA» convierte el PDF en Markdown en un solo paso. El texto sale de la capa del propio PDF o, si es un escaneo, del OCR local, cada página va bajo su propio encabezado cuando el documento tiene varias, y el diálogo muestra una estimación orientativa de tokens para que sepas cuánto vas a pegar antes de hacerlo. La vista previa es editable, así que puedes recortar lo que sobre antes de copiar o descargar el archivo. Y como el paso se hace censurando, lo tapado viaja como marcadores numerados en lugar de datos, con la opción de recuperarlos después en la respuesta del asistente.
Una vez tienes el texto extraído, la herramienta para detectar datos personales en un texto reconoce los DNI, los teléfonos y las cuentas que lleva y los sustituye por marcadores antes de pegarlo, sin subir nada.
Y antes de pegar el resultado, la herramienta para comprobar un texto antes de pegarlo en una IA te dice qué lleva todavía, con un nivel de riesgo.
Errores frecuentes al pasar un PDF a una IA
- Subir el archivo porque es lo más rápido. Lo cómodo se paga en tokens y en calidad de respuesta. Pegar el texto justo suele mejorar las dos cosas.
- No repasar el orden tras la extracción. Las columnas y las tablas son los puntos débiles. Un vistazo de veinte segundos evita que el modelo razone sobre frases entrelazadas.
- Olvidar que un escaneo no tiene texto. Sin OCR no hay nada que pegar. Si el PDF es una foto de papel, conviértelo antes o usa una herramienta que lo haga por ti.
- Limpiar el formato y dejar los datos. El DNI y el IBAN no ayudan a resumir mejor. Sustituirlos por marcadores mantiene el sentido sin regalar identidades.
Dudas habituales
Preguntas frecuentes
¿Qué aporta pegar texto en vez del PDF?
Puede reducir contenido accesorio y facilitar la revisión previa. El resultado depende de la estructura del archivo, por lo que conviene comprobar columnas, tablas, encabezados y orden de lectura.
¿Cómo se estima el tamaño del texto?
La estimación de caracteres entre cuatro sirve como referencia aproximada. Cada modelo tokeniza de forma distinta, así que úsala para comparar y no como una cifra exacta.
¿Qué ocurre si el PDF es un escaneo?
Ofusca puede aplicar OCR en el navegador para proponer texto. El reconocimiento puede contener errores, especialmente en tablas o imágenes de baja calidad, y requiere revisión manual.
Esta guía cuenta qué lleva el documento y qué suele comprobarse en el trámite, que es lo que sabemos por hacer la herramienta. Lo que se exija en tu caso concreto lo fija quien te lo pide.
Publicada el 6 de agosto de 2026. Actualizada el 26 de agosto de 2026. Lectura de 4 min.