Antes de empezar
- Decide si basta el texto incrustado o si las páginas escaneadas requieren OCR.
- Conserva el PDF fuente para comparar pasajes dudosos.
Conversión PDF
Convierte PDF con texto o PDF escaneados a Markdown con OCR opcional de reconocimiento de texto avanzado.
Compara Markdown con las páginas difíciles antes de reutilizarlo.
Archivos temporales: limpieza 30 minutos y límite de ocho minutos.
La mayoría de las herramientas de archivos del servidor tienen una retención predeterminada de 30 minutos. Los archivos vencidos se eliminan mediante limpieza programada; no es una hora de borrado exacta.
Cómo resolver problemas de conversión: formatos, fuentes, cifrado y páginasLímite: Markdown conserva estructura de texto útil, no la presentación visual exacta de cada página.
Convierte PDF normales o escaneados a Markdown y usa OCR cuando no existe una capa de texto aprovechable.
Elige modo automático, OCR forzado o solo capa de texto. Los PDF normales usan texto incrustado para mayor velocidad; las páginas escaneadas pueden renderizarse y reconocerse con OCR. Se entregan Markdown, TXT y JSON.
El PDF, imágenes renderizadas y archivos Markdown, TXT y JSON se procesan temporalmente y se eliminan automáticamente.
Sí. El modo automático recurre a OCR cuando falta texto extraíble.
No. Conserva estructura textual útil; tablas complejas y varias columnas pueden requerir limpieza.
Sí. El modo solo capa de texto extrae texto incrustado sin renderizar páginas para OCR.