Centro de Ayuda
Catálogo de NodosData

Nodo PDF Extractor

Extrae tablas de archivos PDF a datos estructurados (Python/tabula por debajo) — facturas, reportes y estados de cuenta se vuelven filas procesables.

PDF Extractor (pdf_extractor) convierte tablas atrapadas en PDFs en datos estructurados que tu flow puede filtrar, transformar y guardar. Combínalo con Pandas Processor para limpieza.

Nodo PDF Extractor

Configuración

Abre el nodo (doble clic) para editarlo. Campos clave:

  • Node ID / Nombre — el identificador usado en variables y el nombre visible en el lienzo.
  • Archivo origen — de un formulario, S3 o URL.
  • Opciones de extracción — páginas/área a leer.

Entradas y salidas

Recibe un PDF y emite sus tablas como arrays de filas. Los nodos siguientes referencian su salida con {{node_id.campo}} — ver la referencia de variables.

Ejemplo

Form Input (PDF) → PDF Extractor → Pandas → Database

Ver también: Nodos de datos · Cookbook: pipeline de documentos

En esta página