Centro de Ayuda
Cookbook

Pipeline de documentos

Recibe PDFs por un formulario público, extrae sus tablas, normaliza los datos y guarda registros limpios en una base — con archivo en S3.

Facturas, estados de cuenta, reportes: los documentos llegan sucios, los datos deben aterrizar limpios. Este pipeline hace la parte aburrida.

Nodos de datos en el catálogo

El patrón

Form Input (subida de archivo) → PDF Extractor → Pandas Processor → Database
                              └→ S3 Storage (archivo del original)

Paso a paso

  1. Form Input (Interfaces Públicas) — un campo de archivo que acepta PDFs; quien deba enviar documentos recibe el link público.
  2. PDF Extractor (Datos) — saca las tablas del PDF a filas estructuradas.
  3. Pandas Processor (Datos) — normaliza: renombra columnas, corrige tipos, elimina filas vacías, calcula campos derivados.
  4. Database (Datos) — inserta los registros limpios en tu colección de MongoDB.
  5. S3 Storage (Datos) — rama paralela: archiva el archivo original para auditoría.

Variaciones

  • Agrega un LLM Agent después de la extracción para clasificar el tipo de documento o marcar anomalías antes de guardar.
  • Modo lote: un nodo Loop procesa envíos multi-archivo uno por uno.
  • Cierra el ciclo con una vista pública de Data Table para que el equipo navegue lo procesado.

Prompt de Genius: "Crea un pipeline de documentos: formulario público con subida de PDF, extraer tablas, limpiar con pandas, guardar en base de datos y archivar el original en S3."

En esta página