Pipeline de documentos
Recibe PDFs por un formulario público, extrae sus tablas, normaliza los datos y guarda registros limpios en una base — con archivo en S3.
Facturas, estados de cuenta, reportes: los documentos llegan sucios, los datos deben aterrizar limpios. Este pipeline hace la parte aburrida.

El patrón
Form Input (subida de archivo) → PDF Extractor → Pandas Processor → Database
└→ S3 Storage (archivo del original)Paso a paso
- Form Input (Interfaces Públicas) — un campo de archivo que acepta PDFs; quien deba enviar documentos recibe el link público.
- PDF Extractor (Datos) — saca las tablas del PDF a filas estructuradas.
- Pandas Processor (Datos) — normaliza: renombra columnas, corrige tipos, elimina filas vacías, calcula campos derivados.
- Database (Datos) — inserta los registros limpios en tu colección de MongoDB.
- S3 Storage (Datos) — rama paralela: archiva el archivo original para auditoría.
Variaciones
- Agrega un LLM Agent después de la extracción para clasificar el tipo de documento o marcar anomalías antes de guardar.
- Modo lote: un nodo Loop procesa envíos multi-archivo uno por uno.
- Cierra el ciclo con una vista pública de Data Table para que el equipo navegue lo procesado.
Prompt de Genius: "Crea un pipeline de documentos: formulario público con subida de PDF, extraer tablas, limpiar con pandas, guardar en base de datos y archivar el original en S3."
Workflow de aprobación
Pon una compuerta humana antes de acciones sensibles — envíos, pagos, publicaciones — con asignados, timeout y contexto completo para decidir.
Pipeline multiagente: planner, executor, reviewer
Divide una tarea compleja entre tres roles LLM — uno planea, otro ejecuta con herramientas, otro revisa — conectados por estructura que garantiza el proceso.