Stack Data + IA 2025: De Hadoop a Agentes Autónomos
En 2017 publicábamos en este blog la evolución del stack Big Data: de GFS/MapReduce a Colossus, Spanner y Dataflow. Ocho años después, el panorama ha cambiado tanto que aquella arquitectura parece arqueología industrial. El problema ya no es procesar petabytes en batch; es servir inferencias en milisegundos, gobernar modelos que alucinan y orquestar agentes que toman decisiones de negocio sin supervisión humana.
En BAOSS hemos acompañado a una docena de clientes —banca, retail, logística, sector público— en esta transición durante 2024-2025. Lo que sigue no es teoría de vendor: son patrones reales, métricas reales y dolores reales que hemos resuelto (o estamos resolviendo) en producción.
El problema 2025-2026: tres cuellos de botella que matan proyectos
- Latencia de valor: El 68 % de las iniciativas GenAI corporativas no pasan de PoC (Gartner, mayo 2025). La causa raíz: arquitecturas desacopladas donde datos, modelos y lógica de negocio viven en silos distintos.
- Gobernanza fantasma: Modelos que se reentrenan solos, RAGs que filtran PII, agentes que ejecutan transacciones financieras sin auditoría. El 41 % de los CISOs españoles reconoce no tener visibilidad completa de su estate de IA (INCIBE, Q1 2025).
- Coste invisible: Un clúster GPU mal dimensionado quema 12.000 €/mes en inferencia ociosa. Hemos visto facturas de cloud crecer 3,7× tras activar RAG sin caching semántico ni routing inteligente.
Arquitectura de referencia 2025: capas, no silos
La respuesta no es «otra herramienta más». Es una capa de orquestación que une datos, modelos y ejecución con contratos observables. El stack que desplegamos hoy en BAOSS tiene cinco planos:
- Data Plane unificado: Iceberg + Trino/StarRocks sobre S3/MinIO. ACID real, time-travel, cero ETL nocturno. Un cliente retail redujo 82 % el tiempo de frescura de datos (24 h → 4 h) migrando de Hive a Iceberg.
- Model Plane gobernado: vLLM u Ollama para servir Llama-3.1-70B, Qwen2.5-72B o Nemotron-3-Ultra con continuous batching y prefix caching. Métrica clave: TTFT (Time To First Token) < 120 ms en p95.
- Knowledge Plane (RAG 2.0): Índices híbridos (BM25 + dense + ColBERT) con re-ranking cross-encoder. Chunking semántico adaptativo, no por tokens fijos. Un caso banca: precisión de recuperación del 61 % al 89 % solo cambiando estrategia de chunking.
- Agent Plane: LangGraph + MCP (Model Context Protocol) para agentes con estado, human-in-the-loop nativo y trazabilidad completa. CrewAI/AutoGen solo para prototipado rápido; en producción LangGraph gana por control de ciclos y checkpointing.
- Control Plane: OpenTelemetry + Prometheus/Grafana + LangSmith/Langfuse para observabilidad end-to-end: latencia, coste por traza, drift de embeddings, alucinación detectada vía self-consistency sampling.
Caso 1: Banca media — Automatización de reclamaciones con agentes RAG
Contexto: 12.000 reclamaciones/año, 3 semanas de SLA medio, 14 analistas dedicados. Documentación dispersa: PDFs normativos, histórico de sentencias, notas de voz transcritas.
Solución BAOSS (Q2 2025):
- Ingesta continua a Iceberg (Kafka Connect → MinIO → Trino).
- RAG híbrido: 2,4 M chunks, re-ranking con bge-reranker-v2-m3.
- Agente LangGraph de 4 nodos: classify → retrieve → draft → human-review. MCP expone herramientas: «consultar normativa BdE», «buscar jurisprudencia», «calcular intereses legales».
- Política de human-in-the-loop: solo el 23 % de borradores requieren edición; el resto se auto-aprueba con umbral de confianza > 0,92.
Resultados a 4 meses:
- SLA: 3 semanas → 2,1 días (reducción 90 %).
- Coste unitario: 47 € → 3,8 € (factor 12,4×).
- Precisión jurídica validada por comité: 96,3 % vs 91 % manual.
- ROI: 3,2× en 6 meses (proyectado 5,8× a 12 meses).
Caso 2: Logística internacional — Demand Sensing con forecasting multimodal
Contexto: 400 SKUs, 18 países, estacionalidad caótica post-COVID. Forecasting ARIMA clásico: MAPE 28 %. Stockouts y overstock simultáneos.
Solución BAOSS (Q3 2025):
- Feature store Feast sobre Iceberg: 340 features (clima, festividades, macros, señales web, telemetría IoT camiones).
- Modelo Temporal Fusion Transformer (PyTorch Forecasting) servido con Triton + vLLM para batch inference nocturno.
- Agente CrewAI de what-if para planificadores: «¿qué pasa si sube 15 % el fuel en Q4?» → simulación en 8 s.
Resultados a 3 meses:
- MAPE: 28 % → 14,2 % (reducción 49 %).
- Stockouts: -63 %; Overstock valorado: -41 %.
- Tiempo de simulación de escenarios: 4 h (Excel) → 8 s (agente).
- Ahorro neto estimado: 1,7 M€/año.
Caso 3: Sector público — Asistente ciudadano RAG + voz con garantías
Contexto: 2,3 M consultas/año, 11 lenguas cooficiales, RGPD estricto, cero tolerancia a alucinaciones en prestaciones sociales.
Solución BAOSS (Q4 2025 en curso):
- Índice RAG por comunidad autónoma + ámbito competencial. Guardrails NeMo: deny-list de temas sensibles, self-check de consistencia (3 muestras, temperatura 0,3).
- ASR/TTS on-premise (Whisper-large-v3 + Piper) para voz; latencia e2e < 1,8 s.
- MCP expone herramienta «consultar BOE/BOJA/DOGC» con cita exacta (artículo, párrafo, fecha).
- Auditoría inmutable: cada traza firmada con KMS y almacenada en WORM S3.
KPIs objetivo (go-live Q1 2026):
- Desvío a agente humano < 8 % (hoy 34 %).
- Tasa de alucinación detectada < 0,4 % (hoy 2,1 % en PoC sin guardrails).
- Coste por consulta < 0,018 € (hoy 0,12 € centro llamadas).
Lecciones duras aprendidas en 2024-2025
Stack tecnológico BAOSS 2025-2026 (versión corta)
| Capa | Elección principal | Alternativa / Complemento | Por qué |
|---|---|---|---|
| Lago transaccional | Apache Iceberg (Tabular/Cloudera) | Delta Lake (Databricks) | ACID, time-travel, particionado oculto, multi-engine |
| Motor SQL federado | Trino / StarRocks | DuckDB (local), ClickHouse (analytics pesado) | Pushdown, coste-based optimizer, conectores nativos |
| Serving LLM | vLLM (PagedAttention) | Triton + TensorRT-LLM, Ollama (edge/dev) | Throughput 2-5× HF TGI, prefix caching nativo |
| Embeddings / Re-rank | bge-m3 + bge-reranker-v2-m3 | E5-mistral, Nomic-embed-text-v1.5, ColBERTv2 | Multilingüe, SOTA MTEB, licencia Apache-2.0 |
| Orquestación agentes | LangGraph + MCP | CrewAI (prototipo), AutoGen (multi-agente simple) | Estado, ciclos, checkpointing, human-in-the-loop nativos |
| Observabilidad | Langfuse (self-hosted) + OpenTelemetry | LangSmith (SaaS), Phoenix (Arize) | Coste controlado, trazabilidad completa, evaluación automática |
| Guardrails | NeMo Guardrails + OPA | Guardrails AI, LlamaIndex response synthesizers | Políticas declarativas, validación en runtime, explicables |
| Feature Store | Feast (Iceberg backend) | Tecton (managed), Hopsworks | GitOps, point-in-time correctness, multi-entorno |
| Infra / GitOps | Terraform + ArgoCD + Kustomize | Pulumi, FluxCD | Despliegues deterministas, rollback en segundos |

