Big Data 2025: del lago de datos al agente autónomo que decide por ti
En 2015 publicábamos una lista de 10 herramientas para Big Data Analytics. Hadoop, MapReduce, Storm, Kafka… Eran los cimientos. Hoy, nueve años después, el problema ya no es cómo almacenar o procesar petabytes, sino cómo convertir ese ruido en decisiones autónomas en milisegundos.
En BAOSS hemos acompañado a una docena de clientes —banca, retail, logística, sector público— en el salto del data lake pasivo a la arquitectura agente: pipelines que no solo ingieren y transforman, sino que razonan, planifican y ejecutan acciones vía LLM + herramientas. Este artículo no es un catálogo. Es el relato de ese viaje, con métricas reales, tropiezos y la pila tecnológica que hoy (2025-2026) funciona en producción.
El problema real 2025: datos abundantes, decisiones escasas
El 73 % de las empresas españolas encuestadas por IDC en Q1 2025 declara tener «madurez de datos alta» (data lake, catálogo, gobernanza). Sin embargo, solo el 18 % logra time-to-insight < 1 hora para preguntas de negocio no predefinidas. El cuello de botella ya no es ETL ni almacenamiento: es la capa semántica y de acción.
- Fragmentación semántica: 12-15 definiciones de «cliente activo» conviven en una misma organización.
- Latencia decisión-acción: un analista tarda 3-5 días en preparar el dataset, validar hipótesis y enviar el ticket a ingeniería para automatizar la acción.
- Deuda técnica LLM: pilotos RAG con GPT-4o o Claude 3.5 Sonnet que funcionan en notebook pero fallan en producción por hallucination rate > 12 %, coste/consulta > 0,40 € o ausencia de observability.
Un cliente retail (anonimizado: «Cliente R», 1.200 M€ facturación, 400 tiendas) resumía así su dolor en enero 2025: «Tenemos Snowflake, dbt, Airflow, Looker y un equipo de 8 data engineers. Pero el director comercial sigue pidiendo excels a mano para decidir promociones de la semana que viene».
Arquitectura agente: la pila que despliega BAOSS en 2025-2026
La solución no es añadir otra herramienta, sino orquestar inteligencia sobre la pila existente. Nuestro patrón de referencia (validado en 4 clientes producción + 3 PoC pagados) combina:
- Capa de datos: Iceberg + Trino/StarRocks (lectura federada) + dbt Core (transformaciones versionadas).
- Capa semántica: Cube.dev o dbt Semantic Layer — métricas y dimensiones únicas expuestas via API (GraphQL/REST/SQL).
- Capa de conocimiento: RAG híbrido (vector + grafo) sobre Neptune/Neo4j + Qdrant/Weaviate, chunking semántico + reranking (Cohere Rerank v3.5 / bge-reranker-v2-m3).
- Capa agente: LangGraph (estado, ciclos, human-in-the-loop) + CrewAI (equipos de agentes con roles) o AutoGen 0.4 (conversación multi-agente). Modelos: GPT-4o / Claude 4 Sonnet / Opus para razonamiento complejo; vLLM + Ollama (Llama 3.3 70B / Nemotron 3 Ultra / Qwen 2.5 72B) para inferencia on-prem / VPC privada con latencia P99 < 800 ms y coste 1/12 vs API.
- Protocolo de herramientas: MCP (Model Context Protocol) — estándar abierto 2025 para exponer funciones SQL, API REST, Python, dbt run-operation, disparadores Airflow/Temporal como tools tipadas y versionadas.
- Observabilidad & guardrails: LangSmith / Langfuse + OpenTelemetry + evaluators automáticos (faithfulness, answer_relevance, SQL_correctness) en CI/CD.
Caso Cliente R: de 5 días a 12 minutos (promoción semanal)
Reto: decidir cada lunes la promoción de 12 categorías × 400 tiendas × 3 canales (tienda, app, web) con objetivo: maximizar margen + evitar stock-out.
Antes (enero 2025): analista extrae 18 tablas → Excel → reglas heurísticas → valida con category manager → ticket Jira → data engineer programa job Airflow → despliegue miércoles. Lead time: 4,2 días laborables. Precisión lift estimado vs real: 68 %.
Después (junio 2025, 14 semanas en producción):
- Agente «PromoPlanner» (LangGraph + GPT-4o + MCP tools): recibe objetivo semanal (margen, stock, estacionalidad), consulta capa semántica (Cube), lanza what-if via dbt + Python (prophet + xgboost), negocia con agente «InventoryGuard» (CrewAI) y emite plan JSON validado por schema Pydantic.
- Human-in-the-loop: category manager aprueba/rechaza/modifica en UI Streamlit (3 min media).
- Despliegue: plan → Kafka topic → Flink SQL → API promociones (latencia < 2 min).
| KPI | Antes | Después | Δ |
|---|---|---|---|
| Lead time decisión-despliegue | 4,2 días | 12 min | -99,5 % |
| Precisión lift (MAPE) | 32 % | 11 % | -65 % |
| Stock-out promocionales | 4,7 % SKU-semana | 0,9 % | -81 % |
| Coste inferencia/semana | — | 18 € (vLLM on-prem) | — |
| ROI acumulado 6 meses | — | 3,2× | — |
Clave: no migramos datos. Conectamos MCP tools sobre Snowflake + dbt + Airflow existentes. El agente es una capa de orquestación inteligente, no un reemplazo.
Caso Cliente B (banca media): cumplimiento normativo autónomo
Dolor: 2.300 alertas/mes de blanqueo (AML) → 92 % falsos positivos → analistas saturados → riesgo sanción BdE.
Solución (marzo 2025, 9 semanas a producción): agente «ComplianceAnalyst» (AutoGen 0.4 + Claude 4 Opus + RAG grafo Neo4j de tipologías BdE + jurisprudencia). Flujo:
- Alerta entra → agente recupera entidad, red transaccional 3 saltos, histórico decisiones, normativa vigente (RAG).
- Genera narrativa de investigación + score riesgo + acción recomendada (archivar, pedir info, ROS).
- Analista valida en UI (1 clic) → auditoría automática (trazabilidad completa LangSmith).
| Métrica | Antes | Después (6 meses) |
|---|---|---|
| Falsos positivos | 92 % | 31 % |
| Tiempo medio investigación | 47 min | 6 min |
| Alertas/analista/día | 18 | 52 |
| Coste LLM/mes (Claude 4 Opus API) | — | 4.200 € |
| Ahorro FTE equivalente | — | 3,8 analistas → 280k €/año |
Lección: Claude 4 Opus supera a GPT-4o en razonamiento normativo largo (contexto 200k + extended thinking), pero cuesta 4,8× más. Para clasificación masiva usamos vLLM + Llama 3.3 70B quant 4-bit (coste 0,0008 €/1k tokens vs 0,015 €/1k Opus). Model routing por complejidad = ahorro 78 %.
Trampas 2025 que hemos visto (y cómo evitarlas)
- RAG naïf = demo, no producción: chunking fijo 512 tokens + cosine similarity falla en tablas, código, jerarquías. Solución: semantic chunking (llama-index) + hybrid search (BM25 + dense) + reranker + graph RAG para relaciones n:m. Métrica: faithfulness > 0,92 en eval set curado.
- Agentes sin estado ni memoria = bucle tonto: LangGraph checkpointer (PostgreSQL/Redis) + long-term memory (vector store por sesión/usuario) obligatorio. Sin ello, el agente olvida el objetivo a los 3 pasos.
- MCP tools sin versionado ni contratos: cada tool expone JSON Schema + OpenAPI + tests de contrato (Schemathesis) en CI. Rotura = build fail.
- Coste oculto: observabilidad: LangSmith/Langfuse + evaluadores automáticos cuestan 15-20 % del presupuesto LLM. Sin ellos, drift silencioso a las 3 semanas.
- GPU on-prem: comprad, no alquilad (si > 6 meses): 4× H100 80GB (NVLink) = 120k € CAPEX → amortizado en 8 meses vs RunPod/Lambda Labs para carga constante > 40k tokens/s. Para picos: burst a cloud via vLLM disaggregated serving.
La pila «starter kit» BAOSS 2025 (para equipo 3-4 personas)
| Capa | Elección por defecto | Alternativa enterprise |
|---|---|---|
| Orquestación agentes | LangGraph (Python) | LangGraph Platform (managed) |
| Multi-agente simple | CrewAI | AutoGen 0.4 |
| Modelos cloud | GPT-4o / Claude 4 Sonnet | Azure OpenAI / Bedrock (VPC) |
| Modelos locales | vLLM + Ollama (Llama 3.3 70B / Qwen 2.5 72B) | TGI / TensorRT-LLM |
| Vector DB | Qdrant (hybrid search nativo) | Weaviate / Pinecone Serverless |
| Grafo conocimiento | Neo4j Aura / Kuzu (embedded) | Neptune / FalkorDB |
| Capa semántica | Cube Cloud / dbt Semantic Layer | AtScale / ThoughtSpot |
| Tools / MCP | FastMCP (Python) + Pydantic | MCP Gateway (TypeScript) |
| Observabilidad | Langfuse (self-hosted) + OpenTelemetry | LangSmith / Datadog LLM |
| Evals CI/CD | RAGAS + custom evaluators (pytest) | Promptfoo / DeepEval |

