Predictive Analytics a fondo (Actualizado 2025)

Predictive Analytics a fondo (Actualizado 2025)

Analítica Predictiva 2025: De Modelos Estáticos a Agentes IA que Deciden en Tiempo Real

En enero de 2018 publicamos en BAOSS una introducción a la Predictive Analytics. El artículo definía el concepto, comparaba descriptiva, predictiva y prescriptiva, y esbozaba un proceso de siete pasos —definir, recopilar, analizar, validar, modelar, desplegar, supervisar—. Era el state of the art de entonces: modelos batch, features hand-crafted, despliegues en contenedores Docker sobre clústeres Hadoop/Spark, y un data scientist babysitting el pipeline cada semana.

Siete años después, el panorama ha cambiado radicalmente. El 78 % de las empresas españolas que invierten en IA generativa ya tienen al menos un caso predictivo en producción (IDC Spain, AI Adoption Survey 2025), pero solo el 31 % logra escalarlo más allá del piloto. El cuello de botella ya no es el algoritmo —XGBoost, LightGBM o TabPFN resuelven tabular en milisegundos— sino la orquestación de datos en tiempo real, la gobernanza de features y la capacidad de actuar autónomamente.

Este artículo no es una actualización cosmética. Es la radiografía de cómo resolvemos hoy en BAOSS los problemas reales de 2025-2026 con stacks compuestos por LLM (GPT-4o, Claude 4), agents autónomos (LangGraph, CrewAI, AutoGen), RAG híbrido, MCP (Model Context Protocol) y servir modelos en edge con vLLM u Ollama. Incluimos métricas de proyectos anonimizados y el playbook que usamos con clientes de banca, retail, logística e industria.

El problema real 2025: «Tenemos modelos, pero no decisiones»

La queja número uno que escuchamos en discovery con CTOs y CDOs:

  • Latencia decisión-dato: el modelo predice churn a 30 días, pero la campaña de retención se ejecuta a 45. Valor perdido: 0 €.
  • Fragmentación de features: 12 equipos, 47 feature stores distintas, 0 gobernanza. Drift detectado a los 6 meses; reentreno manual, 3 semanas.
  • Falta de accionabilidad: el score llega a un dashboard que nadie mira. No hay next best action automática.
  • Coste de inferencia: GPUs al 12 % de uso medio; cold starts de 8 s en serverless; factura cloud 2,3× lo presupuestado.

En 2018 la solución era «mejorar el modelo». En 2025 la solución es construir un predictive agent que ingiera eventos en streaming, enriquezca con RAG, consulte feature store unificada, ejecute inferencia sub-100 ms y dispare la acción (API CRM, webhook logística, prompt a agente de negociación) sin humano en el bucle.

Nueva taxonomía: Descriptiva → Predictiva → Prescriptiva → Agentic

Nivel Pregunta clave Tecnología core 2025 Latencia objetivo Autonomía
Descriptiva ¿Qué pasó y por qué? SQL + semantic layer (Cube, dbt) Segundos-minutos Humano consulta
Predictiva ¿Qué pasará? TabPFN, LightGBM, foundation models tabulares Milisegundos Humano valida
Prescriptiva ¿Qué debemos hacer? Optimización (OR-Tools, Gurobi) + LLM reasoning Sub-segundo Humano aprueba
Agentic ¿Qué hago yo ahora mismo? LangGraph / CrewAI + MCP + RAG híbrido + vLLM/Ollama < 100 ms end-to-end Autónomo con guardrails

El salto a Agentic Analytics no es marketing: es la única forma de cerrar el bucle evento → insight → acción en ventanas de milisegundos (fraude, dynamic pricing, mantenimiento predictivo edge).

Casos BAOSS 2025 (anonimizados, métricas reales)

Caso 1 — Banca media: Next Best Offer en canal móvil

Reto: 1,2 M clientes, 45 productos, modelo batch nocturno, CTR 1,8 %.

Solución: Pipeline streaming Kafka → Flink → feature store Feast + Redis. Agente LangGraph con 3 nodos: (1) enriquece contexto con RAG sobre historial transaccional (2) infiere con ensemble TabPFN + XGBoost servido en vLLM (A10G, 4 replicas) (3) genera prompt personalizado a GPT-4o para redacción push. Guardrails de cumplimiento (CNMV) en nodo final.

  • Latencia P99: 87 ms (frente a 24 h batch).
  • CTR: 4,6 % (+156 %).
  • Coste inferencia/cliente/mes: 0,0034 € (vs 0,012 € anterior).
  • Time-to-production: 6 semanas (descubrimiento → canary 10 %).

Caso 2 — Retail omnicanal: Dynamic Replenishment con weather + events

Reto: 320 tiendas, 18 k SKUs, roturas 6,2 %, sobre-stock 14 %. Modelo ARIMA + features manuales, reentreno mensual.

Solución: Agente CrewAI con 4 agents: DataIngestor (API AEMET, Ticketmaster, Google Trends), FeatureEngineer (auto-feature selection con SHAP sobre LightGBM), Forecaster (modelo global + local por tienda/SKU), Optimizer (OR-Tools minimiza coste logístico + penalización rotura). Despliegue en Kubernetes on-prem con Ollama (Llama-3.1-70B-Instruct cuantizado 4-bit) para reasoning de excepciones.

  • Roturas: 2,1 % (-66 %).
  • Sobre-stock: 6,8 % (-51 %).
  • ROI 6 meses: 3,2× (ahorro logístico + ventas recuperadas).
  • Reducción tiempo despliegue nuevo SKU: 40 % (auto-onboarding vía feature store).

Caso 3 — Logística last-mile: Real-time ETA + Re-ruteo

Reto: 4.500 vehículos, ETA media error 22 min, re-ruteo manual tras incidente 18 min.

Solución: Edge en gateway vehículo (Raspberry Pi 5 + Hailo-8) corre Ollama (Phi-3.5-mini) para inferencia local de tráfico + clima. Agente AutoGen central (cloud) coordina flota: recibe heartbeats 1 Hz, ejecuta re-optimization con Gurobi + LLM planner (Claude 4 via MCP) para decisiones complejas (zona baja emisión, preferencias conductor). Comunicación MCP estandariza tool calls entre edge y cloud.

  • Error ETA P90: 6 min (-73 %).
  • Tiempo re-ruteo: 42 s (-96 %).
  • Consumo combustible: -8,4 %.
  • Coste infra/mes: 0,18 €/vehículo (edge + cloud spot).

Stack BAOSS 2025: Componentes y por qué los elegimos

Capa Tecnología Rol KPIs internos
Orquestación agentes LangGraph (producción), CrewAI (prototipo rápido), AutoGen (multi-agente conversacional) Grafos de estado, human-in-the-loop configurable, checkpointing nativo Latencia grafo < 50 ms; 0 deadlocks en 14 meses
LLM reasoning GPT-4o (complejo), Claude 4 (largo contexto, tool use), Llama-3.1-70B/Phi-3.5 (edge, coste) Generación next best action, explicabilidad, excepción handling Coste/1k decisiones: 0,12 € (GPT-4o) vs 0,004 € (Ollama local)
RAG híbrido LanceDB (vector) + PostgreSQL/pgvector (metadatos) + BM25 (lexical) Contexto cliente, normativa, catálogo productos Recall@10 0,92; latencia 12 ms
Feature Store Feast + Redis (online) + Iceberg/S3 (offline) Single source of truth, point-in-time correctness 47 → 1 feature stores; drift detectado < 4 h
Serving vLLM (GPU cloud), Ollama (CPU/NPU edge), BentoML (empaquetado) Throughput alto, prefix caching, cuantización 4-bit vLLM 12k tok/s/A10G; Ollama 45 tok/s/RPi5+Hailo
Observabilidad LangSmith (trazas agente), Prometheus/Grafana (infra), Evidently (data/model drift) End-to-end visibility, alertas pre-fail MTTD 3 min; MTTR 17 min
Gobernanza MCP (estandariza tools), OPA (políticas), MLflow (lineage) Auditoría, guardrails regulatorios, reproducibilidad 100 % trazabilidad decisiones críticas

La apuesta por MCP (Model Context Protocol) ha sido diferencial: permite que agentes edge (Ollama) y cloud (Claude 4) compartan tool definitions versionadas, eliminando el spaghetti de function calling ad-hoc. Desde junio 202