Iniciar un proyecto de datos en 2025: de la avalancha a agentes IA autónomos
En junio de 2015 publicábamos en este mismo blog una radiografía de dos escenarios clásicos: la «avalancha de datos» que ahoga a los equipos y el «silo departamental» donde Marketing y Tecnología hablan idiomas distintos. Diez años después, el diagnóstico no ha cambiado tanto como la herramienta. Lo que sí ha mutado es la velocidad: según IDC, el datasphere global superará los 181 zettabytes en 2025 (frente a los 64 ZB de 2020), y Gartner estima que el 75 % de las empresas habrá operacionalizado IA generativa para finales de 2026. El reto ya no es almacenar, sino decidir qué dato activa un agente autónomo a las 3 de la madrugada mientras tu equipo duerme.
El problema real 2025-2026: ruido, latencia y confianza
Hoy las organizaciones no sufren por falta de datos —sufren por exceso de señales sin semántica. Un cliente retail con 12.000 SKU y 300 tiendas nos confesaba: «Tenemos dashboards para todo, pero nadie sabe por qué cae el ticket medio los martes». El cuello de botella se ha desplazado del storage al significado:
- Fragmentación semántica: catálogos de datos desconectados del lenguaje de negocio (ERP, CRM, IoT, logs, PDFs, tickets de soporte).
- Latencia decisión-dato: el ciclo «pregunta → SQL → dashboard → reunión → acción» promedia 11 días en empresas medianas (encuesta BAOSS 2024, n=47).
- Déficit de confianza: solo el 23 % de los directivos confía «plenamente» en los outputs de sus modelos internos (MIT Sloan 2024).
La intuición que mencionábamos en 2015 sigue siendo el punto de partida, pero hoy se materializa en prompts estructurados que disparan flujos RAG (Retrieval-Augmented Generation) sobre grafos de conocimiento versionados, no en hojas de cálculo compartidas por correo.
Arquitectura de referencia 2025: del Data Lake al Knowledge Graph + Agentes
En BAOSS hemos estandarizado un patrón que llamamos Semantic Data Mesh: una capa de ontologías de negocio (definidas con stakeholders, no solo IT) que expone data products versionados vía API REST/GraphQL y MCP (Model Context Protocol). Sobre esa capa corren agentes especializados orquestados con LangGraph o CrewAI, cada uno con system prompt, herramientas y guardrails propios.
Pila tecnológica típica en producción (Q1 2025)
- Ingesta/Streaming: Kafka / Redpanda + Debezium CDC + Apache Iceberg (tablas ACID sobre S3/MinIO).
- Catálogo semántico: DataHub + ontologías OWL/SHACL sincronizadas con GitOps (ArgoCD).
- Motor LLM: GPT-4o / Claude 4 (vía API) + modelos locales Llama-3.1-70B-Instruct servidos con vLLM u Ollama para datos sensibles (PII, financiero).
- RAG avanzado: chunking semántico + reranking (Cohere Rerank 3.5) + graph-RAG sobre Neo4j/FalkorDB.
- Orquestación de agentes: LangGraph (stateful, ciclos) / CrewAI (role-based) / AutoGen (multi-agente conversacional).
- Observabilidad: LangSmith / Arize Phoenix + OpenTelemetry traces end-to-end.
- Evaluación continua: eval sets versionados (RAGAS, DeepEval) en CI/CD (GitHub Actions / GitLab CI).
Clave: no hay «un modelo para gobernarlos a todos». Un agente Text-to-SQL usa un modelo pequeño fine-tuned (ej. sqlcoder-7b en vLLM), otro de resumen ejecutivo tira de GPT-4o, y un tercero de validación regulatoria corre local con Ollama. El router (LangGraph) decide cuál invocar según intención, coste y latencia SLA.
Caso BAOSS #1: Retail multicanal — de 11 días a 4 horas (anonymized)
Contexto: 300 tiendas, e-commerce, app, 12.000 SKU, 1,2 M clientes fidelizados. Equipo datos: 6 personas (2 DE, 2 DA, 1 ML, 1 lead).
Dolor: Preguntas tipo «¿por qué cae conversión en categoría deporte en Madrid?» requerían 3 joins manuales, validación con tienda, reunión semanal → acción a los 11 días.
Intervención (8 semanas):
- Semanas 1-2: talleres de domain-driven design con Marketing, Operaciones, Finanzas → ontología compartida (Producto, Tienda, Cliente, Ticket, Promo, Stock).
- Semanas 3-4: Iceberg tables + DataHub + contratos de datos (Pydantic) versionados en Git. Despliegue CDC desde Oracle ERP + PostgreSQL e-commerce + Mongo logs app.
- Semanas 5-6: Graph-RAG sobre FalkorDB (entidades + relaciones temporales). Agente InsightHunter (LangGraph): recibe pregunta natural → descompone en sub-consultas SQL + traversals grafo → sintetiza respuesta con cita de fuentes + nivel de confianza.
- Semanas 7-8: eval set de 200 preguntas reales históricas → RAGAS faithfulness 0,89 / answer_relevancy 0,92. Despliegue en Slack + Teams via bot con human-in-the-loop para validación final.
Métricas a 6 meses:
- Time-to-insight: 11 días → 3,7 horas (mediana, p95 < 8 h).
- Adopción: 84 % de business users activos semanales (vs 12 % dashboards previos).
- ROI: 3,2x en 6 meses (ahorro estimado 420 k€/año en reuniones + decisiones de stock/precio).
- Coste LLM: 0,018 €/pregunta (mix 70 % local vLLM / 30 % GPT-4o).
Caso BAOSS #2: Banca media — cumplimiento normativo autónomo (anonymized)
Contexto: 450 empleados, 180 k clientes, regulación MiFID II + EBA Guidelines + LOPD. Equipo compliance: 4 analistas + 1 IT.
Dolor: Revisión manual de 2.300 comunicaciones/mes (emails, chats, grabaciones) → 40 % falsos positivos, 3 semanas de retraso, riesgo sanción.
Solución (10 semanas): Pipeline multimodal (Whisper-large-v3 → diarización → chunking semántico) + agente ComplianceGuard (CrewAI: 3 roles — Extractor, Validador, Redactor). Modelo principal: Llama-3.1-70B-Instruct en vLLM (GPU A100 80GB on-prem) para cero salida de datos.
Resultados a 4 meses:
- Falsos positivos: 40 % → 6 % (precision 0,94 / recall 0,91).
- Tiempo revisión/analista: 45 min → 8 min (solo validar hallazgos reales).
- Cobertura: 100 % comunicaciones (antes muestreo 30 %).
- Coste inferencia: 0,003 €/comunicación (infra propia, amortizada en 14 meses).
Metodología BAOSS 2025: 4 hitos, 0 «big bang»
La lección de 2015 sigue vigente: no intentes hervir el océano. Pero hoy el «océano» tiene corrientes de IA que cambian cada trimestre. Nuestra hoja de ruta pragmática:
- Semana 1-2: Discovery & Ontology Sprint. 2 talleres de 3 h con business owners + data owners. Output: diccionario de negocio acordado (Google Sheet → YAML → OWL), lista de 15-25 competency questions priorizadas (MoSCoW).
- Semana 3-6: Primer Data Product + Agente Piloto. Un dominio acotado (ej. «Stock tienda + Promo + Ticket»), CDC a Iceberg, grafo RAG mínimo, 1 agente LangGraph expuesto en Slack/Teams. Definition of Done: RAGAS > 0,85 en eval set real + feedback positivo de 3 usuarios clave.
- Semana 7-12: Escalado horizontal + Gobernanza. Replicar patrón a 2-3 dominios más. CI/CD con tests de regresión semántica. Políticas de acceso (OPA/Rego) sobre APIs de datos. Finops: dashboards de coste por agente/dominio.
- Mes 4-6: Autonomía progresiva. Introducir planner agents que encadenan sub-agentes (LangGraph Supervisor). Métrica norte: % preguntas resueltas sin intervención humana (target > 70 % en dominios maduros).
Cada hito entrega valor medible. Si el piloto falla (raro si la ontología nace del negocio), el coste es < 25 k€ y 6 semanas —no 18 meses y 400 k€ de un Data Lake tradicional.
Trampas 2025 que no existían en 2015 (y cómo esquivarlas)
- Prompt sprawl: 200 prompts sueltos en Notion/Confluence → versiónalo en Git, trata prompts como código (tests, PR, rollback).
- Eval theater: métricas de benchmark público (MMLU, GSM8K) ≠ tu dominio. Construye eval sets con 100-200 casos reales antes de tocar el modelo.
- RAG naïf: chunking fijo 512 tokens + cosine similarity → alucinaciones en tablas/series temporales. Usa chunking semántico + graph-RAG + reranking.
- Vendor lock-in LLM: arquitectura multi-modelo (router + fallback local) desde día 1. MCP facilita el swap.
- Shadow AI: Marketing contrata SaaS con IA embebida sin pasar por IT → catálogo de approved AI services + gateway único (Kong/Traefik + plugins auth/rate-limit/observabilidad).
Presupuesto orientativo 2025 (rango medio empresa 200-1.500 empleados)
| Concepto | Rango (€/año) | Notas |
|---|---|---|
| Infra datos (Iceberg, Kafka, catálogo, CI/CD) | 35.000 – 90.000 | Cloud (AWS/GCP/Azure) u on-prem (K8s + MinIO) |
| GPU inferencia (A100 80GB x2, 3 años amortización) | 45.000 – 60.000 | Opcional si 100 % API; recomendado para PII/regulado |
| APIs LLM (GPT-4o, Claude 4, embeddings) | 12.000 – 40.000 | Depende volumen; caching semántico reduce 60-70 % |
| Equipo BAOSS (lead + 2 consultants, 6 meses) | 120.000 – 180.000 | Incluye transferencia, docs |

