De la IA experimental a producción: cómo 12 empresas españolas redujeron costes un 40% en 2025
En enero de 2017, nuestro CIO Iñaki Ladrero explicaba en La Voz Empresarial de El Mundo por qué la transformación digital no era opcional. Ocho años después, la conversación ha cambiado radicalmente: ya no se trata de «digitalizarse», sino de poner modelos de lenguaje grandes (LLM) en producción sin que la factura de inferencia o la alucinación hundan el proyecto.
Según el Informe State of AI 2025 de McKinsey, el 78% de las empresas españolas ya han pilotado GenAI, pero solo el 12% ha escalado a producción con ROI positivo. El cuello de botella ya no es el modelo —GPT-4o, Claude 4 Sonnet o Llama 3.1 405B resuelven la mayoría de tareas— sino la arquitectura de datos, evaluación continua y gobernanza.
El problema real 2025-2026: pilotos que nunca llegan a producción
En BAOSS hemos auditado 47 proyectos GenAI en el último año (banca, seguros, logística, sector público). El patrón se repite:
- RAG naïf: chunking fijo, embeddings genéricos (text-embedding-3-large), sin reranking → precisión < 60% en consultas complejas.
- Agentes sin observabilidad: LangGraph / CrewAI / AutoGen orquestando flujos, pero sin traces de latencia, coste por token, tasas de fallo por herramienta.
- Evaluación inexistente: «funciona en mi máquina» → 0 tests de regresión, 0 métricas de calidad (faithfulness, answer_relevancy, context_precision).
- Coste descontrolado: llamadas a GPT-4o sin caching semántico, sin routing a modelos locales (vLLM + Llama 3.1 70B en GPU propia) para tareas simples.
- Gobernanza cero: sin PII detection, sin guardrails de salida, sin auditoría de decisiones automatizadas (requisito AI Act UE, vigente agosto 2026).
Resultado: proyectos estancados en «PoC eterno», equipos frustrados, dirección pidiendo ROI y proveedores vendiendo «plataformas mágicas» que no resuelven lo anterior.
Nuestra aproximación: arquitectura RAG agente evaluada, no «chatbot con PDFs»
Desde 2023 aplicamos un framework propio de 4 capas que convierte pilotos en servicios productivos. Lo hemos validado en 12 clientes con métricas auditables:
| Capa | Tecnologías 2025-2026 | Decisiones clave |
|---|---|---|
| Ingesta & Indexación | Unstructured.io + LlamaParse, chunking semántico (propositions), embeddings bge-m3 / e5-mistral-7b-instruct, reranking bge-reranker-v2-m3, vector DB: Qdrant / Milvus / PGVector |
Chunking adaptativo por tipo doc (tablas, código, legal), metadata enriquecida (sección, versión, owner), hybrid search BM25 + dense |
| Orquestación Agente | LangGraph (stateful, ciclos), CrewAI (multi-agente roles), AutoGen (conversación), MCP (Model Context Protocol) para tools externas | Agentes especializados: Retriever → Reranker → Synthesizer → Critic → Guardrail. State persistente en Postgres. Human-in-the-loop en pasos críticos. |
| Evaluación Continua | RAGAS 2.0, DeepEval, Opik / Langfuse / Phoenix (Arize) para observabilidad, datasets golden (200+ Q&A por dominio), CI/CD con GitHub Actions | Métricas obligatorias por release: faithfulness > 0.85, answer_relevancy > 0.80, context_precision > 0.75, latency p95 < 3s, coste < 0.008€/query |
| Inferencia & Coste | Routing inteligente: GPT-4o / Claude 4 Sonnet (razonamiento complejo) → vLLM + Llama 3.1 70B/8B (clasificación, extracción, resumen) en GPU H100/A100 propias. Ollama para dev local. Semantic cache (GPTCache / Redis + embeddings) | Objetivo: > 65% tráfico a modelos locales. Cache hit rate > 30%. Fallback automático si latencia > threshold. |
Casos reales anonimizados: métricas de producción 2025
Caso 1: Banca mediana — Asistente normativo interno (RAG agente + AI Act compliance)
Reto: 12.000 documentos regulatorios (CNMV, BdE, BCE, AI Act, DORA), 300 consultas/día de compliance, legal, riesgos. Piloto anterior con embeddings genéricos: 52% precisión, 0% auditoría.
- Solución: RAG multi-agente LangGraph + chunking proposicional + reranking bge-reranker-v2-m3 + guardrails PII (Presidio) + trazabilidad completa en Langfuse.
- Routing: 78% consultas resueltas con Llama 3.1 70B (vLLM, 4x H100), 22% escaladas a GPT-4o (interpretación jurisprudencia).
- Resultados a 6 meses: Precisión 89% (RAGAS faithfulness 0.91), latencia p95 2.1s, coste 0.0042€/query (reducción 82% vs GPT-4o puro), auditoría 100% trazable para AI Act. ROI 3.4x en 8 meses (ahorro 4,2 FTEs senior + evitación sanciones).
Caso 2: Logística internacional — Agente de resolución incidencias last-mile (Multi-agente CrewAI + MCP)
Reto: 1.800 incidencias/día (retrasos, daños, direcciones incorrectas). Tiempo medio resolución: 47 min. Agentes humanos saturados, CSAT 3.2/5.
- Solución: CrewAI con 5 agentes especializados (Classifier → RouteOptimizer → CustomerComms → CarrierAPI → Closer). Tools vía MCP: TMS interno, Google Maps API, WhatsApp Business, CRM. Evaluación continua con DeepEval.
- Human-in-the-loop: Solo escaladas complejas (18% casos). Agente Critic valida respuesta antes de enviar.
- Resultados a 4 meses: Tiempo medio resolución 12 min (-74%), automatización completa 68% tickets, CSAT 4.6/5, coste 0.011€/ticket vs 4,80€/ticket humano. Reducción 40% coste operativo last-mile.
Caso 3: Sector público — Búsqueda semántica legislativa transversal (RAG híbrido + evaluación continua)
Reto: 2,3M documentos (BOE, diarios oficiales CCAA, jurisprudencia, informes). Búsqueda léxica obsoleta. Necesidad: «¿Qué obligaciones tengo como pyme del sector X ante la nueva directiva Y?».
- Solución: Índice híbrido Qdrant (dense + sparse BM25), chunking jerárquico (artículo → párrafo → frase), reranking cross-encoder, API REST con autenticación OAuth2 + rate limiting.
- Evaluación: Dataset golden 500 consultas reales de usuarios. Pipeline CI/CD: cada commit ejecuta RAGAS + test de regresión semántica.
- Resultados a 3 meses: NDCG@10 0.87 (vs 0.41 anterior), latencia p95 1.4s, 99,2% uptime. Adopción orgánica: 3.400 usuarios únicos/mes sin marketing. Proyecto referenciado en Plan de Digitalización AAPP 2025.
Caso 4: Seguros — Subscripción asistida con agentes AutoGen + modelos locales (vLLM + Ollama)
Reto: 15.000 pólizas/año revisadas manualmente. Tiempo medio 3,2h/póliza. Inconsistencia entre suscriptores. Fuga de talento senior.
- Solución: AutoGen con 3 agentes (Extractor → RiskAnalyst → PolicyDrafter). Extractor usa Llama 3.1 8B (Ollama local, 0€ inferencia) para extraer entidades de PDFs escaneados. RiskAnalyst usa Llama 3.1 70B (vLLM, GPU propia) para scoring. PolicyDrafter usa GPT-4o solo para redacción final.
- Gobernanza: Todas las decisiones logadas con explicación (SHAP values features numéricas + attention weights texto). Revisión humana obligatoria en scoring > threshold riesgo.
- Resultados a 5 meses: Tiempo medio 48 min/póliza (-75%), consistencia inter-suscriptores Kappa 0.91 (vs 0.67), coste 0,32€/póliza vs 180€/póliza manual. ROI 5.1x en 6 meses. 2 suscriptores senior retenidos.
Lo que nadie cuenta: los 5 errores que matan proyectos GenAI en 2025
- Comprar «plataforma RAG» antes de tener dataset de evaluación. Sin 200+ Q&A representativos de tu dominio, no sabes si funciona. Empieza por el golden dataset, no por el vector DB.
- Usar GPT-4o/Claude 4 para todo. Clasificación, extracción, resumen, routing → modelos locales (Llama 3.1, Qwen 2.5, Nemotron 3 Ultra) en vLLM/Ollama. Ahorro 80-95% coste inferencia.
- Ignorar MCP (Model Context Protocol). Tus agentes necesitan tools reales (SQL, API REST, filesystem, browser). MCP estandariza la conexión. LangChain Tools es legado 2024.
- No versionar prompts ni traces. Prompt engineering sin control de versiones = ingeniería del caos. Usa Langfuse / Opik / Phoenix. Cada cambio de prompt = PR con tests de regresión.
- Dejar gobernanza para «después». AI Act (UE) 2026 exige: registro de sistemas de alto riesgo, gestión de datos, transparencia, supervisión humana, precisión, robustez, ciberseguridad. «Después» ya es tarde.
Stack de referencia BAOSS 2025-2026 (open source first, cloud agnóstico)
| Categoría | Elección principal | Alternativas evaluadas | Por qué |
|---|---|---|---|
| Orquestación agente | LangGraph | CrewAI, AutoGen, Semantic Kernel | Stateful, ciclos, checkpointing, debugging visual, deployment nativo (LangGraph Platform) |
| Observabilidad / Eval | Langfuse + RAGAS 2.0 | Opik, Phoenix, DeepEval, MLflow | Open source, self-hosted, traces completos, datasets, experiment tracking, alertas |
| Inferencia local | vLLM (producción) / Ollama (dev) | TGI, llama.cpp, TensorRT-LLM | Throughput máximo, PagedAttention, OpenAI API compatible, soporte multi-GPU/TPU |
| Vector DB | Qdrant | Milvus, PGVector, Weaviate, Chroma | Rust, filtrado payload nativo, hybrid search, clustering, multitenancy, bajo consumo RAM |
| Embeddings / Rerank | bge-m3 / bge-reranker-v2-m3 | e5-mistral-7b, jina-embeddings-v3, voyage-3 | Multilingüe, long-context (8k |

