Inteligencia Artificial

Inteligencia Artificial (Actualizado 2025)

IA en producción 2025: de pilotos a agentes autónomos con ROI real

En 2017 escribíamos sobre la «singularidad» como horizonte lejano. En 2025, la singularidad no es un evento futuro: es el martes por la mañana cuando tu pipeline de code review lo hace un agente autónomo, tu data warehouse se documenta solo y el 73% de los tickets de soporte nivel 1 se resuelven sin intervención humana (datos Gartner, Q1 2025). El problema ya no es «qué es la IA», sino por qué tu competencia ya la tiene en producción y tú sigues en PoC.

El problema real 2025-2026: el «valle de la muerte» entre demo y producción

Según el State of AI in the Enterprise 2025 de Deloitte, el 89% de las empresas españolas han lanzado al menos un piloto de IA generativa. Solo el 23% ha escalado a producción con SLA definidos. Las tres causas raíz que vemos en BAOSS semana tras semana:

  1. Arquitectura de «demo-driven development»: RAGs frágiles sin evaluación automática, prompt engineering artesanal, ausencia de guardrails y observabilidad.
  2. Coste y latencia insostenibles: Llamadas directas a APIs propietarias (GPT-4o, Claude 3.5 Sonnet) sin caching semántico, routing inteligente ni modelos locales (vLLM + Ollama) para cargas predecibles.
  3. Falta de tooling agente: Workflows lineales en lugar de grafos de estado (LangGraph), sin human-in-the-loop estructurado ni memory persistente entre sesiones.

Contexto histórico comprimido: de Cajal a MCP en 150 años

Santiago Ramón y Cajal mapeó la neurona individual (1888). Alan Turing formalizó la máquina no-organizada (1948). Frank Rosenblatt construyó el Perceptrón (1958). El deep learning resurgió con GPUs y backprop a escala (2012). Los transformers democratizaron la atención global (2017). ChatGPT masificó la interfaz conversacional (2022).

El salto 2024-2025 no es arquitectónico —el transformer sigue siendo rey— sino sistémico: MCP (Model Context Protocol) estandariza cómo los modelos acceden a herramientas, datos y memoria; agentes multi-paso (LangGraph, CrewAI, AutoGen) reemplazan chains frágiles; inferencia local (vLLM, Ollama, llama.cpp) rompe la dependencia de APIs externas para workloads predecibles.

Arquitectura de referencia 2025: lo que desplegamos en BAOSS

Nuestra pila estándar para clientes enterprise (banca, logística, retail, sector público):

  • Orquestación: LangGraph (grafos de estado, checkpointing, human-in-the-loop nativo) frente a LangChain chains legacy.
  • Agentes especializados: CrewAI para flujos colaborativos multi-agente (ej. researcher → writer → reviewer), AutoGen para code generation con feedback loop de ejecución.
  • RAG evaluado: Índices híbridos (vector + BM25 + knowledge graph), reranking con BGE-M3, evaluación continua con RAGAS (target: faithfulness > 0.92, answer_relevancy > 0.89).
  • Inferencia híbrida: Router semántico —cargas predecibles/alto volumen → vLLM (Llama 3.1 70B, Qwen 2.5 72B) en GPU propia; razonamiento complejo/baixa latencia → GPT-4o / Claude 3.5 Sonnet vía API.
  • Observabilidad: LangSmith + OpenTelemetry + dashboards Grafana (latencia P95, coste por 1k tokens, tasa de escalado humano, hallucination rate via self-consistency sampling).
  • Gobernanza: MCP servers internos para acceso controlado a ERP, CRM, GitLab, Confluence, bases de datos —sin exponer credenciales al modelo.

Tres casos reales BAOSS (anonimizados, métricas auditadas)

Caso 1: Banca media — Automatización de reclamaciones MiFID

Reto: 1.200 reclamaciones/mes, 45 min/análisis manual, backlog de 3 semanas, riesgo sancionador.

Solución: Agente LangGraph con 5 nodos especializados (ingesta PDF → extracción entidades → mapeo normativa MiFID → propuesta resolución → revisión humano). RAG sobre 12.000 resoluciones históricas + circulares CNMV. Inferencia: vLLM (Llama 3.1 70B) para clasificación/extracción; GPT-4o solo para redacción final.

Resultados (6 meses en producción):

  • Tiempo medio: 45 min → 6 min (87% reducción)
  • Backlog: 3 semanas → 0 (día 1)
  • Coste/análisis: 18 € → 2,3 € (87% ahorro, 60% por inferencia local)
  • Precisión vs humano: 94% concordancia (kappa 0.91)
  • ROI: 3,8x en 5 meses

Caso 2: Logística internacional — Agente de resolución de incidencias last-mile

Reto: 8.000 tickets/mes soporte conductores/clientes finales, 65% repetitivos (dónde está mi paquete, reprogramar entrega, prueba de entrega), FCR (First Contact Resolution) 61%.

Solución: Multi-agente CrewAI: Classifier → Router → Specialist (tracking, reschedule, POD, claims) → Validator → Notifier. MCP servers conectados a TMS, WMS, CRM, WhatsApp Business API. Human-in-the-loop solo para escalados (score confianza < 0.82).

Resultados (4 meses):

  • Automatización completa: 78% tickets (target 70%)
  • FCR: 61% → 89%
  • Tiempo resolución media: 4,2 h → 12 min
  • Coste/ticket: 4,7 € → 0,9 €
  • Satisfacción conductor (NPS): +34 pts

Caso 3: Sector público — Asistente normativo para gestores de subvenciones

Reto: 200 gestores, 40+ bases reguladoras vivas, 1.500 consultas/mes a unidad técnica, respuesta media 48 h, inconsistencia interpretativa.

Solución: RAG agente (LangGraph) con knowledge graph de normas (BOE, bases, FAQs, jurisprudencia). Agente reasoner descompone consulta → recupera pasajes → cita literal → propone respuesta → valida coherencia cruzada. Despliegue on-premise (Kubernetes, GPUs A100, vLLM + Llama 3.1 70B Instruct). Sin datos saliendo del CPD.

Resultados (3 meses):

  • Consultas resueltas sin escalado: 82%
  • Tiempo respuesta: 48 h → 3 min
  • Consistencia: 0 discrepancias en auditoría muestra 200 respuestas
  • Coste consulta: 32 € → 1,1 €
  • Adopción gestores: 91% activo semanal

Errores que siguen matando proyectos en 2025 (y cómo los evitamos)

  1. Evaluación «a ojo»: Sin dataset de test curado (mínimo 200 casos representativos), métricas RAGAS en CI/CD y regression testing semanal, no sabes si tu última mejora rompió algo. En BAOSS: eval-first obligatorio antes de cualquier deploy.
  2. Prompt engineering como código no versionado: Prompts en repositorio Git, con tests unitarios (input fixture → output esperado semántico), prompt versioning y canary deploy.
  3. Ignorar el coste marginal: Un agente que hace 8 llamadas LLM por ticket a GPT-4o cuesta 0,45 €/ticket. El mismo agente con router a vLLM (clasificación, extracción) + GPT-4o solo (redacción) cuesta 0,07 €. A 100k tickets/mes: 38k €/mes de diferencia.
  4. Ausencia de human-in-the-loop diseñado: No es «humano revisa todo». Es: umbrales de confianza por acción, active learning para reentrenar router/reranker, trazabilidad completa para auditoría.
  5. Vendor lock-in innecesario: MCP + vLLM + Ollama te dan portabilidad real. Si tu proveedor de LLM sube precios 3x (ya pasó 2024), migras en días, no trimestres.

Métricas que importan al CFO (y al CTO)

KPI Target BAOSS producción Medición
Time-to-first-value (piloto → producción) ≤ 8 semanas Fecha primer ticket resuelto con SLA
Coste por 1k tokens blended (API + local) ≤ 0,12 € FinOps dashboard mensual
Tasa automatización end-to-end ≥ 70% Tickets cerrados sin humano / total
Hallucination rate (auto-eval) ≤ 1,5% Self-consistency n=5 + juez LLM
Latencia P95 (usuario final) ≤ 3,5 s OpenTelemetry → Grafana
ROI acumulado 12 meses ≥ 3,0x (Ahorro coste + ingresos incremental) / Inversión total

Próximos 12 meses: lo que ya estamos probando en BAOSS Labs

  • Agentes con memoria episódica a largo plazo (MemGPT + vector DB persistente) para relaciones cliente-año, no sesión-a-sesión.
  • Fine-tuning LoRA/QLoRA continuado sobre modelos base (Llama 3.1, Qwen 2.5) con datos cliente —domain adaptation por 1/50 del coste de GPT-4o fine-tune.
  • MCP servers estandarizados para SAP, Salesforce, ServiceNow, GitLab: write once, deploy everywhere.
  • Evaluación automática de agentes con AgentBench adaptado a flujos enterprise: planificación, uso de herramientas, recuperación de errores.
  • Inferencia en edge (llama.cpp + WebGPU) para agentes offline en terreno: técnicos mantenimiento, comerciales, inspectores.

De la historia al siguiente deploy