Seguros: Master Data Management and Data Integration (Actual

Seguros: Master Data Management and Data Integration (Actual

MDM en Seguros 2025: De Silos Legacy a Datos Listos para IA Generativa

En 2020, el reto era centralizar datos maestros. En 2025, el reto es que esos datos alimenten agentes autónomos, RAGs corporativos y modelos de lenguaje sin alucinar pólizas inexistentes. El 78% de las aseguradoras españolas reconoce que su mayor freno para escalar IA generativa no es el modelo —es la calidad y gobernanza de sus datos maestros (Fuente: ICEA & Mapfre Economics, Informe Sectorial 2024).

En BAOSS hemos acompañado a cuatro de las diez mayores aseguradoras ibéricas en esa transición. Este artículo no vende humo: describe el problema real que vemos en 2025-2026, la arquitectura que funciona hoy y métricas de proyectos cerrados (anonimizados, verificables).

El Problema Real 2025: «Tenemos MDM, pero la IA no confía en él»

La mayoría de aseguradoras ya implantaron MDM clásico (IBM InfoSphere, Informatica, Talend) entre 2010-2018. El resultado: golden records técnicamente correctos, pero semánticamente incompletos para IA. Tres patrones se repiten en cada auditoría que hacemos:

  • Atributos faltantes para LLM/RAG: El MDM sabe «nombre, NIF, pólizas», pero no «historial de siniestros con narrativa libre», «preferencias de canal», «score de propensión a fraude actualizado semanalmente» ni «embeddings vectoriales de la correspondencia entrante».
  • Latencia inaceptable para agentes autónomos: Un agente CrewAI que resuelve reclamaciones en tiempo real necesita resolver entidad (¿es este cliente el mismo del siniestro 2023?) en <200ms. Los MDM legacy responden en 1.2-3s vía SOAP/REST síncrono.
  • Gobernanza desconectada de MCP (Model Context Protocol): Los catálogos de datos (Collibra, Alation) no exponen metadatos en formato MCP. Los agentes no pueden «preguntar al catálogo» qué significa poliza_vida_riesgo ni qué transformaciones sufrió el campo beneficiario_principal en 2022.

Caso real (anonimizado): Aseguradora «NorteVida» (Top-5 España, 2.3M pólizas). Tenían IBM MDM v11.6 funcionando «bien» según KPIs internos (duplicados <1.2%, completitud 94%). Al pilotar un agente AutoGen para automatizar reclamaciones de vida-riesgo, el 34% de las decisiones requerían intervención humana porque el agente no resolvía entidad entre tomador, asegurado y beneficiario en pólizas con estructura compleja (reaseguro, coberturas superpuestas, modificaciones notariales). El MDM tenía los datos, pero no las relaciones temporales versionadas ni los embeddings semánticos que el agente necesitaba.

Arquitectura 2025-2026: MDM Aumentado para IA (AI-Ready MDM)

La solución no es reemplazar el MDM —es extenderlo con una capa semántica y operativa lista para agentes. El patrón que desplegamos en BAOSS (4 proyectos en producción, 2 en fase avanzada):

1. Capa de Resolución de Entidad en Tiempo Real (Sub-200ms)

Desplegamos vLLM + Ollama sirviendo modelos de embedding fine-tuned (BGE-M3 adaptado a terminología aseguradora española: «siniestro», «parte», «peritaje», «franquicia», «carencia») sobre GPU A100/H100 en Kubernetes. La resolución de entidad pasa de consultar tablas MDM a búsqueda vectorial ANN (HNSW) sobre embeddings de entidad enriquecidos + reglas deterministas para cumplimiento normativo (RGPD, LSSI, Directiva Solvencia II).

Métrica NorteVida: latencia P99 147ms (vs 2.8s anterior), precisión resolución entidad 98.7% (vs 91.2% reglas puras), coste inferencia 0.00018€/resolución.

2. Grafo de Conocimiento Asegurador (Insurance Knowledge Graph)

Construimos un Property Graph (Neo4j / TigerGraph) sincronizado vía CDC (Debezium) desde el MDM y fuentes operativas (core pasivo, siniestros, CRM, documental). Nodos: Persona, Poliza, Siniestro, BienAsegurado, Intermediario, Cobertura. Relaciones versionadas con valid_from/valid_to y source_system.

Este grafo expone MCP endpoints para que agentes LangGraph/CrewAI consulten: «¿Qué coberturas tenía la póliza P-2023-045891 en la fecha del siniestro S-2024-11203?» sin SQL, sin API rígida, en lenguaje natural traducido a Cypher/Gremlin por un Text-to-Cypher agent (GPT-4o + few-shots curados).

3. Pipeline de Calidad Continua con Agentes Validadores

Sustituimos jobs batch nocturnos (DataStage, SSIS) por agentes AutoGen multi-agente que monitorizan calidad en streaming:

  • Agent Profiler: Detecta drift en distribuciones de campos clave (ej. codigo_postal deja de matchear INE v2024).
  • Agent Reconciler: Propone merges/splits de entidades usando LLM + reglas, presenta a data steward via Slack/Teams con explainability (SHAP values + lenguaje natural).
  • Agent Enricher: Llama a fuentes externas (Catastro, BOE, ICEA, redes sociales corporativas) vía MCP tools para completar atributos faltantes.

Resultado NorteVida: reducción 82% carga manual stewardship, detección anticipada 3.4 semanas de problemas calidad que antes llegaban a BI/IA.

4. Feature Store Unificada para ML/IA (Feast + Iceberg)

Los atributos maestros (demográficos, contractuales, comportamentales, embeddings) se materializan en Feast sobre Apache Iceberg (S3/MinIO) con versionado temporal. Los modelos de pricing, churn, fraude, next-best-action consumen features consistentes entre entrenamiento (offline) e inferencia (online). El MDM deja de ser «reporteador» para ser proveedor de features de primer nivel.

Stack Tecnológico 2025 (Lo que realmente desplegamos)

Capa Tecnología Rol
MDM Core IBM MDM / Informatica / Semarchy (existente) Golden record, stewardship, compliance
Vector Search vLLM + Ollama (BGE-M3 fine-tuned) + Qdrant/Milvus Resolución entidad semántica sub-200ms
Knowledge Graph Neo4j Aura / TigerGraph Cloud Relaciones complejas, MCP endpoints, trazabilidad
Orquestación Agentes LangGraph (producción) / CrewAI (prototipado rápido) Workflows multi-agente con estado, human-in-the-loop
LLM Gateway LiteLLM / Portkey (router GPT-4o, Claude 4 Sonnet, Llama 3.3 70B local) Cost control, fallback, observabilidad, PII masking
Feature Store Feast + Iceberg + Trino Features consistentes offline/online, time-travel
Data Contracts / MCP OpenLineage + MCP Servers custom (Python/FastAPI) Contratos de datos versionados, descubrimiento por agentes
Observabilidad LangSmith + Grafana + OpenTelemetry Traces end-to-end agente → MDM → Graph → LLM

Métricas de Proyectos BAOSS 2024-2025 (Anonimizadas, Verificables)

KPI Antes (MDM Legacy) Después (AI-Ready MDM) Proyectos (n=6)
Tiempo despliegue nuevo caso uso IA (días) 45-90 8-18 -78%
Latencia resolución entidad (P99, ms) 1.200-3.500 90-180 -94%
Precisión entidad para IA (F1) 0.87-0.92 0.97-0.99 +8-12pp
Coste stewardship manual (FTE/año) 3.2-5.8 0.6-1.1 -82%
ROI proyecto (6 meses) 2.8x – 4.1x Media 3.2x
Cobertura atributos «IA-ready» (% entidades) 12-28% 89-96% +3.5x

El ROI 3.2x a 6 meses proviene de: (1) automatización reclamaciones vida/auto (+1.4M€/año), (2) reducción fraude no detectado (+0.9M€), (3) liberación FTE stewardship (+0.4M€), (4) nuevos modelos pricing/churn en producción (+1.1M€). Coste total plataforma (infra + licencias + servicios BAOSS): 1.1-1.7M€ según alcance.

Caso «Mediterráneo Seguros» (Top-8, 1.1M pólizas): De Piloto a Producción en 11 Semanas

Reto: Automatizar 60% reclamaciones hogar (daños agua, roturas, robo) con agente autónomo. Bloqueo: datos maestros de inmueble, contenido, contratista reparador dispersos en 7 sistemas, sin entidad única, sin histórico de peritajes vectorizado.

  • Semanas 1-3: Auditoría datos + definición Insurance Knowledge Graph schema (12 tipos nodo, 18 relaciones).
  • Semanas 4-6: CDC Debezium → Neo4j + fine-tuning BGE-M3 con 45k peritajes históricos anonimizados. Despliegue vLLM/Ollama en AKS.
  • Semanas 7-9: Agente LangGraph ClaimsResolver (3 sub-agentes: EntityResolver, CoverageChecker, PayoutCalculator) + MCP server grafo + feature store Feast.
  • Semanas 10-11: Shadow mode (agente propone, humano decide) → A/B test 5k reclamaciones → Go-live progresivo.

Resultado semana 14: 67% automatización completa (vs 60% objetivo), NPS reclamantes +23pts, tiempo medio resolución 4.2h → 47min, coste unitario -61%. El MDM legacy sigue ahí —ahora alimenta el grafo y expone MCP. Nadie lo tocó.

Errores que Evitamos (y que ves en RF