De capas a plataformas con IA: cómo evoluciona la arquitectura en 2025
En 2019 escribíamos sobre el fin de las arquitecturas en capas rígidas y el auge de los equipos multifuncionales respaldados por SaaS. Seis años después, el panorama ha cambiado radicalmente: la IA generativa, los agentes autónomos y la Platform Engineering han reescrito las reglas. En BAOSS hemos acompañado a una docena de clientes en esta transición durante 2024-2025. Los patrones se repiten, los dolores son los mismos, pero las herramientas —y las métricas— son otras.
El problema real en 2025: complejidad cognitiva, no capas
El dolor ya no es «el frontend espera al backend». El dolor en 2025 es:
- Fragmentación de herramientas IA: RAG, MCP, LangGraph, CrewAI, AutoGen, vLLM, Ollama — cada equipo elige su pila, nadie gobierna.
- Deuda de plataforma invisible: Los equipos de producto construyen sus propios wrappers sobre Bedrock, Vertex AI o Azure OpenAI. Resultado: 3-4 implementaciones distintas del mismo patrón RAG en una misma organización.
- Observabilidad ciega a agentes: Logs y métricas tradicionales no trazan cadenas de razonamiento multi-agente. Cuando un agente falla, el MTTR se dispara.
- Governance & compliance reactivos: RGPD, AI Act, ISO 42001. Los equipos descubren requisitos en producción, no en diseño.
- Cognitive load insostenible: Un developer senior en 2025 debe dominar Kubernetes, Terraform, prompt engineering, eval frameworks, vector DBs, guardrails, cost optimization… y entregar features.
La arquitectura en capas de los 2000 separaba presentation / business / data. La de 2019 separaba equipos por value stream. La de 2025 debe separar complejidad accidental de complejidad esencial mediante una Internal Developer Platform (IDP) con capacidades IA nativas.
Evolución en tres actos: 2000 → 2019 → 2025
| Dimensión | 2000s (3-tier) | 2019 (DevOps + SaaS) | 2025-26 (Platform + IA) |
|---|---|---|---|
| Unidad de arquitectura | Capa técnica | Value stream / producto | Capacidad de plataforma reutilizable |
| Equipos | Frontend / Backend / DBA / Ops | Cross-functional por producto | Stream-aligned + Platform + Enabling + Complicated-subsystem (Team Topologies) |
| Abstracción clave | API REST entre capas | Self-service infra (Terraform, K8s) | Golden Paths con IA: plantillas RAG, agent scaffolds, eval harnesses, guardrails |
| Observabilidad | Logs / APM básico | Distributed tracing, metrics, logs | LLM observability: traces de reasoning, token costs, hallucination rates, eval scores |
| Gobernanza | Change advisory board | Policy as code (OPA, Sentinel) | AI guardrails as code: PII detection, bias eval, cost budgets, model versioning |
| Time-to-market (feature media) | 3-6 meses | 2-4 semanas | 3-7 días (con Golden Path IA) |
El salto de 2019 a 2025 no es incremental: la plataforma deja de ser «infra self-service» para convertirse en «cognitive load reducer» con IA embebida.
Casos BAOSS 2024-2025: métricas reales, clientes anonimizados
Caso 1: Banca media — Plataforma RAG corporativa
Contexto: 4 equipos de producto construyendo cada uno su RAG sobre Azure OpenAI + AI Search. Duplicación de código, prompts inconsistentes, sin eval framework, costes descontrolados (€18K/mes en tokens).
Intervención BAOSS (8 semanas):
- Diseño de Golden Path RAG: plantilla Terraform + módulo Python (LangChain + LangGraph) + eval harness (RAGAS + custom) + guardrails (Presidio + custom PII) + cost dashboard (FinOps).
- Migración de 4 implementaciones a 1 plataforma compartida con versionado de prompts y modelos.
- Enabling team de 2 platform engineers dando soporte a 30 developers.
Resultados a 6 meses:
- Reducción 62% coste tokens (caché semántico + routing inteligente GPT-4o → GPT-4o-mini + prompt compression).
- Time-to-market nuevo caso de uso RAG: 4 días → 4 horas (clone template, config YAML, deploy).
- Hallucination rate de 18% → 3.2% (eval automatizado en CI/CD + human-in-the-loop sampling).
- ROI 3.8x en 6 meses (ahorro directo + velocidad + reducción riesgo regulatorio).
Caso 2: Retail omnicanal — Agentes autónomos para atención cliente
Contexto: PoC con CrewAI + Ollama (Llama 3.1 70B) en staging. Funcionaba en demo, fallaba en producción: latencia P99 > 45s, memory leaks, sin observabilidad de reasoning traces, escalado manual.
Intervención BAOSS (6 semanas):
- Refactor a arquitectura multi-agente supervisada: Router (LangGraph) → Specialist agents (RAG, SQL, API) → Critic/Verifier → Response synthesizer.
- Deploy en vLLM + Kubernetes (KServe) con autoscaling basado en queue depth + GPU utilization.
- Instrumentación completa: LangSmith + OpenTelemetry + custom span exporters para reasoning traces.
- Guardrails: output schema validation (Pydantic), toxicity (Detoxify), PII (Microsoft Presidio), cost budget per conversation.
Resultados a 3 meses:
- Latencia P99: 45s → 3.2s (batching, KV cache optimization, model quantization INT4).
- Resolución automática L1: 34% → 67% (mejora prompts + few-shot dinámico + eval continuo).
- Coste por conversación: €0.84 → €0.19 (routing inteligente + modelos pequeños para tareas simples).
- MTTR incidentes IA: 4.2h → 22 min (traces completos + alertas en eval score drift).
Caso 3: Seguros — Platform Engineering como habilitador
Contexto: 12 equipos de producto, 0 platform team. Cada equipo gestiona su K8s, su CI/CD, su observabilidad, su IA. Inconsistencia total. Lead time for changes: 11 días. Change failure rate: 28%.
Intervención BAOSS (12 semanas, fase 1 de 3):
- Creación de Platform Team (6 personas) con mandate: «Golden Paths, not gates».
- IDP sobre Backstage + ArgoCD + Crossplane + Kyverno.
- Primer Golden Path: «Servicio REST + PostgreSQL + Observabilidad + IA opcional» — scaffold en 7 min via Backstage template.
- Segundo Golden Path (semana 10): «RAG-as-a-Service» — abstrae vector DB, embedding model, reranker, eval, guardrails.
Resultados a 4 meses (fase 1):
- Lead time for changes: 11 días → 2.3 días (DORA metrics).
- Change failure rate: 28% → 9%.
- Adopción Golden Paths: 78% equipos (voluntaria, sin mandatos).
- NPS interno platform team: 8.4/10 (medido trimestral).
La pila tecnológica 2025-2026: qué usamos realmente en producción
No todo es hype. Esta es la pila que hemos validado en cliente tras cliente:
| Capacidad | Herramientas estándar BAOSS 2025 | Cuándo aplicar |
|---|---|---|
| Orquestación agentes | LangGraph (stateful, ciclos, human-in-the-loop), CrewAI (rápido para multi-agente simple), AutoGen (investigación) | LangGraph por defecto; CrewAI para PoC < 2 semanas |
| RAG framework | LlamaIndex (modular, avanzado), LangChain (ecosistema), custom sobre vector DB nativa | LlamaIndex para producción; LangChain para compatibilidad legacy |
| Serving LLM | vLLM (throughput), Ollama (dev/local), TGI (Hugging Face), managed (Bedrock, Vertex, Azure AI) | vLLM en K8s propio; managed para < 100 req/min o compliance estricto |
| Eval & guardrails | RAGAS + DeepEval + custom (CI/CD), Guardrails AI / NeMo Guardrails (runtime), Presidio (PII) | Eval en pipeline obligatorio; guardrails runtime en producción |
| Observabilidad IA | LangSmith (traces), OpenTelemetry + custom semantic conventions, Arize/Phoenix (drift), Grafana LGTM stack | LangSmith + OTel nativo; Arize si > 50K trazas/día |
| Vector DB | Qdrant (k8s-native, filtering), Pinecone (managed), Weaviate (hybrid search), pgvector (PostgreSQL existente) | Qdrant por defecto en K8s; pgvector si ya hay Postgres y < 10M vectores |
| Platform/IDP | Backstage (portal), ArgoCD/Flux (GitOps), Crossplane (control plane), Kyverno/OPA (policy), Terraform (infra) | Backstage + ArgoCD + Crossplane = baseline BAOSS |
| FinOps IA | Kubecost + custom token dashboards, Vantage, CloudZero | Token-level cost attribution obligatorio desde día 1 |
Regla de oro 2025: Si no tienes eval automatizado en CI/CD, no estás en producción, estás en demo.

