- Compute: Cloudflare Workers (edge, V8 isolates, $0.30/M) + Modal (GPU serverless, scale-to-zero real) + Lambda (integración nativa AWS, SnapStart Java/Python).
- Orquestación: Temporal (durable execution, replay, versioning) para workflows negocio; LangGraph para agentes IA (ciclos, estado, human-in-the-loop).
- Datos: DynamoDB (single-digit ms, on-demand) + Pinecone Serverless / Qdrant Cloud (vector) + Redis Cloud (caché semántico, rate limiting).
- Observabilidad: OpenTelemetry nativo en Workers/Lambda/Modal → Datadog / Grafana Cloud (correlación logs+traces+metrics+profiles). Reg
Serverless 2025: De la moda a la arquitectura rentable con IA
En 2019 escribimos que Serverless era «uno de los temas más de moda». Seis años después, la moda ha pasado. Lo que queda es una decisión de arquitectura que separa a las empresas que escalan con márgenes sanos de las que queman presupuesto en idle y complejidad operativa. En BAOSS hemos acompañado a 27 clientes en migraciones y nuevas arquitecturas serverless desde 2022. Los patrones son claros: el problema ya no es «qué es serverless», sino «cómo evitar que se convierta en una factura impredecible y un nido de dependencias».
El problema real en 2025-2026: complejidad invisible y costes opacos
Los CTOs que nos llaman hoy no preguntan por Lambda vs Cloud Functions. Preguntan por tres dolores concretos:
- Facturación sorpresa: Un cliente retail vio su factura AWS crecer un 340% en tres meses tras activar Step Functions masivas sin provisioned concurrency ni reserved instances.
- Observabilidad fragmentada: Trazas distribuidas entre API Gateway, Lambda, DynamoDB, EventBridge y S3 que requieren 4 herramientas distintas para correlacionar un fallo.
- Vendor lock-in real: Migración de Firebase a Supabase + Cloudflare Workers estimada en 6 meses-hombre por acoplamiento a triggers propietarios y SDKs no portables.
La promesa original —»cero ops, paga por uso»— choca con la realidad de cargas de trabajo con IA embebida: inferencia en frío (cold start) de 2-8 segundos en modelos >7B parámetros, límites de memoria de 10 GB en Lambda, y timeouts de 15 minutos que obligan a fragmentar pipelines RAG en state machines frágiles.
Cómo ha cambiado el panorama desde 2019: datos 2025
Dimensión 2019 (Artículo original) 2025-2026 (Realidad BAOSS) Proveedores FaaS maduros AWS Lambda, Azure Functions, GCF + Cloudflare Workers, Vercel Edge, Netlify Functions, Supabase Edge, Modal, Beam, RunPod para GPU serverless Cold start típico (Node/Python) 100-500 ms 50-150 ms (SnapStart, V8 isolates, pre-warmed pools) Cold start con modelo LLM 7B N/A 2-8 s (requiere GPU warm pool o speculative decoding) Límite memoria 3 GB (Lambda) 10 GB (Lambda) / 24 GB (Modal) / 80 GB (Beam) Timeout máximo 15 min (Lambda) 15 min (Lambda) / 4 h (Modal) / sin límite (K8s + KEDA) Orquestación nativa Step Functions, Durable Functions Temporal, Hatchet, LangGraph, CrewAI (workflows como código, versionables, testables) Coste por 1M invocaciones (128 MB, 100 ms) $0.20 $0.20 (Lambda) / $0.0003 (Cloudflare Workers) / $0.00001 (Supabase Edge) La gran novedad 2025: serverless GPU. Modal, Beam, RunPod y Banana permiten levantar A100/H100 por segundo. Un cliente fintech redujo un 78% su factura de inferencia moviendo batch scoring nocturno de EKS (GPU 24/7) a Modal (scale-to-zero real).
Tres casos reales BAOSS (anonimizados, métricas auditadas)
Caso 1: Marketplace B2B — Migración de monolito Spring a arquitectura event-driven serverless
Contexto: 12 servicios acoplados, despliegues quincenales con 40 min de downtime, 3 ingenieros dedicados a ops.
- Solución: API Gateway + Lambda (TypeScript) + EventBridge + DynamoDB + Step Functions para sagas distribuidas. Migración por strangler fig
- Métricas post-migración (6 meses):
- Despliegues: diarios, cero downtime (canary + feature flags en LaunchDarkly)
- Tiempo medio de recuperación (MTTR): 12 min → 3 min (trazas unificadas en Datadog + X-Ray)
- Coste infra/mes: $18.4K → $6.2K (-66%, eliminando EC2/RDS idle)
- Tiempo ingeniería en ops: 3 FTE → 0.5 FTE (reasignados a producto)
- Arquitectura: S3 (landing) → Lambda (parser + chunking semántico con LangChain + Unstructured.io) → Embeddings (text-embedding-3-large via Bedrock) → Pinecone Serverless → API Gateway + Lambda (RAG: retrieval + rerank Cohere Rerank 3.5 + generación GPT-4o/Claude 4 Sonnet con guardrails NeMo).
- Orquestación: LangGraph (stateful, ciclos de reflexión, human-in-the-loop para validación clínica) desplegado en Modal (GPU A10G warm pool 3 instancias).
- Resultados (3 meses producción):
- Latencia P50: 1.8 s (caché semántico Redis + speculative decoding en Modal)
- Coste por query: $0.018 (vs $0.067 en EKS GPU dedicado 24/7)
- Disponibilidad: 99.97% (SLA 99.9%)
- ROI: 3.2x en 6 meses (ahorro ops + reducción 40% tiempo diagnóstico médico)
- Solución: Cloudflare Workers + Durable Objects (estado por repartidor) + Workers KV (geofencing) + Queues (buffer picos). Lógica de snapping a ruta + ETA ML (modelo ONNX 2 MB compilado a WASM con wasmEdge) ejecutada 100% en edge.
- Métricas:
- Latencia P99: 67 ms (vs 340 ms en región us-east-1)
- Coste: $0.15/M req (incluye Durable Objects) vs $2.10/M en Lambda@Edge
- Despliegues: 15/día (GitHub Actions + Wrangler, preview deployments automáticos)
- Cero incidentes de escalado en Black Friday 2024 (pico 45K req/s)
- Compute: Cloudflare Workers (edge, V8 isolates, $0.30/M) + Modal (GPU serverless, scale-to-zero real) + Lambda (integración nativa AWS, SnapStart Java/Python).
- Orquestación: Temporal (durable execution, replay, versioning) para workflows negocio; LangGraph para agentes IA (ciclos, estado, human-in-the-loop).
- Datos: DynamoDB (single-digit ms, on-demand) + Pinecone Serverless / Qdrant Cloud (vector) + Redis Cloud (caché semántico, rate limiting).
- Observabilidad: OpenTelemetry nativo en Workers/Lambda/Modal → Datadog / Grafana Cloud (correlación logs+traces+metrics+profiles). Reg
Lección clave: Step Functions Express + map state para procesamiento paralelo de 50K ítems/día redujo latencia P99 de 45 de 8 s a 1.2 s. Pero: límites de cuenta (quotas) requieren quota increase requests proactivos; perdimos 3 días en producción por ThrottlingException en EventBridge.
Caso 2: HealthTech — Pipeline RAG serverless para asistente clínico con GPT-4o y Claude 4
Contexto: 2.4M documentos médicos (PDF, HL7, DICOM metadata). Necesidad: respuesta < 3 s, cumplimiento HIPAA, coste predecible.
Trampa evitada: Pinecone Serverless cobra por read/write units + almacenamiento. Índice mal particionado (metadata cardinalidad alta) disparó coste 3x. Solución: namespace por especialidad + metadata filtering pre-retrieval.
Caso 3: Logística last-mile — Edge computing en Cloudflare Workers para tracking en tiempo real
Contexto: 15K repartidores, 2M eventos GPS/día, latencia < 100 ms P99 en 12 países LATAM.
Cuándo NO usar serverless en 2025 (y qué elegir)
| Escenario | Por qué serverless falla | Alternativa BAOSS |
|---|---|---|
| Cargas sostenidas > 70% capacidad 24/7 | Coste unitario 3-5x vs reserved/spot | EKS/GKE + KEDA + Karpenter (spot + scale-to-zero pods) |
| Latencia ultra-baja determinista (< 10 ms P99) | Cold starts + variabilidad red multi-tenant | Bare metal / dedicated hosts / Cloudflare Workers (V8 isolates) |
| Estado pesado / conexiones persistentes masivas | Límites memoria/tiempo, serialización costosa | WebSockets en K8s (Socket.io + Redis Cluster) o AppSync |
| ML training / fine-tuning | Timeouts, sin checkpointing nativo, GPU caro | Modal / Beam / RunPod / SageMaker Training Compiler |
| Equipo sin cultura DevOps / observabilidad | Debugging distribuido inmanejable | PaaS gestionado (Vercel, Railway, Render) + platform engineering interno |

