Serverless computing (Actualizado 2025)

Serverless computing (Actualizado 2025)
  1. Compute: Cloudflare Workers (edge, V8 isolates, $0.30/M) + Modal (GPU serverless, scale-to-zero real) + Lambda (integración nativa AWS, SnapStart Java/Python).
  2. Orquestación: Temporal (durable execution, replay, versioning) para workflows negocio; LangGraph para agentes IA (ciclos, estado, human-in-the-loop).
  3. Datos: DynamoDB (single-digit ms, on-demand) + Pinecone Serverless / Qdrant Cloud (vector) + Redis Cloud (caché semántico, rate limiting).
  4. Observabilidad: OpenTelemetry nativo en Workers/Lambda/Modal → Datadog / Grafana Cloud (correlación logs+traces+metrics+profiles). Reg

    Serverless 2025: De la moda a la arquitectura rentable con IA

    En 2019 escribimos que Serverless era «uno de los temas más de moda». Seis años después, la moda ha pasado. Lo que queda es una decisión de arquitectura que separa a las empresas que escalan con márgenes sanos de las que queman presupuesto en idle y complejidad operativa. En BAOSS hemos acompañado a 27 clientes en migraciones y nuevas arquitecturas serverless desde 2022. Los patrones son claros: el problema ya no es «qué es serverless», sino «cómo evitar que se convierta en una factura impredecible y un nido de dependencias».

    El problema real en 2025-2026: complejidad invisible y costes opacos

    Los CTOs que nos llaman hoy no preguntan por Lambda vs Cloud Functions. Preguntan por tres dolores concretos:

    1. Facturación sorpresa: Un cliente retail vio su factura AWS crecer un 340% en tres meses tras activar Step Functions masivas sin provisioned concurrency ni reserved instances.
    2. Observabilidad fragmentada: Trazas distribuidas entre API Gateway, Lambda, DynamoDB, EventBridge y S3 que requieren 4 herramientas distintas para correlacionar un fallo.
    3. Vendor lock-in real: Migración de Firebase a Supabase + Cloudflare Workers estimada en 6 meses-hombre por acoplamiento a triggers propietarios y SDKs no portables.

    La promesa original —»cero ops, paga por uso»— choca con la realidad de cargas de trabajo con IA embebida: inferencia en frío (cold start) de 2-8 segundos en modelos >7B parámetros, límites de memoria de 10 GB en Lambda, y timeouts de 15 minutos que obligan a fragmentar pipelines RAG en state machines frágiles.

    Cómo ha cambiado el panorama desde 2019: datos 2025

    Dimensión2019 (Artículo original)2025-2026 (Realidad BAOSS)
    Proveedores FaaS madurosAWS Lambda, Azure Functions, GCF+ Cloudflare Workers, Vercel Edge, Netlify Functions, Supabase Edge, Modal, Beam, RunPod para GPU serverless
    Cold start típico (Node/Python)100-500 ms50-150 ms (SnapStart, V8 isolates, pre-warmed pools)
    Cold start con modelo LLM 7BN/A2-8 s (requiere GPU warm pool o speculative decoding)
    Límite memoria3 GB (Lambda)10 GB (Lambda) / 24 GB (Modal) / 80 GB (Beam)
    Timeout máximo15 min (Lambda)15 min (Lambda) / 4 h (Modal) / sin límite (K8s + KEDA)
    Orquestación nativaStep Functions, Durable FunctionsTemporal, Hatchet, LangGraph, CrewAI (workflows como código, versionables, testables)
    Coste por 1M invocaciones (128 MB, 100 ms)$0.20$0.20 (Lambda) / $0.0003 (Cloudflare Workers) / $0.00001 (Supabase Edge)

    La gran novedad 2025: serverless GPU. Modal, Beam, RunPod y Banana permiten levantar A100/H100 por segundo. Un cliente fintech redujo un 78% su factura de inferencia moviendo batch scoring nocturno de EKS (GPU 24/7) a Modal (scale-to-zero real).

    Tres casos reales BAOSS (anonimizados, métricas auditadas)

    Caso 1: Marketplace B2B — Migración de monolito Spring a arquitectura event-driven serverless

    Contexto: 12 servicios acoplados, despliegues quincenales con 40 min de downtime, 3 ingenieros dedicados a ops.

    • Solución: API Gateway + Lambda (TypeScript) + EventBridge + DynamoDB + Step Functions para sagas distribuidas. Migración por strangler fig en 6 sprints.
    • Métricas post-migración (6 meses):
    • Despliegues: diarios, cero downtime (canary + feature flags en LaunchDarkly)
    • Tiempo medio de recuperación (MTTR): 12 min → 3 min (trazas unificadas en Datadog + X-Ray)
    • Coste infra/mes: $18.4K → $6.2K (-66%, eliminando EC2/RDS idle)
    • Tiempo ingeniería en ops: 3 FTE → 0.5 FTE (reasignados a producto)

    Lección clave: Step Functions Express + map state para procesamiento paralelo de 50K ítems/día redujo latencia P99 de 45 de 8 s a 1.2 s. Pero: límites de cuenta (quotas) requieren quota increase requests proactivos; perdimos 3 días en producción por ThrottlingException en EventBridge.

    Caso 2: HealthTech — Pipeline RAG serverless para asistente clínico con GPT-4o y Claude 4

    Contexto: 2.4M documentos médicos (PDF, HL7, DICOM metadata). Necesidad: respuesta < 3 s, cumplimiento HIPAA, coste predecible.

    • Arquitectura: S3 (landing) → Lambda (parser + chunking semántico con LangChain + Unstructured.io) → Embeddings (text-embedding-3-large via Bedrock) → Pinecone Serverless → API Gateway + Lambda (RAG: retrieval + rerank Cohere Rerank 3.5 + generación GPT-4o/Claude 4 Sonnet con guardrails NeMo).
    • Orquestación: LangGraph (stateful, ciclos de reflexión, human-in-the-loop para validación clínica) desplegado en Modal (GPU A10G warm pool 3 instancias).
    • Resultados (3 meses producción):
    • Latencia P50: 1.8 s (caché semántico Redis + speculative decoding en Modal)
    • Coste por query: $0.018 (vs $0.067 en EKS GPU dedicado 24/7)
    • Disponibilidad: 99.97% (SLA 99.9%)
    • ROI: 3.2x en 6 meses (ahorro ops + reducción 40% tiempo diagnóstico médico)

    Trampa evitada: Pinecone Serverless cobra por read/write units + almacenamiento. Índice mal particionado (metadata cardinalidad alta) disparó coste 3x. Solución: namespace por especialidad + metadata filtering pre-retrieval.

    Caso 3: Logística last-mile — Edge computing en Cloudflare Workers para tracking en tiempo real

    Contexto: 15K repartidores, 2M eventos GPS/día, latencia < 100 ms P99 en 12 países LATAM.

    • Solución: Cloudflare Workers + Durable Objects (estado por repartidor) + Workers KV (geofencing) + Queues (buffer picos). Lógica de snapping a ruta + ETA ML (modelo ONNX 2 MB compilado a WASM con wasmEdge) ejecutada 100% en edge.
    • Métricas:
    • Latencia P99: 67 ms (vs 340 ms en región us-east-1)
    • Coste: $0.15/M req (incluye Durable Objects) vs $2.10/M en Lambda@Edge
    • Despliegues: 15/día (GitHub Actions + Wrangler, preview deployments automáticos)
    • Cero incidentes de escalado en Black Friday 2024 (pico 45K req/s)

    Cuándo NO usar serverless en 2025 (y qué elegir)

    EscenarioPor qué serverless fallaAlternativa BAOSS
    Cargas sostenidas > 70% capacidad 24/7Coste unitario 3-5x vs reserved/spotEKS/GKE + KEDA + Karpenter (spot + scale-to-zero pods)
    Latencia ultra-baja determinista (< 10 ms P99)Cold starts + variabilidad red multi-tenantBare metal / dedicated hosts / Cloudflare Workers (V8 isolates)
    Estado pesado / conexiones persistentes masivasLímites memoria/tiempo, serialización costosaWebSockets en K8s (Socket.io + Redis Cluster) o AppSync
    ML training / fine-tuningTimeouts, sin checkpointing nativo, GPU caroModal / Beam / RunPod / SageMaker Training Compiler
    Equipo sin cultura DevOps / observabilidadDebugging distribuido inmanejablePaaS gestionado (Vercel, Railway, Render) + platform engineering interno

    Stack serverless 2025 recomendado por BAOSS

    1. Compute: Cloudflare Workers (edge, V8 isolates, $0.30/M) + Modal (GPU serverless, scale-to-zero real) + Lambda (integración nativa AWS, SnapStart Java/Python).
    2. Orquestación: Temporal (durable execution, replay, versioning) para workflows negocio; LangGraph para agentes IA (ciclos, estado, human-in-the-loop).
    3. Datos: DynamoDB (single-digit ms, on-demand) + Pinecone Serverless / Qdrant Cloud (vector) + Redis Cloud (caché semántico, rate limiting).
    4. Observabilidad: OpenTelemetry nativo en Workers/Lambda/Modal → Datadog / Grafana Cloud (correlación logs+traces+metrics+profiles). Reg