Cassandra vs Hadoop en 2025: ¿Siguen siendo relevantes o el lakehouse los ha devorado?
En 2017, cuando publicamos la primera versión de esta comparativa, el dilema era binario: Hadoop para batch masivo y Cassandra para OLTP distribuido. Ocho años después, el panorama ha cambiado radicalmente. Los datos no estructurados representan ya el 90% del volumen global (IDC, 2024) y la irrupción de agentes IA autónomos (LangGraph, CrewAI, AutoGen) exigiendo latencias sub-segundo sobre petabytes ha roto los esquemas tradicionales.
Hoy en BAOSS no vemos clusters Hadoop puros en producción desde 2022. Lo que encontramos son arquitecturas lakehouse híbridas (Iceberg + Trino/StarRocks + Flink) donde Cassandra —o su fork empresarial DataStax Astra— sobrevive solo como serving layer de baja latencia para features en tiempo real. El problema real 2025-2026 no es elegir entre ambos, sino cómo unificar analítica histórica, operational analytics y RAG vectorial sin duplicar datos ni disparar costes cloud.
El elefante en la sala: MapReduce murió, pero el batch sigue aquí
Hadoop HDFS y MapReduce son historia. Sin embargo, el procesamiento batch masivo no ha desaparecido: ha mutado a Apache Flink (streaming unificado) y Spark Structured Streaming sobre formatos abiertos (Apache Iceberg, Delta Lake, Hudi). Según el último radar de Thoughtworks (2024), el 78% de las empresas encuestadas ya migran o han migrado a lakehouse.
- Iceberg se impone como estándar de facto: time-travel, schema evolution, partition pruning y ACID sobre S3/MinIO/GCS.
- Trino / StarRocks / ClickHouse resuelven el SQL federado y OLAP sub-segundo sin mover datos.
- Flink SQL unifica batch y streaming con exactly-once, late-data handling y savepoints nativos.
En un proyecto reciente para un retailer europeo (anonimizado), reemplazamos un clúster Hadoop de 120 nodos (HDFS + Hive + Spark batch nocturno) por Iceberg en S3 + Flink Kubernetes Operator + StarRocks. Resultado: reducción 62% en coste mensual cloud, latencia de dashboards de 4 h a 12 s y time-to-insight de nuevos datasets de 3 semanas a 2 días.
Cassandra 2025: de «always-on» a «feature store + vector search»
Cassandra 5.0 (GA 2024) introduce Storage-Attached Indexes (SAI), vector search nativo (HNSW) y ACL granulares. DataStax Astra DB (managed) añade JSON API, GraphQL y gRPC. Pero la realidad de campo es clara: nadie usa Cassandra como data lake. Su sweet spot 2025 son tres patrones:
- Feature store online para modelos ML/IA (latencia P99 < 5 ms).
- Session store / identity resolution en aplicaciones de alta concurrencia (millones RPS).
- RAG retrieval layer con embeddings vectoriales + metadatos filtrados (SAI).
Caso BAOSS: fintech latam (anonimizada) migra su motor de scoring en tiempo real de Cassandra 3.11 on-prem a Astra DB serverless + vector search para enriquecer transacciones con embeddings de comportamiento histórico (GPT-4o fine-tuned). Métricas: latencia P99 3,8 ms, coste 40% menor vs clúster autogestionado, cero downtime en migración gracias a CDC (Change Data Capture) + Flink dual-write durante 4 semanas.
El falso dilema: HBase vs Cassandra ya no existe
HBase sigue vivo en entornos legacy HDP/Cloudera, pero ningún greenfield lo elige en 2025. Las alternativas modernas para wide-column sobre lakehouse son:
- Apache Druid / ClickHouse / StarRocks para OLAP real-time sobre Iceberg.
- Apache Pinot para user-facing analytics (LinkedIn style).
- Cassandra SAI + vector solo si necesitas writes masivos + reads puntuales con filtrado metadata.
La lección: separar storage (Iceberg en object store) de compute (motores especializados) elimina el acoplamiento que obligaba a elegir HBase o Cassandra por «dónde viven los datos».
Arquitectura 2025-2026: Lakehouse + AI Agent Mesh
El patrón ganador que desplegamos en BAOSS combina cinco capas desacopladas:
- Ingestion: Kafka / Redpanda / WarpStream → Flink CDC → Iceberg (bronze).
- Curated: dbt / SQLMesh + Flink SQL → Iceberg silver/gold (partition pruning, Z-order).
- Serving OLAP: StarRocks / Trino / ClickHouse para BI, embedded analytics, operational dashboards.
- Serving OLTP/Vector: Astra DB (Cassandra) / Pinecone / Weaviate / Qdrant para feature store, RAG, session store.
- AI Agent Mesh: LangGraph / CrewAI / AutoGen + MCP (Model Context Protocol) + vLLM / Ollama para inference local. Los agentes consultan Trino (SQL), StarRocks (OLAP) y Astra (vector/key-value) vía function calling tipado.
Ejemplo real: logística global (anonimizada) implementa agentes de optimización de ruta (CrewAI + GPT-4o + herramientas SQL/Vector) que leen Iceberg en S3 (histórico 5 PB), StarRocks (KPIs temps réel) y Astra vector (embeddings de incidencias). Resultado: reducción 18% km recorridos, ROI 3,4x en 5 meses, despliegue en 6 semanas gracias a plantillas BAOSS (Terraform + Helm + GitOps ArgoCD).
MCP y RAG: el nuevo contrato único
Model Context Protocol (MCP, especificación 2024, adopción 2025) estandariza cómo los agentes acceden a datos y herramientas. En BAOSS construimos MCP servers internos que exponen:
- query_trino(sql: str) → DataFrame con row-level security via OPA.
- search_astra_vector(embedding: list[float], filter: dict) → list[doc] con re-ranking cross-encoder.
- get_feature_store(entity_id: str, features: list[str]) → dict con TTL y lineage.
Esto elimina el «spaghetti RAG» donde cada equipo replica embeddings. Un único contrato versionado (OpenAPI + JSON Schema) gobierna el acceso de agentes, notebooks y dashboards. Métrica interna: reducción 70% tiempo onboarding nuevo caso de uso IA (de 4 sprints a 1,2 sprints).
Costes 2025: la sorpresa del serverless
La comparativa de costes ha dado la vuelta. Un clúster Hadoop on-prem (hardware + ops + licencias Cloudera) cuesta ~$0,18/GB/mes TCO 3 años. Iceberg en S3 Standard-IA + StarRocks serverless + Astra DB serverless: ~$0,07/GB/mes con escalado a cero y pago por query.
Tabla resumen proyecto BAOSS 2024 (teleco España, 12 PB):
| Componente | Antes (Hadoop + Cassandra on-prem) | Después (Lakehouse + Astra + StarRocks) |
|---|---|---|
| Storage | $210k/mes | $48k/mes (S3 IA + compaction automática) |
| Compute batch | $85k/mes (YARN fijo) | $22k/mes (Flink K8S spot + scale-to-zero) |
| Compute OLAP | $60k/mes (Impala clúster) | $18k/mes (StarRocks serverless) |
| Serving OLTP | $45k/mes (Cassandra 3 DC) | $12k/mes (Astra serverless multi-region) |
| Total | $400k/mes | $100k/mes (-75%) |
Además: MTTR de incidentes de 45 min a 4 min (observabilidad unificada Grafana + Tempo + Loki + Pyroscope) y cumplimiento GDPR/CCPA automático via Iceberg time-travel + column masking.
Cuándo NO migrar (y qué hacer en su lugar)
- Workloads mainframe acopladas a HBase con SLA contractuales: encapsula con Debezium CDC → Kafka → Iceberg y deja el legacy intacto.
- Cassandra con data model «wide row» complejo (contadores, TTLs por columna, CQL custom): refactoriza a materialized views en StarRocks + Flink antes de mover.
- Equipos sin madurez DevOps/GitOps: invierte 2 trimestres en plataforma interna (Backstage + ArgoCD + policy-as-code) antes de tocar datos.
En BAOSS aplicamos un Assessment de 3 semanas (arquitectura, costes, skills, compliance) que entrega roadmap priorizado con ROI proyectado. El 60% de clientes decide híbrido progresivo (dual-write + validación sombra) en lugar de big-bang.
Stack recomendado BAOSS 2025-2026 (opinionated)
- Object store: S3 / GCS / MinIO (on-prem) + Iceberg REST Catalog (Polaris / Nessie / Gravitino).

