Qué es un data warehouse y por qué tu empresa necesita uno
Qué es un data warehouse: la diferencia con una base transaccional y un data lake, hechos y dimensiones, ETL y ELT, capas y cómo empezar en pequeño.

En resumen
- Un data warehouse es una base de datos hecha para el análisis, que reúne varios sistemas, aplica reglas únicas y guarda historial para generar indicadores confiables en el BI.
- La base transaccional registra operaciones y el data lake guarda archivos en bruto; el data warehouse entrega datos limpios y modelados, listos para consultas e informes.
- El modelado dimensional organiza los datos en tablas de hechos, con eventos y números, y tablas de dimensión, con el contexto que se convierte en filtro en los informes.
- Empieza por un área temática, con capas bronce, plata y oro, verificaciones de calidad y validación de las cifras con el negocio antes de expandir.
Toda empresa mediana o grande llega a un punto en que la misma pregunta tiene tres respuestas. Finanzas saca la facturación del ERP, el área comercial la saca del CRM, operaciones tiene su propia hoja de cálculo, y la reunión de resultados se convierte en una discusión sobre cuál cifra es la correcta.
Un data warehouse, o almacén de datos, es una base de datos construida para el análisis. Reúne datos de varios sistemas, aplica las mismas reglas de negocio, guarda el historial y organiza todo en un formato fácil de consultar en herramientas de BI, como Power BI. Es la base que transforma datos dispersos en indicadores confiables.
En esta guía vas a entender para qué sirve un data warehouse, en qué se diferencia de una base transaccional, de un data lake y de un lakehouse, cómo funciona el modelado con hechos y dimensiones, qué herramientas usar y cómo empezar en pequeño.
¿Por qué tu empresa necesita un data warehouse?
Los sistemas del día a día, como ERP, CRM y plataformas de atención, se hicieron para registrar operaciones, no para responder preguntas de gestión. Las consultas pesadas vuelven lentos a esos sistemas, cada uno usa sus propios códigos y muchos no guardan el historial de cambios. El data warehouse crea una capa solo para análisis y es el corazón de cualquier proyecto de business intelligence.
Algunos ejemplos por área:
- Finanzas: estado de resultados gerencial que cruza contabilidad, centros de costo y presupuesto sin hojas de cálculo intermedias.
- Ventas: facturación, margen y metas por vendedor, región y producto, con las mismas reglas en todos los informes.
- Operaciones: inventario, plazos de entrega y productividad, con historial para comparar períodos.
- Contact center: datos de la plataforma de telefonía, del CRM y de la encuesta de satisfacción en el mismo modelo, por agente y por cola.
- Energía: generación de las plantas, facturas de las distribuidoras y créditos por contrato en una base única y auditable.
Data warehouse, base transaccional, data lake y lakehouse: ¿cuál es la diferencia?
Los cuatro términos aparecen juntos en cualquier conversación sobre datos, pero resuelven problemas diferentes.
Base de datos transaccional
Es la base del sistema operativo de la empresa, como el ERP. Está optimizada para grabar y actualizar muchos registros pequeños con rapidez, como un pedido o un pago. Este uso se llama OLTP, sigla en inglés de procesamiento de transacciones en línea.
Data warehouse
Está optimizado para leer y agregar grandes volúmenes, como la facturación mensual de los últimos cinco años. Los datos están estructurados, limpios y organizados por tema. Este uso se llama OLAP, o procesamiento analítico en línea.
Data lake
Es un repositorio de archivos de bajo costo que acepta cualquier formato: tablas, JSON, imágenes, logs. Es flexible, pero sin organización se convierte en un depósito de datos difícil de usar y de confiar.
Lakehouse
Combina los dos mundos: el almacenamiento barato y abierto del data lake con las tablas estructuradas, las transacciones y el rendimiento de un data warehouse. Plataformas como Microsoft Fabric siguen este modelo, con tablas en formato Delta guardadas en el data lake.
¿Cómo funciona el modelado dimensional?
El modelado dimensional es la forma más usada de organizar un data warehouse para el análisis. Divide los datos en dos tipos de tabla:
- Tabla de hechos: registra eventos medibles, como ventas, llamadas atendidas o energía generada. Cada fila tiene números, como valor, cantidad o duración, y claves que apuntan a las dimensiones.
- Tablas de dimensión: describen el contexto del evento, como cliente, producto, vendedor, sucursal y fecha. Son las que se convierten en filtros y agrupaciones en los informes.
Con la tabla de hechos en el centro y las dimensiones alrededor, el diseño parece una estrella, de ahí el nombre esquema en estrella (star schema). Este formato es fácil de entender para la gente de negocio y es el que Power BI procesa con mejor rendimiento.
La decisión más importante es el grano, es decir, qué representa una fila de la tabla de hechos: una línea de factura, un pedido completo o el total del día. Define el grano más fino que el negocio realmente necesita. Con grano detallado siempre puedes sumar; con grano agregado no puedes volver al detalle.
¿Cómo llegan los datos al data warehouse?
ETL o ELT
En el ETL (extraer, transformar y cargar), los datos se tratan antes de entrar al data warehouse, en una herramienta intermedia. En el ELT (extraer, cargar y transformar), los datos en bruto se cargan primero y se transforman dentro de la propia plataforma, con SQL o Python. Con almacenamiento en la nube más barato y motores de procesamiento más potentes, el ELT se volvió el estándar en proyectos nuevos, porque preserva el dato original y facilita reprocesar cuando cambia una regla.
Capas bronce, plata y oro
Una forma común de organizar el ELT es la arquitectura en capas, también llamada arquitectura medallón:
- Bronce: datos en bruto, tal como vinieron de la fuente, para auditoría y reprocesamiento.
- Plata: datos limpios y estandarizados, con tipos correctos, duplicados eliminados y códigos unificados.
- Oro: tablas de hechos y de dimensión listas para el consumo, con las reglas de negocio aplicadas.
Calidad de datos e historial
Un data warehouse solo genera confianza si las cifras cuadran. Incluye verificaciones automáticas en cada carga: conteo de filas contra el origen, totales de valores, campos obligatorios vacíos y claves sin correspondencia. Cuando una verificación falla, el equipo debe recibir un aviso antes de que el director abra el panel.
El historial es otra ganancia. Si un cliente cambia de región o un vendedor cambia de equipo, el ERP normalmente sobrescribe el registro. En el data warehouse, puedes guardar cada versión con fechas de inicio y fin, técnica conocida como dimensión de cambio lento tipo 2. Así, las ventas del año pasado siguen en la región correcta.
¿Qué herramientas usar para armar un data warehouse?
No existe una herramienta correcta para todos. La elección depende del volumen, del equipo y de lo que la empresa ya usa:
- SQL Server: buena opción para quien ya tiene infraestructura propia y licencias Microsoft, con muchos profesionales disponibles en el mercado.
- Azure SQL: el mismo motor de SQL Server como servicio administrado en la nube, sin ocuparte de servidor, respaldo o actualización.
- PostgreSQL: base de datos de código abierto, robusta y sin costo de licencia, que corre en servidor propio o en cualquier nube.
- Microsoft Fabric: plataforma completa con Lakehouse, Warehouse, pipelines y Power BI integrados, indicada cuando hay muchas fuentes, volumen creciente o necesidad de datos casi en tiempo real.
Para orquestar las cargas, entran los pipelines de Fabric o de Azure Data Factory y scripts en Python. Para visualizar, Power BI o paneles web a medida.
¿Cómo empezar un data warehouse pequeño?
El error clásico es intentar modelar toda la empresa antes de entregar el primer panel. Empieza por un área temática, como ventas o finanzas, entrega valor pronto y expande después. Sigue este paso a paso:
- Elige un área con un dolor claro y un responsable que va a usar los datos cada semana.
- Lista de 5 a 10 preguntas que esa área necesita responder y los indicadores ligados a ellas.
- Mapea las fuentes de cada indicador y quién es responsable de cada sistema.
- Define el grano de la tabla de hechos y las dimensiones necesarias, empezando por fecha, cliente y producto.
- Construye las capas bronce, plata y oro con cargas incrementales y verificaciones de calidad.
- Valida las cifras con el área, lado a lado con los informes actuales.
- Publica los paneles, documenta las reglas y solo entonces pasa a la siguiente área.
Checklist antes de pasar a producción:
- Las definiciones de cada indicador están escritas y aprobadas por el área.
- Las cargas corren solas, en un horario definido, y avisan cuando fallan.
- Los totales cuadran con el origen dentro de una tolerancia acordada.
- El acceso se controla por perfil, con especial cuidado con los datos personales sujetos a la LGPD (ley brasileña de protección de datos).
- Existe un responsable técnico y un responsable de negocio del modelo.
¿Qué errores evitar al construir un data warehouse?
- Copiar las tablas del ERP tal como están y llamar a eso data warehouse, sin modelado.
- Empezar por la herramienta en lugar de empezar por las preguntas del negocio.
- Aplicar reglas de negocio dentro de cada informe, en lugar de aplicarlas una sola vez en la capa oro.
- Recargar todo desde cero cada noche cuando una carga incremental bastaría.
- Ignorar el historial y perder la visión de cómo eran los registros en el pasado.
- No monitorear la calidad y descubrir los errores solo cuando un gerente se queja.
Cómo ayuda Wolkee
Wolkee diseña y construye data warehouses con SQL, Python, Microsoft Fabric y Azure, desde el modelado de las primeras tablas hasta los paneles en producción. En 9 años y más de 500 entregas, trabajamos con datos de ERP, CRM, contact center y energía solar. Mira cómo funciona nuestro servicio de ingeniería de datos.
Si quieres entender por dónde empezar, agenda un diagnóstico gratuito de 30 minutos. Evaluamos tus fuentes, sugerimos la primera área temática y presentamos un prototipo funcional antes del contrato. Respondemos en hasta 1 día hábil.
Preguntas frecuentes
¿Cuál es la diferencia entre data warehouse y base de datos?
Todo data warehouse es una base de datos, pero no toda base de datos es un data warehouse. La base de un sistema como el ERP está hecha para registrar operaciones con rapidez. El data warehouse está hecho para el análisis: reúne varias fuentes, guarda el historial y organiza los datos en hechos y dimensiones para consultas rápidas en herramientas de BI.
¿Power BI es un data warehouse?
No. Power BI es una herramienta de modelado y visualización para informes. Almacena datos en sus modelos semánticos, pero no fue hecho para integrar muchas fuentes, guardar historial de largo plazo y servir como fuente única para otros sistemas. Lo ideal es que Power BI consuma datos de un data warehouse, con las reglas de negocio ya aplicadas.
¿Qué es un data mart?
Un data mart es un recorte del data warehouse dedicado a un área o tema, como ventas, finanzas o contact center. Contiene las tablas de hechos y de dimensión que esa área usa. Empezar por un data mart es una forma práctica de construir el data warehouse poco a poco, siempre que las dimensiones comunes, como cliente y producto, se compartan entre las áreas.
¿Cuánto tiempo toma implementar un data warehouse?
Depende del alcance, de la cantidad de fuentes y de la calidad de los datos. Un data warehouse que cubre toda la empresa se construye por olas, a lo largo del tiempo. En cambio, una primera área temática, con pocas fuentes y preguntas bien definidas, llega a producción mucho antes. Por eso la recomendación es empezar en pequeño, entregar valor pronto y expandir por área.


