Estás en el blog de Nicolau Roca
Dos dashboards, dos verdades: quién decide qué significa una métrica
Dos dashboards pueden discrepar sin un fallo técnico. La definición de métricas, el contexto y la responsabilidad permiten entender esas diferencias.

En una reunión imaginaria, Comercial enseña 120.000 euros de ventas, el informe de facturación dice 100.000 y Tesorería tiene 85.000. Los tres títulos dicen «ventas del mes», así que la conversación que iba de decidir acaba dedicada a buscar el número bueno. Nadie quiere comprometerse con una cifra que otro dashboard parece desmentir.
Podemos entender la reacción de pedir que alguien arregle los datos, pero antes de tocar una consulta necesitamos saber qué está contando cada informe. Si las preguntas son distintas, hacer coincidir las respuestas puede empeorar el problema.
La definición de métricas tiene consecuencias bastante menos abstractas de lo que su nombre sugiere: decide qué se considera una mejora, cuándo se da por cumplido un objetivo y a quién se le piden explicaciones.
¿Por qué dos dashboards pueden dar cifras distintas?
Porque pueden medir hechos, poblaciones o momentos diferentes aunque compartan título. Primero hay que comparar sus definiciones. Si coinciden hecho, período, perímetro y corte de información, la discrepancia sí requiere investigar un posible error.
Airbnb también tuvo esa reunión
El problema tiene un antecedente real bien documentado. En su presentación de Minerva, publicada en abril de 2021, el equipo de Airbnb cuenta que Ciencia de Datos y Finanzas podían dar respuestas distintas a una pregunta tan sencilla como qué ciudad había tenido más reservas la semana anterior. Utilizaban tablas, definiciones y lógica de negocio ligeramente diferentes.
En aquella publicación, Airbnb declaraba más de 12.000 métricas y 4.000 dimensiones en Minerva, utilizadas por más de 200 productores de datos de distintas funciones. Su respuesta incluía centralizar definiciones, revisar cambios y reutilizar las métricas en análisis, experimentación e informes. Son cifras históricas comunicadas por la empresa: muestran la escala del problema y de su plataforma, pero no cuantifican por sí solas el ahorro ni prueban que todas las discrepancias desaparecieran.
Lo que podemos extraer del caso es la importancia de compartir el significado cuando varias herramientas pretenden responder a la misma pregunta. Una plataforma central puede ayudar mucho, pero seguirá necesitando que alguien decida qué cuenta como reserva y cómo se tratan sus cambios. Esas decisiones no vienen resueltas al instalar una herramienta.
Tres cifras legítimas necesitan tres nombres precisos
En nuestro ejemplo inicial, las cantidades son ficticias: Comercial cuenta pedidos aceptados, el segundo informe cuenta facturas emitidas y Tesorería mira cobros recibidos. Estamos hablando de gestión, no fijando criterios contables. Como cada cifra representa hechos y conjuntos de operaciones diferentes, no hay motivo para exigir que coincidan; parte de lo cobrado este mes podría corresponder a facturas de meses anteriores.
Por eso tampoco sería válido restar 85.000 a 100.000 y llamar «pendiente de cobro» al resultado sin relacionar primero las operaciones. La resta es correcta, pero su interpretación puede ser falsa. Antes de reconciliar números hay que comprobar que estamos comparando el mismo hecho, período y perímetro.
Nombrar cada indicador de forma precisa conserva información que una etiqueta genérica oculta. Comercial puede necesitar observar compromisos recientes y Tesorería entradas efectivas de dinero; ambas perspectivas tienen utilidad. La discrepancia no demuestra que los cálculos estén bien, pero la igualdad tampoco serviría para validarlos cuando las preguntas son distintas.
Una subida del 10 % que escondía un problema
Definir la métrica resuelve una parte del trabajo. Interpretarla requiere además comprender qué comportamiento produce el número. El estudio de Microsoft A Dirty Dozen, presentado en KDD 2017, documenta doce errores habituales de interpretación observados en experimentos reales. Uno de los casos resulta especialmente claro: un cambio en Windows Store produjo un aumento del 10 % en las vistas de un tipo de página.
La investigación descubrió que esas páginas estaban mal configuradas y no mostraban contenido, por lo que los usuarios intentaban abrirlas repetidamente. El aumento descrito correspondía a aquel experimento y a ese tipo de página; no era una mejora general de Windows Store. Sin mirar lo que ocurría, una métrica de actividad podía convertir una experiencia defectuosa en una aparente buena noticia.
Una métrica puede estar bien calculada y sostener una conclusión equivocada. Este caso no demuestra que toda subida de visitas sea sospechosa, pero sí obliga a preguntarse qué representa. En un servicio pensado para resolver una gestión, repetir la visita puede expresar interés, confusión o un fallo. La lectura profesional necesita evidencia que permita distinguirlos.
El tiempo y la agregación también cambian el significado
Incluso después de acordar «pedidos aceptados», dos informes pueden discrepar porque uno conserva la foto del cierre y el otro descuenta cancelaciones conocidas después. Compararlos exige saber qué fecha coloca una operación en el período y hasta cuándo se admiten correcciones. Si esas reglas permanecen ocultas, el lector atribuirá al negocio una variación que procede de cómo lo medimos.
La agregación introduce otra dificultad. Si diez clientes compran por la web y ocho en tienda, con tres personas presentes en ambos grupos, el total de clientes distintos es quince, no dieciocho. Es un ejemplo aritmético inventado para ilustrar el solapamiento: sumar cifras correctas no garantiza obtener un total correcto. Con porcentajes de grupos de tamaños diferentes, un promedio simple también puede alterar la interpretación.
Las herramientas permiten representar parte de estas reglas. La documentación de métricas de dbt, por ejemplo, distingue tipos, filtros y parámetros para ratios o acumulados. Esa capacidad facilita reutilizar una definición, pero no decide por nosotros qué población corresponde al objetivo ni qué comparación resulta legítima. Una regla compartida necesita una justificación, además de una implementación correcta.
Contrato de significado de una métrica
El contrato de significado de una métrica reúne lo que debe acompañar a una cifra para poder discutirla. Esta síntesis del artículo propone cinco campos; puede documentarse sin imponer una herramienta.
- Hecho
- Qué acontecimiento cuenta: pedido aceptado, factura o cobro.
- Perímetro
- Qué población entra, qué queda fuera y cómo se resuelven solapamientos.
- Tiempo
- Qué fecha sitúa el hecho y hasta cuándo aceptamos correcciones.
- Uso
- Qué decisión permite y qué interpretación sería improcedente.
- Responsabilidad
- Quién resuelve cambios, desde cuándo rigen y qué ocurre con el histórico.
Aplicado a la reunión inicial, el contrato no fuerza a igualar pedidos, facturas y cobros: hace visible por qué responden a preguntas distintas. Si dos informes declaran el mismo contrato y siguen discrepando, ahora tenemos un desacuerdo delimitado. Acordar el significado facilita localizar errores; no garantiza que el cálculo esté bien implementado.
Cálculo correcto ≠ interpretación correcta. Una resta puede ser válida y no representar lo que su etiqueta promete. Definición compartida ≠ implementación verificada. También hay que comprobar datos y lógica.
Quién responde cuando cambia la definición
El ingeniero puede explicar de dónde sale una cifra y el analista estudiar cómo cambia su interpretación, mientras el responsable del proceso aporta el propósito y las consecuencias de negocio. Cuando la métrica evalúa un objetivo compartido, hace falta una autoridad reconocida que resuelva desacuerdos y asuma la decisión. Dejarla escondida en un filtro no la convierte en una cuestión exclusivamente técnica.
Imaginemos que el indicador deja de incluir pedidos cancelados a partir de este mes. La gráfica podría empeorar sin que la actividad haya variado, y alguien acabaría explicando un rendimiento que ya no es comparable con el anterior. Conservar la versión, fecha de vigencia y efecto sobre el histórico permite entender esa ruptura; recalcular el pasado puede ser útil si se identifica expresamente la revisión.
La responsabilidad técnica sigue siendo indispensable. Si dos dashboards usan la misma definición, período, población y corte de información, una diferencia merece investigarse como posible fallo. Reconocer que existen varias métricas legítimas no autoriza a aceptar cualquier resultado: pérdidas de eventos, duplicados y cálculos incorrectos siguen siendo errores.
En La mayoría de los problemas de datos no se solucionan con tecnología aparece la cuestión general de la responsabilidad. Aquí se vuelve concreta: poder explicar qué mide una cifra, qué deja fuera y quién puede modificar su significado. Esa explicación es lo que permite utilizar un dashboard con criterio.
En la reunión del principio, habremos avanzado si salimos sabiendo qué representan los 120.000, 100.000 y 85.000 euros, cómo se relacionan y qué decisión admite cada uno. Si después sigue habiendo una discrepancia bajo la misma definición, tendremos un problema delimitado que investigar. Hacerlos coincidir por obligación solo conseguiría ocultar dónde empieza el desacuerdo.




