1. ¿Qué es la distancia de Mahalanobis?
La distancia de Mahalanobis es, valga la redundancia, una medida de distancia entre un punto y un centro de masa en un espacio multivariado. Es la base para determinar qué tan típica o atípica es una observación compuesta de muchas dimensiones, y es el corazón de un gran número de cartas de control multivariadas, empezando por las que iniciaron el movimiento del control multivariado: las conocidas y de Hotelling.
La distancia de Mahalanobis mide una distancia en un espacio multivariado estandarizado, donde la variabilidad de los datos se homogeniza en todas las direcciones alrededor del centro de masa analizado. Este centro de masa se define por un vector de medias. Y la homogenización ocurre aplicando una transformación que «elimina» de forma ingeniosa las correlaciones y estandariza las dimensiones, de tal forma que todas las direcciones alrededor del centro de masa son comparables entre sí. Matemáticamente la distancia de Mahalanobis se define como
donde es una observación en forma de vector, es el vector de medias, y es la matriz de varianza-covarianza.
La distancia de Mahalanobis determina qué tan lejos está un punto del centro de masa, expresando esta separación en una escala estandarizada. En el caso univariado, esta idea es equivalente al valor absoluto de la estandarización
En el caso multivariado, la distancia de Mahalanobis extiende esta idea considerando simultáneamente la variabilidad y correlación entre todas las variables. Es más, si reducimos nuestro problema a una sola dimensión, la distancia de Mahalanobis se convierte en el absoluto de la distancia .
1.1 ¿Qué encontraremos en el resto de este artículo?
El secreto para entender la distancia de Mahalanobis se encuentra en la utilización ingeniosa de un conjunto de conceptos que vimos en un artículo anterior, el análisis de componentes principales (ACP). Para entender estas conexiones, recorreremos en las siguientes secciones el mundo de las distancias estandarizadas, partiendo de la conocida distancia .
Luego derivaremos en pasos intuitivos e ilustrados la distancia de Mahalanobis hasta obtener su forma conocida. Evaluaremos qué sucede con esta distancia cuando podemos asumir que nuestras observaciones siguen una distribución normal multivariada conocida. Y finalmente, aterrizaremos todos estos conceptos en una aplicación para evaluar puntos atípicos.
Todo esto y más, a continuación.
2. Midamos distancias
2.1 ¿Qué Problema Estamos Resolviendo?
Estamos resolviendo el problema de medir la distancia entre una observación y el valor medio de una población de interés. Por ejemplo:
- Caso univariado: En un proceso de llenado, queremos saber qué tan alejada, o rara, es una medición de 135 gramos en un proceso que usualmente produce 100 gramos de media con una desviación estándar de 10 gramos.
- Caso multivariado: En un proceso de cocción, ¿qué tan extraño es terminar con una humedad interna de 30% en un horno que trabajó a una temperatura de 210°C en un contexto donde de media se trabaja con 35% de humedad y 200°C de temperatura, y con desviaciones de 2% y 5°C, respectivamente?
Revisaremos primero el contexto univariado para entender los conceptos subyacentes. Luego tomaremos estos conceptos y los trasladaremos a una situación donde tenemos más de una medición sobre un mismo objeto, es decir, el caso multivariado.
2.2 Una Distancia Univariada: la distancia Z
Vamos a recordar un poco a la distribución normal y cómo está agrupada una población que sigue este patrón. No todas las variables siguen una distribución normal, pero entender la variabilidad de la distribución normal y su relación con medidas de distancia nos ayuda a crear una imagen mental que luego podemos extrapolar.
Iniciamos definiendo la media de la población como y su desviación estándar como . Utilizando un enfoque gráfico que nos ayuda a ir desarrollando nuestra intuición estadística, en la Figura 1 observamos cómo un intervalo que está entre más o menos una desviación estándar de la media contiene el 68.3% de la población. Más o menos dos desviaciones de la media contiene el 95.4% de la población. Y más o menos tres desviaciones de la media contiene casi todo, el 99.7% de la población.

De esta manera aprendemos que en una población con distribución normal, se espera que la mayor parte de lo que observemos se encuentre entre más o menos dos desviaciones de la media. Mientras que observaciones más allá de tres desviaciones estándar de la media son raras, al punto de poder sospechar que una observación de esta magnitud en realidad no pertenece al grupo con que la estamos comparando.
Poder identificar qué tan alejada o cercana se encuentra una observación del centro de variabilidad de la población nos da un indicio de qué tan verosímil es dicha observación en relación al grupo o población. Para medir correctamente esta cercanía o alejamiento del grupo no basta con conocer la distancia al centro de la población. Necesitamos conocer el grado de variabilidad.
Analicemos el caso de una observación de 135 gramos en un proceso de llenado. En la Figura 2 vemos esta observación marcada como en dos contextos distintos. Uno, (a), donde la población tiene una media de 100 y desviación estándar de 5. Mientras que en (b), se tiene la misma media de (a) pero ahora la desviación estándar es de 10.

Es evidente que la observación de 135 gramos se encuentra más alejada de la zona de variabilidad de la población en la Figura 2(a) en relación a la Figura 2(b). Esta percepción de distancia la podemos formalizar definiendo una distancia estándar. A esta distancia estándar la llamaremos , y es una medida, en desviaciones estándar, de la distancia entre una observación y el centro de la población con que está siendo comparada. Así se define
En la práctica, podemos dejar el signo de para saber si estamos a la izquierda o derecha de la media, aunque la medida de la distancia es en sí el valor absoluto. Cuando la desviación estándar es 5, . Mientras que cuando la desviación estándar es 10 tenemos que . La distancia de 3.5 es menor que la distancia 7, por lo tanto la observación está más cerca, en términos de desviaciones estándar, de la población con desviación estándar de 10 unidades.
Si nuestra variable sigue una distribución normal con media y desviación , la variable transformada sigue una distribución normal con media 0 y desviación estándar de 1. A la distribución de la transformación se le conoce como la distribución normal estándar.
Todas las poblaciones normales las podemos reducir a normales estándar al hacer la transformación , tal que esta distribución estándar sirve como referencia única para comparar las distancias, en términos de desviaciones estándar, entre las observaciones de distintas poblaciones normales hacia el centro de la población.
En la Figura 3 observamos visualmente a la distribución normal estándar, y para ilustrar la magnitud de las mediciones efectuadas, colocamos las dos estandarizaciones del valor de 135 gramos: una con una desviación estándar de 10 y otra de 5, mostradas como y respectivamente.

La estandarización que sigue la transformación simplifica la comparación al colocar en una misma escala poblaciones de distinta variabilidad cuando lo que nos interesa saber es qué tan cercana es una observación a las zonas que concentran la mayor variabilidad de la población. Y si esta población tiene una distribución conocida, como la normal en la Figura 1, podemos asociar estas distancias a probabilidades.
Para el caso de la distribución normal formalmente escribimos
donde el signo se lee «se distribuye como». Y es la expresión para decir que estamos frente a una distribución normal con media 0 y varianza 1. Si la varianza es , entonces la desviación estándar es .
Cuando nuestras observaciones incluyen más de una dimensión todavía podemos seguir usando transformaciones univariadas para el análisis individual, pero el análisis del conjunto se dificulta, pues con dos o más variables aparece un nuevo elemento: la correlación. Y con la correlación, algunos comportamientos se pueden enmascarar para nuestro detrimento. Necesitamos una distancia multivariada que considere este nuevo elemento.
2.3 Una distancia multivariada: la distancia de Mahalanobis
Para ilustrar el concepto de la distancia de Mahalanobis y cómo se calcula, usaré como referencia un proceso de monitoreo de harina de maíz nixtamalizada.
Ejemplo de un proceso multivariado
En una planta que produce harina de maíz (tortillas, botanas, cereales), es común monitorear:
- Humedad (%): afecta la vida de anaquel y la textura.
- pH: refleja calidad del proceso de nixtamalización.
En este proceso ilustrativo, estas dos variables están correlacionadas positivamente. Esto es, a mayor humedad, más pH. En este caso, tienen una correlación moderada de 0.65. Además, sabemos que históricamente el % de humedad se ha mantenido en 12% con una desviación estándar de 0.6, y el pH suele oscilar alrededor de una media de 7.8 con una desviación estándar de 0.25.
Matricialmente podemos resumir los parámetros del proceso con su vector de medias
y su matriz de varianza-covarianza
donde los elementos de la diagonal son las varianzas y los demás son las covarianzas, es decir,
Así, y . Los demás elementos son las covarianzas que se pueden obtener entendiendo que la correlación no es más que una covarianza estandarizada . Así, siendo que la correlación entre la variable 1 y la variable 2 es se resuelve
Finalmente notamos que el orden de las variables para obtener las covarianzas no importa. Esto es, . De esta manera obtenemos la matriz de varianza-covarianza anteriormente mostrada.
Cuando se trabaja con estadística multivariada, es típico expresar los parámetros de un proceso en términos matriciales. Esto facilita el acomodo de la información, sobre todo cuando tenemos muchas dimensiones. Y se vuelve indispensable al momento de querer generalizar los cálculos y demostraciones que se pudieran hacer.
Veamos una muestra
Obtenemos 22 datos de una muestra del proceso de harina de maíz descrito anteriormente. Estos datos se observan en la Tabla 1. Nota que las observaciones 21 y 22 se han marcado como Punto A y Punto B respectivamente. Le prestaremos especial atención a estos últimos puntos a lo largo de este ejercicio.
| ID | Humedad | pH |
|---|---|---|
| 1 | 12.73 | 7.99 |
| 2 | 11.81 | 7.84 |
| 3 | 11.33 | 7.68 |
| 4 | 13.43 | 8.14 |
| 5 | 11.71 | 7.84 |
| 6 | 11.62 | 7.96 |
| 7 | 12.37 | 7.80 |
| 8 | 12.27 | 8.08 |
| 9 | 12.34 | 7.90 |
| 10 | 12.48 | 8.12 |
| 11 | 12.34 | 7.69 |
| 12 | 12.57 | 8.06 |
| 13 | 12.43 | 8.06 |
| 14 | 11.94 | 7.88 |
| 15 | 11.34 | 7.91 |
| 16 | 12.00 | 8.02 |
| 17 | 12.19 | 8.27 |
| 18 | 12.47 | 8.20 |
| 19 | 12.49 | 8.00 |
| 20 | 10.53 | 7.45 |
| 21 (Punto A) | 13.00 | 8.30 |
| 22 (Punto B) | 11.00 | 8.30 |
En la Figura 4 vemos una representación de los datos de la Tabla 1 con varios adornos que la hacen particularmente interesante. En la figura podemos notar
- Centroide teórico: formado por las coordenadas (12, 7.8), las medias conocidas de la humedad y pH.
- Puntos A y B: que corresponden a las observaciones 21 y 22 de la Tabla 1.
- Líneas que conectan los puntos A y B con el centroide: Estas líneas representan la distancia euclidiana entre los puntos y el centroide.
- Distancia de A: .
- Distancia de B: .
- Elipses alrededor del centroide: Marcadas como , corresponden a curvas de nivel usadas como referencia visual y que nos indican distintos grados de concentración poblacional alrededor del centroide. Entre más cerca del centroide, más densa es la población.

Se puede observar en la Figura 4 que los puntos A y B se encuentran exactamente a la misma distancia euclidiana del centroide. Geométricamente se podría decir que están a la misma distancia. Sin embargo, los segmentos que traza cada punto al centroide atraviesan distintos niveles de concentración de datos en su trayecto.
Específicamente, en la Figura 4, el Punto B se encuentra más allá de 3 niveles de concentración del centro, mientras que el Punto A apenas está más de 2. Esto indica que el Punto A está más cerca de la mayor concentración de los datos, mientras que el Punto B está más lejos.
¿Pero qué tan lejos o cerca están los puntos respecto a los niveles de concentración de los datos?
Responder esta duda es difícil cuando nuestros datos se encuentran correlacionados. Es decir, cuando varían conjuntamente en una dirección. Esto dificulta el diagnóstico.
Para resolver este problema, podemos mover nuestras observaciones a un nuevo sistema cartesiano que esté rotado respecto al original, pero que mantenga la estructura de los datos intacta. Es más, podríamos encontrar un espacio donde las observaciones ya no se muestren correlacionadas. Un sistema así lo encontramos en las direcciones principales de variación. Esto es, haremos un análisis de componentes principales (ACP). Aunque para este manuscrito no es indispensable entender con profundidad el ACP, ciertamente ayuda. Para más detalles del ACP sugiero revises mi artículo anterior.
Si es una matriz cuyas columnas son los vectores propios de la matriz , tal que la primera columna corresponde al vector propio con el valor propio más grande, y las demás le siguen en orden decreciente, entonces la transformación
genera una rotación de nuestras variables centradas. Aquí, sería una matriz de datos como los de la Tabla 1, donde a cada dato se le ha restado su media correspondiente.
Las observaciones rotadas en el espacio de componentes principales se observan en la Figura 5. En este nuevo espacio, las distancias no han cambiado. Sin embargo, la posición relativa, salvo por la rotación efectuada, se mantiene entre las observaciones. Y, lo más destacable, es que en este nuevo espacio las variables, ahora llamadas componentes o scores, ya no están correlacionadas.

Con los datos ahora decorrelacionados, sólo resta un detalle, corregir las diferencias de variación. Para hacer esto usamos los valores propios. Como se mostró anteriormente, la varianza de cada componente principal es justamente su valor propio correspondiente. Sólo tenemos que dividir cada componente entre su desviación estándar y así lograr la estandarización en las dimensiones.
Esto lo logramos haciendo uso de la matriz , una matriz diagonal de valores propios. Esto es, , y los demás valores son 0. Una curiosidad de las matrices diagonales es que la potencia de una matriz diagonal se calcula elevando cada elemento de la diagonal principal a la potencia que se desea. Así, para tener una matriz con el recíproco de las desviaciones estándar de los componentes sólo necesitamos , pues . Ya sólo nos resta multiplicar para estandarizar
A este nuevo espacio de variables decorrelacionadas y estandarizadas se le conoce como espacio blanqueado, y al proceso para lograrlo se le llama blanqueamiento o whitening. Los resultados de este blanqueamiento los podemos apreciar en la Figura 6.

En la Figura 6 las escalas de los ejes se han ajustado para que sean iguales y la geometría sea más clara. Podemos apreciar que las elipses que teníamos en las Figuras anteriores ahora se han convertido en círculos perfectos con radios de 1, 2 y 3. En este nuevo espacio, dentro de un contexto normal, todos los segmentos de vectores que parten del centroide atraviesan los mismos niveles de concentración de datos. Dicho de otra manera, todas las direcciones desde el origen son comparables entre sí.
Observemos cómo quedan las nuevas coordenadas de nuestras observaciones. Para el Punto A, ahora tras el blanqueamiento, las coordenadas son . Mientras que las del Punto B son . Como el centroide en el espacio blanqueado es , para obtener la distancia euclidiana hacemos
Como estamos trabajando en el espacio blanqueado, donde no hay correlación y todas las unidades están en «desviaciones estándar», podemos decir que el Punto A está aproximadamente a 2.057 «desviaciones estándar» del centro de masa del espacio blanqueado, mientras que el punto B está a 4.386. La razón de poner «desviación estándar» entre comillas responde a que en realidad se trata de una distancia multivariada estandarizada que no corresponde a la desviación estándar de una sola variable o dirección original, pero la relación con el concepto de unidades de desviación estándar ayuda con la intuición por el proceso que se sigue.
Y esto es la distancia de Mahalanobis, la distancia euclidiana de un punto hacia su centro de masa, o centroide, en un espacio blanqueado. Y como el blanqueamiento se hizo con la desviación estándar de los componentes, las unidades de la distancia de Mahalanobis están en una escala estandarizada análoga a las unidades de desviación estándar, la misma medida que ya conocemos con la transformación .
Pero, ¿de dónde sale la ecuación de la distancia de Mahalanobis?
Para entender cómo aparece la ecuación de la distancia de Mahalanobis en este proceso de blanqueamiento y cálculo de la distancia euclidiana, conviene recordar un par de aspectos relativos al trabajo de matrices.
Recordatorio 1: la transformación espectral, o diagonalización matricial
La transformación espectral aplicada a la matriz de varianza-covarianza elevada a algún valor , nos dice que esta puede reexpresarse como
Para que esto sea cierto, es una matriz diagonal conformada por los valores propios, y para obtener su potencia lo único que hay que hacer es elevar individualmente los elementos de la diagonal al valor . Es decir, . Además, puesto que es ortogonal, .
Recordatorio 2: la distancia euclidiana y la norma de un vector
Dados dos puntos y , la distancia euclidiana entre estos dos puntos, de dos dimensiones cada uno es
que no es otra cosa que una aplicación del teorema de Pitágoras, donde la hipotenusa al cuadrado es igual a la suma de los catetos al cuadrado. Aquí, la distancia euclidiana es la hipotenusa.
Si el punto 2 estuviera en el origen, es decir , la ecuación de distancia se reduce a
y si fueran dimensiones lo podríamos generalizar a
Matricialmente esto lo podemos expresar de forma más compacta expresando el vector de las observaciones x como
y escribiendo
Al operador se le conoce con el nombre de norma, pero como hemos visto, la norma no es más que la distancia euclidiana del vector, o punto, hasta el origen.
Si estuviera expresado como vector fila
la distancia se reescribiría como
generando exactamente el mismo resultado.
Dos formas de expresar el blanqueamiento
Manteniendo el formato de vector fila, una observación
con media expresada de la misma forma
se centra como
lo que hace que el blanqueamiento para una sola observación sea
Como en el espacio blanqueado el centroide es el origen, la distancia euclidiana se obtiene como
puesto que es una matriz diagonal, , entonces,
Además, tenemos que ,
Luego, recordando que , nos queda
que es una forma muy parecida a la ecuación que inicialmente se presentó como la distancia de Mahalanobis. Si en lugar de trabajar con un formato de vector fila trabajamos con un formato de vector columna con
la distancia se reexpresa como
y esta sí es la expresión que inicialmente había presentado, quedando así demostrado que la distancia de Mahalanobis no es más que la distancia euclidiana de la observación al centro de masa calculada sobre un espacio transformado donde no hay correlación y las variables están estandarizadas.
¿Qué pasa si trabajamos con datos normales?
Si trabajamos con datos con distribución normal conocida, específicamente, con distribución normal multivariada, podemos obtener una distribución para el estadístico de Mahalanobis.
Para esto, debemos observar al estadístico de Mahalanobis como una distancia euclidiana del espacio blanqueado, quedando como
Este estadístico, elevado al cuadrado queda como una suma de variables al cuadrado,
Por propiedades de la distribución normal multivariada, estas variables estandarizadas son variables aleatorias con distribución normal estándar. Y además son independientes. Si tomamos en cuenta que cada normal estándar al cuadrado genera una distribución chi-cuadrada con un grado de libertad , obtenemos que
De esta manera,
Es decir, la distancia de Mahalanobis al cuadrado sigue una distribución chi-cuadrada con los grados de libertad iguales al número de variables involucradas.
Si los parámetros de la distribución normal multivariada no son conocidos, estos se pueden estimar de una muestra de datos, y la sería una aproximación. Para una distribución exacta nos tendríamos que mover a otra distribución, pero ese desarrollo vale para una nota técnica aparte.
Evaluar Puntos Atípicos
Si asumimos que nuestros datos vienen de una población normal multivariada, podemos definir límites a la variación natural. Asumiendo un nivel de significancia , por lo general definido en 0.05, podríamos etiquetar como atípicos a valores mayores a , donde
En la Tabla 2 se observan algunos de estos valores para .
| k | ||
| 2 | 5.99 | 9.21 |
| 3 | 7.81 | 11.34 |
| 4 | 9.49 | 13.28 |
| 5 | 11.07 | 15.09 |
| 6 | 12.59 | 16.81 |
| 7 | 14.07 | 18.48 |
| 8 | 15.51 | 20.09 |
| 9 | 16.92 | 21.67 |
| 10 | 18.31 | 23.21 |
En nuestro ejemplo, los puntos A y B estaban a una distancia y , por lo tanto,
Como son dos variables las involucradas, de la Tabla 2 tenemos que Así, podemos decir, con una significancia de 0.05, que el Punto A no es una observación atípica mientras que el Punto B sí lo es.
Cuando estos límites son utilizados para crear una carta de control que realiza un monitoreo multivariado, a esta carta de control la llamamos carta de control Hotelling .
3. Conclusión
La distancia de Mahalanobis no es más que la distancia euclidiana en un espacio donde nuestras variables han sido estandarizadas y su correlación eliminada. Gracias a la distancia de Mahalanobis podemos evaluar qué tan cerca se encuentra alguna observación de la población, cuando esta población está definida por múltiples atributos, factores o variables cuantitativas. La distancia de Mahalanobis es una de las bases del monitoreo multivariado y sobre la cual se definen muchos esquemas de control de datos.
Las mediciones individuales de una observación pueden estar dentro de un rango esperado, cuando estas mediciones se evalúan individualmente. Pero cuando analizamos nuestras mediciones en todas sus dimensiones podemos detectar patrones extraños que invitan al descubrimiento.
