 ##  [Información Mutua Puntual (PMI)](/es/node/70350) 

 Definición

Para dos sucesos discretos x e y (p. ej., ítems léxicos), PMI(x,y)=log [P(x,y)/(P(x)P(y))]; cuantifica cuánto diverge la probabilidad conjunta observada de la probabilidad esperada bajo independencia. PMI&gt;0 indica coocurrencia más frecuente que por azar, PMI&lt;0 menos frecuente; PMI es indefinida si P(x,y)=0.

 

 

 

 

 

 





## Principio

Principio

La PMI aumenta con la razón P(x,y)/(P(x)P(y)); por tanto, los ítems que coocurren de forma desproporcionada respecto a sus marginales reciben mayor PMI. No obstante, la PMI es sensible a sucesos de baja frecuencia y puede inflarse para coocurrencias raras.

 

 

 

 

 





## Demostración

Demostración

Escenario ilustrativo → En un corpus hipotético supongamos P(New)=0,001, P(York)=0,0008 y P(New,York)=0,0007. Entonces PMI(New,York)=log(0,0007/(0,001×0,0008))≈log(875)≈6,77 (log natural), un valor positivo elevado que indica una fuerte asociación bajo estas suposiciones de frecuencia.

 

 

 

 

## Aplicación incorrecta

Aplicación incorrecta

Interpretar un alto valor de PMI para un par con cuentas absolutas muy bajas como evidencia de una collocación robusta sin comprobar umbrales de frecuencia o significación estadística; omitir suavizado de ceros o normalización por tamaño del vocabulario.

 

 

 

 

 





## Consecuencia

Consecuencia

PMI se emplea para ordenar candidatos a colocaciones e informar la selección de características en tareas de asociación léxica; si se usa sin restricción de frecuencia o normalización priorizará pares raros y posiblemente espurios, por lo que en la práctica se combina con filtros de frecuencia mínima o variantes normalizadas (p. ej. nPMI).

 

 

 

 

## Inversión

Inversión

Cuando las probabilidades se estiman con fuerte suavizado, corrección de bajas cuentas o se aplican medidas normalizadas (nPMI, t-score, log-likelihood), la sensibilidad de PMI a eventos raros disminuye y su comportamiento ordinal puede cambiar; en modelos condicionados o contextuales, las medidas puntuales pueden reemplazarse por métricas de asociación condicional.

 

 

 

 

 





## Límite

Límite

Claramente dentro: análisis de coocurrencia par a par en un único corpus con estimaciones empíricas de frecuencia. Caso límite: expresiones pluri-membres de más de dos tokens, donde la estimación de la probabilidad conjunta requiere tratamiento combinatorio distinto. Claramente fuera: métricas de similitud distribucional derivadas de modelos vectoriales que no comparan probabilidades conjuntas y marginales.

 

 

 

 

 





## Tensión semántica

Tensión semántica

PMI ↔ Medidas Sensibles a la Frecuencia (p. ej., log-likelihood, t-score) — PMI enfatiza la desviación relativa respecto a la independencia y recompensa asociaciones proporcionales fuertes aun con evidencia absoluta pequeña; otras medidas privilegian el soporte absoluto, creando compensaciones en la detección de colocaciones.

 

 

 

 

 





## Síntesis

Síntesis

PMI cuantifica la inesperabilidad de una coocurrencia dadas las marginales observadas, por lo que resulta valiosa para detectar asociaciones léxicas salientes; su uso efectivo exige umbrales de frecuencia, suavizado o normalización y la precaución de que una PMI alta puede deberse a rareza más que a un vínculo semántico robusto.