Definición
Para dos sucesos discretos x e y (p. ej., ítems léxicos), PMI(x,y)=log [P(x,y)/(P(x)P(y))]; cuantifica cuánto diverge la probabilidad conjunta observada de la probabilidad esperada bajo independencia. PMI>0 indica coocurrencia más frecuente que por azar, PMI<0 menos frecuente; PMI es indefinida si P(x,y)=0.

Principio

Principio
La PMI aumenta con la razón P(x,y)/(P(x)P(y)); por tanto, los ítems que coocurren de forma desproporcionada respecto a sus marginales reciben mayor PMI. No obstante, la PMI es sensible a sucesos de baja frecuencia y puede inflarse para coocurrencias raras.

Demostración

Demostración
Escenario ilustrativo → En un corpus hipotético supongamos P(New)=0,001, P(York)=0,0008 y P(New,York)=0,0007. Entonces PMI(New,York)=log(0,0007/(0,001×0,0008))≈log(875)≈6,77 (log natural), un valor positivo elevado que indica una fuerte asociación bajo estas suposiciones de frecuencia.

Aplicación incorrecta

Aplicación incorrecta
Interpretar un alto valor de PMI para un par con cuentas absolutas muy bajas como evidencia de una collocación robusta sin comprobar umbrales de frecuencia o significación estadística; omitir suavizado de ceros o normalización por tamaño del vocabulario.

Consecuencia

Consecuencia
PMI se emplea para ordenar candidatos a colocaciones e informar la selección de características en tareas de asociación léxica; si se usa sin restricción de frecuencia o normalización priorizará pares raros y posiblemente espurios, por lo que en la práctica se combina con filtros de frecuencia mínima o variantes normalizadas (p. ej. nPMI).

Inversión

Inversión
Cuando las probabilidades se estiman con fuerte suavizado, corrección de bajas cuentas o se aplican medidas normalizadas (nPMI, t-score, log-likelihood), la sensibilidad de PMI a eventos raros disminuye y su comportamiento ordinal puede cambiar; en modelos condicionados o contextuales, las medidas puntuales pueden reemplazarse por métricas de asociación condicional.

Límite

Límite
Claramente dentro: análisis de coocurrencia par a par en un único corpus con estimaciones empíricas de frecuencia. Caso límite: expresiones pluri-membres de más de dos tokens, donde la estimación de la probabilidad conjunta requiere tratamiento combinatorio distinto. Claramente fuera: métricas de similitud distribucional derivadas de modelos vectoriales que no comparan probabilidades conjuntas y marginales.

Tensión semántica

Tensión semántica
PMI ↔ Medidas Sensibles a la Frecuencia (p. ej., log-likelihood, t-score) — PMI enfatiza la desviación relativa respecto a la independencia y recompensa asociaciones proporcionales fuertes aun con evidencia absoluta pequeña; otras medidas privilegian el soporte absoluto, creando compensaciones en la detección de colocaciones.

Síntesis

Síntesis
PMI cuantifica la inesperabilidad de una coocurrencia dadas las marginales observadas, por lo que resulta valiosa para detectar asociaciones léxicas salientes; su uso efectivo exige umbrales de frecuencia, suavizado o normalización y la precaución de que una PMI alta puede deberse a rareza más que a un vínculo semántico robusto.