Aprendizado Não Supervisionado
2026-08-30
Sem rótulo \(y\) — só \(\mathbf{x}_1,\dots,\mathbf{x}_N\).
Que forma esses dados têm?
Profiling: descrever o comportamento típico, depois reconhecer o desvio. Um sensor de temperatura e um de vibração que variam juntos sob operação normal — um ponto novo se parece com isso?
Caminho da aula: assumir uma família teórica → ajustar → usar a verossimilhança para decidir o que é típico.
Distribuição empírica: o histograma/a nuvem de pontos em si. Nunca “errada”, mas ruidosa e não generaliza.
Aposta desta aula: assumir uma família teórica com poucos parâmetros — troca ruído por estrutura, ao custo de a suposição poder estar errada.
\[ \mathcal{N}(\mathbf{x}\mid\boldsymbol\mu,\Sigma) = \frac{1}{(2\pi)^{d/2}|\Sigma|^{1/2}} \exp\left\{-\tfrac12(\mathbf{x}-\boldsymbol\mu)^T\Sigma^{-1}(\mathbf{x}-\boldsymbol\mu)\right\} \]
Por que a Gaussiana? Máxima entropia dada média/covariância; Teorema Central do Limite (soma de muitos efeitos pequenos).
\[ \hat{\boldsymbol\mu} = \frac1N\sum_n \mathbf{x}_n \qquad \hat\Sigma_{\text{ML}} = \frac1N\sum_n(\mathbf{x}_n-\hat{\boldsymbol\mu})(\mathbf{x}_n-\hat{\boldsymbol\mu})^T \]
Viés: \(\mathbb{E}[\hat\Sigma_{\text{ML}}] = \frac{N-1}{N}\Sigma\). Correção: dividir por \(N-1\) (np.cov padrão).
Se \(N\le d\): \(\hat\Sigma\) não é invertível. Sem inversa, sem Mahalanobis, sem verossimilhança. Antecipa a maldição da dimensionalidade da Aula 2.
\[ D_M(\mathbf{x})^2 = (\mathbf{x}-\hat{\boldsymbol\mu})^T\hat\Sigma^{-1}(\mathbf{x}-\hat{\boldsymbol\mu}) \]
“Reduz à Euclidiana quando \(\Sigma=I\)” — em geral, não é a Euclidiana.
\(\Sigma^{-1}\) estica nas direções de baixa variância, comprime nas de alta variância.
\(D_M(\mathbf{x})^2 \sim \chi^2_d\) (resultado clássico, verificado no 01-fontes.md, não vem de PRML/DLFC).
\[ p(\mathbf{x}) = 1 - F_{\chi^2_d}\big(D_M(\mathbf{x})^2\big) \]
“Probabilidade de um ponto do modelo ajustado ser tão extremo quanto \(\mathbf{x}\)” — não “probabilidade de \(\mathbf{x}\) vir do modelo certo”.
Limiar fixo = caso particular \(p(\mathbf{x})<\alpha\). \(p\)-valor ordena por surpresa em vez de só separar em duas caixas.
\(\hat\Sigma\) diagonal = supor independência (PRML p. 84: mais rápido de inverter, mas “limita a capacidade de capturar correlações interessantes”).
Por dimensão: \(p_i(x_i)\) da marginal \(\mathcal{N}(\hat\mu_i,\hat\sigma_i^2)\). Combinado por Fisher: \(-2\sum_i\ln p_i \sim \chi^2_{2d}\).
Relaxar a suposição de família única: \(k\)-NN e KDE, densidade não-paramétrica. Preço: a maldição da dimensionalidade.
UNICAMP — Instituto de Computação