Aula 1: Espaços Vetoriais, Normas e Métricas

Álgebra Linear e Otimização para Aprendizado de Máquina

Prof. Marcos Medeiros Raimundo

2026-08-10

Escalares, Vetores e a Máquina

Motivação: Traduzindo o Mundo Real

  • A máquina só processa números: Conceitos do mundo real precisam ser codificados quantitativamente.
  • Atributos (\(Features\)): Variáveis mensuráveis de um fenômeno.
  • Exemplos de representação vetorial:
    • Imagens: Pixels achatados em um vetor longo (\(\mathbb{R}^{784}\) para \(28 \times 28\)).
    • Dados Tabulares: Atributos de pacientes/clientes (\(\mathbf{x} \in \mathbb{R}^d\)).
    • Texto/NLP: Contagem de palavras ou embeddings (\(\mathbb{R}^{1536}\)).

Escalares vs. Vetores

  • Escalar (\(c \in \mathbb{R}\)): Número real único (ex: learning rate, temperatura).
  • Vetor-coluna (\(\mathbf{x} \in \mathbb{R}^d\)): Arranjo ordenado de \(d\) características:

\[\mathbf{x} = \begin{bmatrix} x_1 \\ x_2 \\ \vdots \\ x_d \end{bmatrix}\]

  • Operações Básicas (Element-wise):
    • Soma: \(\mathbf{u} + \mathbf{v} = [u_1 + v_1, \dots, u_d + v_d]^T\) (composição)
    • Escalar: \(\alpha \mathbf{v} = [\alpha v_1, \dots, \alpha v_d]^T\) (escala/redimensionamento)

Representação Visual: O Espaço de Características (Feature Space)

Geometria das Operações Vetoriais em \(\mathbb{R}^2\)

  • Soma (\(\mathbf{u} + \mathbf{v}\)): Combinação linear de forças/direções (Regra do Paralelogramo).
  • Multiplicação por Escalar (\(\alpha \mathbf{u}\)): Amplificação ou atenuamento de magnitude sem alterar a linha de ação.

Problema de Aprendizado e k-NN

O Problema de Aprendizado Supervisionado

  • Conjunto de Treino: \(\mathcal{D} = \{(\mathbf{x}_i, y_i)\}_{i=1}^N\), onde \(\mathbf{x}_i \in \mathbb{R}^d\) e \(y_i \in \mathcal{Y}\).
  • Classificação: \(y_i \in \{1, 2, \dots, C\}\) (rótulos discretos).
  • Regressão: \(y_i \in \mathbb{R}\) (valores contínuos).
  • Objetivo: Prever \(\hat{y}_{\text{novo}}\) para um novo vetor de características \(\mathbf{x}_{\text{novo}}\).

A Intuição do \(k\)-NN

  • Princípio da Vizinhança: Observações próximas no espaço de características compartilham propriedades semelhantes.
  • Não Paramétrico: O \(k\)-NN não assume uma forma funcional pré-definida para \(f(\mathbf{x})\); o próprio conjunto de treino \(\mathcal{D}\) define o modelo.
  • Mecânica Básica:
    1. Encontrar os \(k\) pontos de treino mais próximos de \(\mathbf{x}_{\text{novo}}\).
    2. Agregar seus rótulos por votação (classificação) ou média (regressão).

Formalização do \(k\)-NN

  • Conjunto de \(k\) Vizinhos: \(\mathcal{N}_k(\mathbf{x}_{\text{novo}}) \subset \mathcal{D}\) contendo as \(k\) amostras com menores \(d(\mathbf{x}_{\text{novo}}, \mathbf{x}_i)\).

  • Classificação (Votação Majoritária): \[\hat{y}_{\text{novo}} = \arg\max_{c} \sum_{i \in \mathcal{N}_k} \mathbb{I}(y_i = c)\]

  • Regressão (Média Aritmética): \[\hat{y}_{\text{novo}} = \frac{1}{k} \sum_{i \in \mathcal{N}_k} y_i\]

Ilustração Prática: Encontrando os \(k\) Vizinhos em \(\mathbb{R}^2\)

Espaços Vetoriais, Subespaços e a Hipótese da Variedade

Subespaços Vetoriais

  • Definição: Subconjunto \(U \subseteq V\) que preserva a estrutura linear plana de um espaço vetorial.
  • Condições (Regras de Fechamento):
    • Contém o vetor nulo (\(\mathbf{0} \in U\)).
    • Fechado para adição (\(\mathbf{x} + \mathbf{y} \in U\)).
    • Fechado para escalar (\(\lambda \mathbf{x} \in U\)).
  • Geometria: Retas e planos infinitos passando necessariamente pela origem. Não possuem curvatura.
  • Exemplo Válido: Solução de \(A\mathbf{x} = \mathbf{0}\).

O Espaço Real dos Dados: Variedades (Manifolds)

  • O que é um Manifold? Um espaço localmente plano, mas globalmente curvo.
  • O Fim da Linearidade: Uma variedade curva viola a definição de Subespaço Vetorial.
  • A Falha no Fechamento: Se você somar dois vetores \(\mathbf{x}\) e \(\mathbf{y}\) que estão sobre uma superfície curva (ex: esfera), o vetor resultante \(\mathbf{x} + \mathbf{y}\) apontará para fora da superfície, caindo no espaço nulo.

A Hipótese da Variedade e a Busca pelo Subespaço Latente

  • Se o Manifold é Plano: Ele é um subespaço afim/vetorial. Métodos de projeção linear (como PCA) funcionam perfeitamente.
  • Se o Manifold é Curvo: Forçar um plano rígido destrói a informação dos dados.
  • A Solução do Deep Learning: Redes neurais aplicam mapas não-lineares para “desamassar” a variedade curva original, enviando-a para um espaço latente.
  • O Subespaço Final: No espaço latente final, a variedade desamassada vira um subespaço perfeitamente plano, onde a distância Euclidiana volta a funcionar.

Normas e Produtos Internos

Normas: O Tamanho do Vetor

  • O que é uma norma? Uma função \(\|\cdot\|: V \rightarrow \mathbb{R}\) que mede o comprimento de um vetor.
  • Propriedades Obrigatórias:
    1. Homogeneidade Absoluta (\(\|\lambda x\| = |\lambda|\|x\|\)).
    2. Desigualdade Triangular (\(\|x + y\| \leq \|x\| + \|y\|\)).
    3. Positiva Definida (\(\|x\| \geq 0\) e \(\|x\| = 0 \Leftrightarrow x = \mathbf{0}\)).
  • Tipos Comuns em ML:
    • \(L_1\) (Manhattan): \(\|x\|_1 := \sum_{i=1}^n |x_i|\).
    • \(L_2\) (Euclidiana): \(\|x\|_2 := \sqrt{\sum_{i=1}^n x_i^2}\).
    • \(L_\infty\) (Chebyshev/Máximo): \(\|x\|_\infty := \max_i |x_i|\).

Demonstração Visual: As Geometrias das Normas

Métricas e a Ilusão da Distância Reta

Definição Formal de Métrica

  • O que é uma métrica? Uma função \(d: X \times X \to \mathbb{R}\) que quantifica a separação entre objetos.
  • Axiomas Obrigatórios:
    1. Não-negatividade (\(d(x, y) \geq 0\) e \(d(x, y) = 0 \iff x = y\)).
    2. Simetria (\(d(x, y) = d(y, x)\)).
    3. Desigualdade Triangular (\(d(x, z) \leq d(x, y) + d(y, z)\)).
  • Métrica Induzida por Norma: \[d(x, y) = \|x - y\|\]

Distância Euclidiana e a Maldição de Alta Dimensão

  • Intuição Física: Excelente para espaços de baixa dimensão (\(\mathbb{R}^2, \mathbb{R}^3\)).
  • O Colapso em Alta Dimensão (\(d \gg 1000\)):
    • Concentração de Distâncias: O ponto mais próximo e o mais distante tornam-se quase indistinguíveis.
    • Viés de Magnitude: O valor da norma \(L_2\) é dominado pelo tamanho absoluto (energia) dos vetores, mascarando o padrão real.

Similaridade do Cosseno em Alta Dimensão

  • Fórmula Formal: \[\text{Sim}_{\cos}(x, y) = \frac{\langle x, y \rangle}{\|x\|_2 \|y\|_2} = \cos(\theta)\]
  • Por que funciona melhor em alta dimensão?
    • Invariância de Escala: Ignora o tamanho absoluto do vetor, focando na proporção das características.
    • Geometria de Orientação: Em espaços latentes e textuais, a semântica é codificada pelo ângulo (direção), e não pelo comprimento do vetor.

A Distância do Cosseno: Métrica ou Quase-Métrica?

  • Fórmula Base: \[d_{\cos}(x, y) = 1 - \frac{\langle x, y \rangle}{\|x\|_2 \|y\|_2} = 1 - \cos(\theta)\]

  • 1. Não-negatividade: Como \(-1 \leq \cos(\theta) \leq 1\), temos que \(0 \leq d_{\cos}(x, y) \leq 2\).

  • 2. Simetria: Decorre diretamente da simetria do produto interno: \(\langle x, y \rangle = \langle y, x \rangle\).

  • 3. Desigualdade Triangular — \(d_{\cos}\) falha aqui: \[\sqrt{2\,d_{\cos}(x, y)} = \|\hat{x} - \hat{y}\|_2 \quad\text{(distância cordal, isso sim é métrica)}\]

Contraexemplo: vetores a \(0^\circ, 90^\circ, 135^\circ\) dão \(d_{\cos}(x,z)\approx 1{,}707 > d_{\cos}(x,y)+d_{\cos}(y,z) = 1{,}293\).

\(d_{\cos}\) não é uma métrica. O que é: \(\sqrt{2\,d_{\cos}}\) (distância cordal) ou \(\arccos(\cos\theta)\) (distância angular).

\(k\)-NN e Limitações Geométricas

\(k\)-NN: Limitações Geométricas e Prática

  • Premissa do \(L_2\): Assume que o espaço local é plano.
  • Garantias: Funciona com dados densos o suficiente para operar na porção localmente plana do manifold.
  • Desafios Práticos:
    • Fronteiras de Voronoi: Particionamento espacial baseado em distâncias.
    • Feature Scaling: Essencial para evitar que características de alta escala distorçam a geometria da norma.

Exemplo 1

RAG (Retrieval-Augmented Generation) é um \(k\)-NN para Texto

  • A Arquitetura: Documentos e perguntas são mapeados como vetores densos em um espaço latente de alta dimensão.

  • O Motor de Busca: A etapa de Retrieval (Recuperação) do RAG é um \(k\)-NN em larga escala, utilizando similaridade de cosseno ou distâncias normadas.

  • Síntese: Toda a teoria de espaços vetoriais, normas e métricas que estudamos hoje é o motor matemático por trás dos sistemas modernos de IA generativa baseados em conhecimento externo.