29set2026
09:00 Defesa de Doutorado Sala 85 do IC2
Tema
Representation Learning of Visual Features Through Self-Supervision
Aluno
Thalles Santos Silva
Orientador / Docente
Hélio Pedrini - Coorientador: Gerberth Adín Ramírez Rivera
Breve resumo
A mudança de paradigma do aprendizado supervisionado para o autossupervisionado representa um marco fundamental na área de aprendizado de máquina. Essa nova abordagem possibilitou o desenvolvimento de modelos de fundação escaláveis que aprendem diretamente dos dados, sem a necessidade de rótulos produzidos por humanos. Na área de Visão Computacional, embora os modelos atuais de autossupervisão concorram diretamente com os modelos supervisionados, suas arquiteturas ainda carregam vieses implícitos que limitam sua adoção em aplicações de ponta. Para superar tais limitações, esta tese apresenta uma progressão de soluções que repensam como as características visuais são aprendidas, extraídas, armazenadas e organizadas. Primeiramente, para mitigar a decimação espacial causada por arquiteturas convolucionais, introduzimos o método Contextualized Local Visual Embeddings (CLoVE), que adapta o mecanismo de autoatenção de múltiplas cabeças e evita operações de pooling que agregam vetores locais em um único vetor global, preservando a granularidade informacional necessária para tarefas de predição densa. Em seguida, para solucionar as instabilidades de otimização nos métodos de agrupamento baseados em protótipos, propomos o Consistent Assignment of Views over Random Partitions (CARP), um algoritmo do tipo dividir e conquistar que regulariza o treinamento por meio de estocasticidade, garantindo um aprendizado estável de ponta a ponta sem depender de heurísticas complexas. Motivados pelo custo computacional e de otimização em manter protótipos, apresentamos uma alternativa não paramétrica aos métodos de agrupamento autossupervisionados. Propomos o Memory Augmented Self-Supervised Learning (MaSSL), que substitui protótipos rígidos por um módulo de memória, permitindo que o modelo de rede neural aprenda diretamente a partir de experiências passadas ao contrastar sinais atuais com conceitos vivenciados anteriormente. Com base nesses mesmos princípios, formulamos o Self-Organizing Prototypes (SOP) para resolver os problemas de superagrupamento predominantes nos métodos padrão. Diferentemente das abordagens atuais, o SOP delega as responsabilidades de atribuição a múltiplas representações em memória. Por fim, para solucionar as ineficiências representacionais das filas First-In-First-Out (FIFO) passivas que alimentam os sistemas de memória não paramétricos existentes, introduzimos o Complexity-Adaptive Memory (CAM), que implementa uma política de roteamento dinâmico Refine-ou-Insira, capaz de comprimir de forma autônoma características redundantes e realoca a capacidade de memória com base na dificuldade implícita de cada conceito. Através de extensas avaliações qualitativas e quantitativas, demonstramos que os métodos propostos superam as limitações identificadas, melhorando consistentemente o poder representacional em comparação ao estado da arte. Em suma, as soluções aqui apresentadas fornecem uma base robusta e escalável para a próxima geração de métodos visuais autossupervisionados.
Banca examinadora
Titulares:
Hélio Pedrini IC/UNICAMP
Alceu de Souza Britto Junior CCET/PUCPR
Ronaldo Cristiano Prati CMCC/UFABC
Fabricio Aparecido Breve IGCE/UNESP
Levy Boccato FEEC/UNICAMP
Suplentes:
Esther Luna Colombini IC/UNICAMP
Moacir Antonelli Ponti ICMC/USP
Edimilson Batista dos Santos DCOMP/UFSJ
Instituto de Computação
Privacy Overview

This website uses cookies so that we can provide you with the best user experience possible. Cookie information is stored in your browser and performs functions such as recognising you when you return to our website and helping our team to understand which sections of the website you find most interesting and useful.