24ago2026
14:00 Defesa de Doutorado sala 85 do IC2
Tema
Towards Robust Visual Odometry under Camera Failures and Diverse Motion Profiles: From Learned Frontends to Geometry-Informed Dense–Sparse Fusion
Aluno
Hudson Martins Silva Bruno
Orientador / Docente
Esther Luna Colombini
Breve resumo
A Odometria Visual (VO) é fundamental para sistemas autônomos, no entanto, os sistemas clássicos baseados em geometria permanecem altamente frágeis quando implantados em ambientes não estruturados ou sujeitos a falhas de câmera. Esta tese investiga a integração de aprendizado profundo em pipelines de VO para superar essas vulnerabilidades. A pesquisa avalia inicialmente frameworks híbridos que incorporam extratores de características baseados em aprendizado e métodos de correspondência baseados em atenção em backends tradicionais. Esses experimentos fundamentais revelam um trade-off crítico: embora as redes neurais profundas aumentem significativamente a robustez do rastreamento local contra falhas de câmera, elas frequentemente apresentam dificuldade em manter a consistência global de longo prazo, inerente aos métodos clássicos. Para quantificar essas vulnerabilidades e avaliar a robustez dos sistemas, este trabalho introduz o conjunto de dados QueensCAMP. Este novo benchmark injeta sistematicamente falhas de câmera padronizadas (como condensação na lente, sujeira e quebra) em trajetórias desafiadoras do mundo real. Avaliações utilizando este conjunto de dados confirmam que, embora os modelos de aprendizado profundo ponta-a-ponta exibam capacidades superiores de rastreamento contínuo em comparação com o SLAM clássico baseado em geometria, eles permanecem suscetíveis a erros não corrigidos ao generalizarem entre domínios distintos. Com base nessas percepções, a pesquisa explora a capacidade dos Vision Transformers (ViTs) para VO ponta-a-ponta. Para alinhar os mecanismos de atenção semântica com o rastreamento espacial preciso, propõe-se uma nova estratégia de aprendizado curricular geométrico, utilizando a estimativa de homografia autossupervisionada como uma tarefa proxy de pré-treinamento. Por fim, essas investigações combinadas culminam no desenvolvimento da Odometria Visual Direta-Indireta Profunda (DDI-VO, Deep Direct-Indirect Visual Odometry), uma nova arquitetura monocular. A DDI-VO unifica fundamentalmente os paradigmas de VO direto denso e indireto esparso, fundindo a percepção contextual global de um ViT calibrado por homografia com a rigidez estrutural de âncoras geométricas esparsas por meio de um mecanismo de atenção cruzada. Avaliações foram realizadas em benchmarks heterogêneos (direção autônoma, voos de alta velocidade e cenários internos irregulares com câmera portátil) para demonstrar a robustez da arquitetura. Embora o DDI-VO não tenha obtido o menor erro em todos os benchmarks, ele se manteve consistentemente entre os melhores desempenhos nos domínios automotivo, aéreo e interno, superando de forma decisiva ambas as linhas de base sob condições de falha de câmera no QueensCAMP, estabelecendo-se como um framework generalista e robusto para a estimativa precisa do movimento da câmera em ambientes diversos, perfis de movimento distintos e sob condições de falhas de câmera.
Banca examinadora
Titulares:
Esther Luna Colombini IC/UNICAMP
Gustavo Teodoro Laureano INF/UFG
Valdir Grassi Junior EESC/USP
André Oliveira Françani EESC/USP
Alisson Vasconcelos de Brito CI/UFPB
Suplentes:
Gabriel Capiteli Bertocco IC/UNICAMP
Fernando dos Santos Osório ICMC/USP
Flavio Tonidandel Socialdroids Robotics
Instituto de Computação
Privacy Overview

This website uses cookies so that we can provide you with the best user experience possible. Cookie information is stored in your browser and performs functions such as recognising you when you return to our website and helping our team to understand which sections of the website you find most interesting and useful.