24ago2026
14:00 Defesa de Doutorado sala 85 do IC2
Tema
Towards Robust Visual Odometry under Camera Failures and Diverse Motion Profiles: From Learned Frontends to Geometry-Informed Dense–Sparse Fusion
Aluno
Hudson Martins Silva Bruno
Orientador / Docente
Esther Luna Colombini
Breve resumo
A Odometria Visual (VO) é fundamental para sistemas autônomos, no entanto, os sistemas clássicos baseados em geometria permanecem altamente frágeis quando implantados em ambientes não estruturados ou sujeitos a falhas de câmera. Esta tese investiga a integração de aprendizado profundo em pipelines de VO para superar essas vulnerabilidades. A pesquisa avalia inicialmente frameworks híbridos que incorporam extratores de características baseados em aprendizado e métodos de correspondência baseados em atenção em backends tradicionais. Esses experimentos fundamentais revelam um trade-off crítico: embora as redes neurais profundas aumentem significativamente a robustez do rastreamento local contra falhas de câmera, elas frequentemente apresentam dificuldade em manter a consistência global de longo prazo, inerente aos métodos clássicos. Para quantificar essas vulnerabilidades e avaliar a robustez dos sistemas, este trabalho introduz o conjunto de dados QueensCAMP. Este novo benchmark injeta sistematicamente falhas de câmera padronizadas (como condensação na lente, sujeira e quebra) em trajetórias desafiadoras do mundo real. Avaliações utilizando este conjunto de dados confirmam que, embora os modelos de aprendizado profundo ponta-a-ponta exibam capacidades superiores de rastreamento contínuo em comparação com o SLAM clássico baseado em geometria, eles permanecem suscetíveis a erros não corrigidos ao generalizarem entre domínios distintos. Com base nessas percepções, a pesquisa explora a capacidade dos Vision Transformers (ViTs) para VO ponta-a-ponta. Para alinhar os mecanismos de atenção semântica com o rastreamento espacial preciso, propõe-se uma nova estratégia de aprendizado curricular geométrico, utilizando a estimativa de homografia autossupervisionada como uma tarefa proxy de pré-treinamento. Por fim, essas investigações combinadas culminam no desenvolvimento da Odometria Visual Direta-Indireta Profunda (DDI-VO, Deep Direct-Indirect Visual Odometry), uma nova arquitetura monocular. A DDI-VO unifica fundamentalmente os paradigmas de VO direto denso e indireto esparso, fundindo a percepção contextual global de um ViT calibrado por homografia com a rigidez estrutural de âncoras geométricas esparsas por meio de um mecanismo de atenção cruzada. Avaliações foram realizadas em benchmarks heterogêneos (direção autônoma, voos de alta velocidade e cenários internos irregulares com câmera portátil) para demonstrar a robustez da arquitetura. Embora o DDI-VO não tenha obtido o menor erro em todos os benchmarks, ele se manteve consistentemente entre os melhores desempenhos nos domínios automotivo, aéreo e interno, superando de forma decisiva ambas as linhas de base sob condições de falha de câmera no QueensCAMP, estabelecendo-se como um framework generalista e robusto para a estimativa precisa do movimento da câmera em ambientes diversos, perfis de movimento distintos e sob condições de falhas de câmera.
Banca examinadora
Titulares:
| Esther Luna Colombini | IC/UNICAMP |
| Gustavo Teodoro Laureano | INF/UFG |
| Valdir Grassi Junior | EESC/USP |
| André Oliveira Françani | EESC/USP |
| Alisson Vasconcelos de Brito | CI/UFPB |
Suplentes:
| Gabriel Capiteli Bertocco | IC/UNICAMP |
| Fernando dos Santos Osório | ICMC/USP |
| Flavio Tonidandel | Socialdroids Robotics |