23set2026
09:00 Defesa de Doutorado Auditório do IC3
Tema
Selective Learning: Investigating the Impact of Data Quality on Portuguese Continued Pretraining
Aluno
Thales Rogério Sales Almeida
Orientador / Docente
Hélio Pedrini - Coorientador: Rodrigo Frassetto Nogueira
Breve resumo
Muitos estudos documentam diferenças de desempenho de modelos de linguagem de grande escala conforme o idioma e o contexto regional em que são avaliados. Em resposta, um conjunto crescente de trabalhos busca melhorar esses modelos continuando seu pré-treinamento em dados sub-representados no corpus original, que vão de textos em um idioma específico a domínios particulares. Esta tese examina o papel da seleção de dados nesse cenário e mostra que, ao adaptar um modelo para um idioma com baixa exposição, a qualidade e a composição dos dados de adaptação importam mais do que seu volume, e esse efeito se intensifica conforme a escala do modelo aumenta. Estabelecemos esses resultados usando o português como estudo de caso, embora as perguntas, os métodos e os princípios sejam pensados para generalizar a outros idiomas sub-representados. O trabalho se desenvolve em três etapas: medir a defasagem entre idiomas, construir a infraestrutura de dados e de avaliação necessária para estudá-la, e conduzir experimentos controlados de pré-treinamento continuado. Para caracterizar o problema, apresentamos o Timely Events Benchmark (TiEBe), com mais de 23.000 pares de pergunta e resposta cobrindo 23 regiões e 13 idiomas, que mostra forte correlação entre a recuperação factual e indicadores socioeconômicos regionais. Para viabilizar experimentos controlados, construímos o ClassiCC-PT, um corpus de português em larga escala extraído do Common Crawl por meio de um pipeline documentado e reprodutível, cujo núcleo é um conjunto de classificadores de conteúdo específicos para o idioma que superam de forma substancial suas contrapartes treinadas apenas em inglês. Desenvolvemos o PoETa v2, o benchmark mais abrangente de avaliação de modelos de linguagem em português até o momento, com 44 tarefas, das quais 12 foram desenvolvidas nativamente. Ele foi usado na maior avaliação sistemática de modelos em português já realizada e oferece a resolução por categoria necessária para identificar onde as intervenções nos dados têm efeito. Sobre essas bases, executamos nossos experimentos centrais por meio do pré-treinamento continuado de checkpoints em inglês, produzindo a família de modelos Curió. O principal resultado é que a qualidade dos dados pode superar a quantidade a partir de uma escala suficiente de modelo: um modelo treinado com um conjunto pequeno de tokens selecionados por classificador supera outro treinado com uma ordem de magnitude mais tokens não filtrados em todas as categorias de avaliação, consumindo apenas uma fração da computação. Mostramos também que a reescrita sintética atua como multiplicador de qualidade e não como equalizador, amplificando muito mais os dados de alta qualidade do que os de baixa qualidade. A estratégia combinada produz os modelos mais fortes treinados neste trabalho. Dois princípios se repetem. A qualidade dos dados supera consistentemente a quantidade, e o retorno da curadoria orientada por qualidade cresce com a escala do modelo: intervenções que reconfiguram os resultados em 7B parâmetros deixam os modelos de 1,1B praticamente inalterados. O pré-treinamento continuado se mostra um caminho eficiente para a adaptação linguística, pois transfere capacidade geral do inglês e exige apenas um orçamento modesto de tokens bem escolhidos no idioma-alvo. Todos os conjuntos de dados, classificadores, modelos e benchmarks são disponibilizados publicamente. Juntos, oferecem uma receita prática e um conjunto de princípios empíricos para adaptar modelos de linguagem a idiomas sub-representados, com o português como caso demonstrativo.
Banca examinadora
Titulares:
Hélio Pedrini IC/UNICAMP
Aline Marins Paes Carvalho IC/UFF
Helena de Medeiros Caseli CCET/UFSCar
Marcos Medeiros Raimundo IC/UNICAMP
Marcelo da Silva Reis IC/UNICAMP
Suplentes:
Anderson de Rezende Rocha IC/UNICAMP
Thiago Alexandre Salgueiro Pardo ICMC/USP
Ronaldo Cristiano Prati CMCC/UFABC
Instituto de Computação
Privacy Overview

This website uses cookies so that we can provide you with the best user experience possible. Cookie information is stored in your browser and performs functions such as recognising you when you return to our website and helping our team to understand which sections of the website you find most interesting and useful.