@techreport{TR-IC-PFG-26-06,
   number = {IC-PFG-26-06},
   author  =  {Pedro  Gadêlha and Luiz Bonifacio and Hélio Pedrini and
                   Roberto Lotufo},
   title   =  {{Ablação  de  Curadoria  de  Dados  na  Continuação  de 
                   Pré-Treinamento de LLM em Português}},
   month = {July},
   year = {2026},
   institution = {Institute of Computing, University of Campinas},
   note = {In Portuguese, 34 pages.
    \par\selectlanguage{brazil}\textbf{Resumo}
       A  qualidade  de  um  {\em  Large Language Model} (LLM) depende
       fortemente  dos dados da fase de pré-treinamento, e a curadoria
       desses   dados   é  uma  das  alavancas  mais  acessíveis  para 
       melhorá-la, especialmente para idiomas com menos recursos que o
       inglês,  como  o  português.  Este  trabalho  estuda,  de forma
       controlada,  como  diferentes métodos de {\em filtragem} e {\em
       deduplicação}   aplicados   ao   corpus   de   continuação   de  
       pré-treinamento  ({\em  continued  pre-training},  CPT)  de  um 
       modelo  Qwen2.5-0.5B-Instruct afetam, em português, a modelagem
       de  linguagem  e  a  capacidade de seguir instruções do modelo.
       \par  Realizamos  sete  experimentos  de  CPT  (R1 a R7), com o
       objetivo  de isolar o efeito da receita de curadoria sobre cada
       uma   dessas   duas  capacidades  do  modelo  resultante.  Como 
       elementos  comuns  a  todos  eles,  mantivemos  os mesmos pesos
       iniciais e os mesmos hiperparâmetros de treinamento, sempre com
       uma  única  época, e partimos sempre do mesmo corpus inicial de
       cerca de 5 bilhões de {\em tokens}, amostrado proporcionalmente
       de  19 fontes do Hugging Face e de um {\em snapshot} de 2025 do
       Common  Crawl,  de  modo que a curadoria fosse a única variável
       entre  as  execuções.  O  que  distingue  cada  experimento  é, 
       portanto,  apenas  a receita aplicada a esse corpus, combinando
       métodos  de  deduplicação  (exata  e  {\em  MinHash}, em escopo
       global e por fonte) e de filtragem heurística de qualidade e de
       repetição (em versões estrita e relaxada). Para medir o impacto
       de  cada receita, utilizamos duas famílias de métricas, uma por
       eixo:  a  modelagem  de  linguagem foi medida pela perplexidade
       (PPL)  sobre  dois  conjuntos  {\em  held-out}  e por dois {\em
       benchmarks}   de   predição   de   última   palavra  (CALAME  e 
       LAMBADA-PT),  ao passo que a capacidade de instrução foi medida
       pelo  agregado  do Open Portuguese LLM Leaderboard (OpenPTLLM).
       \par   Nossos   resultados   indicam  que,  em  todos  os  sete 
       experimentos  e  como  pretendido, o CPT melhora a modelagem do
       português,  o que se expressa na perplexidade e no CALAME-PT, e
       degrada   a  capacidade  de  instrução.  A  receita  de  melhor 
       modelagem  de  linguagem,  R4  (deduplicação  {\em MinHash} por
       fonte), reduz a perplexidade {\em held-out} em cerca de 33\% em
       relação  ao modelo sem CPT (REF), ao custo de cerca de 7,5\% da
       nota  de  instrução;  uma  penalidade  positiva ocorre nas sete
       execuções,  entre  6\%  e  15\%  do agregado do REF. Observamos
       também  um  {\em  desacoplamento}  entre os eixos: a receita de
       melhor modelagem de linguagem (R4) não é a de melhor capacidade
       de  instrução  (R1),  e tampouco é a pior. Por fim, a filtragem
       estrita  penaliza  a  perplexidade,  e  relaxar  alguns  poucos 
       limiares  recupera  cerca  de  43\%  da  distância que separa a
       filtragem   estrita   da   melhor   execução  do  estudo.  \par 
       Palavras-chave:  {\em  continued  pre-training};  deduplicação; 
       filtragem  de  qualidade;  corpus  em  português; perplexidade;
       avaliação de LLM.
    \par\selectlanguage{english}\textbf{Abstract}
       The  quality of a Large Language Model (LLM) depends heavily on
       the  data  of the pre-training phase, and curating that data is
       one  of the most accessible levers for improving it, especially
       for  languages  with  fewer  resources  than  English,  such as
       Portuguese.  This  work  studies,  in  a controlled manner, how
       different  {\em  filtering}  and  {\em  deduplication}  methods 
       applied  to  the  continued  pre-training  (CPT)  corpus  of  a 
       Qwen2.5-0.5B-Instruct model affect, in Portuguese, the language
       modeling  and  the  instruction-following ability of the model.
       \par  We ran seven CPT experiments (R1 to R7), with the goal of
       isolating  the  effect  of the curation recipe on each of these
       two  capabilities of the resulting model. As elements common to
       all  of  them,  we  kept  the same initial weights and the same
       training  hyperparameters,  always  with a single epoch, and we
       always  started from the same initial corpus of about 5 billion
       tokens, sampled proportionally from 19 Hugging Face sources and
       from  a 2025 snapshot of Common Crawl, so that curation was the
       only   variable   across  the  runs.  What  distinguishes  each 
       experiment  is,  therefore,  only  the  recipe  applied to that
       corpus,  combining deduplication methods (exact and MinHash, at
       global   and   per-source  scope)  and  heuristic  quality  and 
       repetition  filtering  (in  strict  and  relaxed  versions). To
       measure  the  impact  of  each  recipe, we used two families of
       metrics,  one  per  axis:  language  modeling  was  measured by
       perplexity  (PPL)  over  two held-out sets and by two last-word
       prediction   benchmarks   (CALAME   and   LAMBADA-PT),  whereas 
       instruction-following  ability was measured by the aggregate of
       the  Open  Portuguese  LLM  Leaderboard  (OpenPTLLM).  \par Our
       results   indicate  that,  in  all  seven  experiments  and  as 
       intended,  CPT  improves  the  modeling of Portuguese, which is
       expressed   in   perplexity  and  in  CALAME-PT,  and  degrades 
       instruction-following   ability.   The  recipe  with  the  best 
       language   modeling,  R4  (per-source  MinHash  deduplication), 
       reduces held-out perplexity by about 33\% relative to the model
       without   CPT  (REF),  at  the  cost  of  about  7.5\%  of  the 
       instruction score; a positive penalty occurs in all seven runs,
       between  6\%  and  15\% of the REF aggregate. We also observe a
       {\em  decoupling}  between  the  axes: the recipe with the best
       language   modeling   (R4)   is  not  the  one  with  the  best 
       instruction-following  ability  (R1),  nor  is  it  the  worst. 
       Finally,  strict filtering penalizes perplexity, and relaxing a
       few  thresholds  recovers about 43\% of the distance separating
       strict filtering from the best run of the study. \par Keywords:
       continued   pre-training;   deduplication;  quality  filtering; 
       Portuguese corpus; perplexity; LLM evaluation.
  }
}
