Resumo: Este trabalho é um relatório final de um projeto realizado como Iniciação Científica, visando a avaliação de um subsistema de memória episódica e sua adaptação para uma arquitetura cognitiva utilizando o CST (Cognitive Systems Toolkit). A realização deste trabalho contou com o suporte financeiro e foi facilitada pela infraestrutura de pesquisa do Hub de Inteligência Artificial e Arquiteturas Cognitivas (H.IAAC) e do Laboratório de Controle e Automação (LCA) instalados no Campus da UNICAMP.
Uma memória episódica é uma funcionalidade essencial na construção de arquiteturas cognitivas, pois permite que agentes aprendam com experiências passadas, melhorando a tomada de decisão e o planejamento futuros. No processo de desenvolvimento de uma memória episódica para o CST, inspirou-se no subsistema de memória episódica desenvolvido pelo CINVESTAV, estudou-se o modelo arquitetural e reproduziram-se os testes no mesmo simulador (Unity) utilizado no projeto original.
Adaptou-se, posteriormente, para a estrutura principal do CST: Memorys para armazenar informações; Codelets intencionais realizando ações paralelas; e Ideas como forma de representação do conhecimento. Foi possível reproduzir alguns testes e foram identificadas limitações do modelo original (feito pelo CINVESTAV) que necessitam de aprimoramento antes de disponibilizarmos como uma ferramenta integrada ao CST.
Resumo: A busca por maior produtividade na programação de GPUs tem motivado o surgimento de modelos que elevam o nível de abstração sem sacrificar desempenho. Nesse contexto, a NVIDIA introduziu o CUDA Tile, que adota o tile como unidade lógica de execução, comunicação e sincronização entre threads, encapsulando padrões de cooperação tradicionalmente expressos de forma manual em CUDA. Este trabalho investiga empiricamente esse modelo, comparando-o com o CUDA tradicional e com o Triton, um compilador JIT com auto-tuning que parte do mesmo diagnóstico, mas adota filosofia distinta.
São descritos os três modelos, a metodologia de comparação (princípio de equidade, protocolo de medição, tratamento estatístico e o modelo Roofline como ferramenta unificadora) e a infraestrutura experimental desenvolvida (bench harness). A comparação é conduzida sobre quatro padrões de kernels que cobrem o espectro do Roofline: redução paralela, multiplicação de matrizes com Tensor Cores, stencil 2D e atenção fundida. Os resultados mostram que o valor da abstração depende do padrão: há empate no padrão limitado por memória sem reúso, ganho expressivo sobre o esforço manual idiomático nos padrões limitados por computação e por fusão de kernels, e perda de desempenho no stencil, em que o controle manual da memória compartilhada explora melhor o reúso de vizinhança. Em todos os casos, as abstrações reduzem o código e a sincronização explícita.
Resumo: Robôs móveis autônomos que operam em ambientes compartilhados com pessoas são sistemas críticos de segurança: falhas de controle têm consequência física direta. Na prática, a análise de segurança e a geração de casos de teste costumam ser conduzidas de forma desarticulada, sem rastreabilidade explícita entre as restrições de segurança levantadas e os testes efetivamente executados. Este trabalho investiga a aplicação integrada de duas técnicas complementares -- a System-Theoretic Process Analysis (STPA), para a análise de segurança, e +a Conformance and Fault Injection (CoFI), para a modelagem comportamental e a derivação de casos de teste --, estendendo uma combinação já proposta na literatura com os passos finais de concretização: a geração e a execução automatizada dos testes, por meio da ferramenta AltWalker, contra um simulador independente do sistema, e uma validação preliminar da eficácia da suíte por análise de mutação. A abordagem é aplicada a um cenário concreto -- um robô autônomo de entrega de bandejas em um restaurante -- e resulta em um pipeline rastreável de ponta a ponta, que liga cada perda e perigo identificados na análise a uma restrição de segurança, a uma transição do modelo comportamental e, por fim, a um caso de teste executável.
Resumo: Este trabalho propõe mitigar o impacto da latência e da perda de pacotes em redes veiculares por meio da predição antecipada de falhas de conexão. O estudo analisa a viabilidade de algoritmos de aprendizado de máquina otimizados para dispositivos com recursos limitados de memória e processamento, empregando o paradigma Tiny Machine Learning (TinyML). Os modelos foram treinados sem restrições iniciais de hardware, tendo seu consumo de memória e tempo de inferência avaliados a posteriori para assegurar a aplicabilidade na Borda (Unidade de Bordo / On-Board Unit - OBU). Utilizando dados empíricos de rádio no padrão Intelligent Transport Systems em 5 GHz (ITS-G5) e de rede celular, o sistema aplica o deslocamento de janelas no tempo (time-shifting) para prever quedas de sinal. Essa técnica permite o acionamento antecipado do handover preditivo. Cabe ressaltar que, embora os testes tenham sido conduzidos no contexto de transição entre o padrão Wireless Access in Vehicular Environments (WAVE) e as tecnologias celulares 4G/5G, o método proposto é agnóstico e aplicável a outros tipos de handover preditivo, tanto horizontal como vertical. Os resultados indicam que, enquanto modelos como o Random Forest são eficientes para previsões de curtíssimo prazo, a Rede Neural Convolucional 1D (CNN 1D) despontou como a solução TinyML mais equilibrada. Demandando apenas
KB de memória e apresentando inferência rápida (
ms), a CNN 1D superou redes recorrentes mais complexas tais como Long Short Term Memory (LSTM) e Gated Recurring Unit (GRU), mantendo precisão satisfatória (acima de 75%) em horizontes de curto (1s) e médio prazo (10s) e apresentando limitações mais relevantes apenas em cenários de previsão de longo prazo (20s).
Abstract: This work proposes mitigating the impact of latency and packet loss in vehicular networks through the early prediction of connection failures. The study analyzes the feasibility of machine learning algorithms optimized for devices with limited memory and processing resources, using the Tiny Machine Learning (TinyML) paradigm. The models were trained without initial hardware constraints, with memory consumption and inference time evaluated afterwards to ensure applicability at the Edge (On-Board Unit - OBU). Using empirical radio data from the Intelligent Transport Systems standard at 5 GHz (ITS-G5) and from cellular networks, the system applies time-shifting to predict signal drops, enabling proactive predictive handover. Although the experiments were conducted in the context of transitions between WAVE and 4G/5G cellular technologies, the proposed method is technology-agnostic and applicable to other types of predictive handover, both horizontal and vertical. Results indicate that, while models such as Random Forest are efficient for very short-term predictions, the 1D Convolutional Neural Network (CNN 1D) emerged as the most balanced TinyML solution. Requiring only
KB of memory and fast inference (
ms), the CNN 1D outperformed more complex recurrent networks such as LSTM and GRU, maintaining satisfactory accuracy (above 75%) in short-term (1s) and medium-term (10s) horizons, with more relevant limitations only in long-term prediction scenarios (20s).
Resumen Este trabajo propone mitigar el impacto de la latencia y la pérdida de paquetes en redes vehiculares mediante la predicción anticipada de fallos de conexión, empleando algoritmos de Tiny Machine Learning (TinyML) ejecutables en la Unidad de a Bordo (OBU). Con datos empíricos ITS-G5 y celulares, y mediante time-shifting, el sistema anticipa el handover predictivo. Los resultados indican que la CNN 1D es la solución TinyML más equilibrada (
KB,
ms), superando a LSTM y GRU en horizontes de corto y medio plazo.
Resumo: O advento das redes móveis 5G e da tecnologia de Network Slicing viabilizou a coexistência de fatias lógicas heterogêneas (eMBB, URLLC e mMTC) sobre uma mesma infraestrutura física de rádio. Para mitigar congestionamentos e assegurar os exigentes Acordos de Nível de Serviço (SLAs), o núcleo de rede requer previsões de tráfego proativas de múltiplos passos diretos (DMS) extremamente ágeis e precisas. Este trabalho apresenta uma avaliação comparativa de desempenho (benchmarking) sistemática entre modelos de Deep Learning baseados em atenção global (PatchTST e suas variantes de ablação) e estimadores de menor sobrecarga computacional (CNN1D, LSTM, DLinear, SARIMA, SNaive e Naive) utilizando o conjunto de dados de simulação realística DeepSlice. A modelagem foi estruturada sobre uma série agregada horária de 168 horas, dividida cronologicamente (70% treino e 30% teste), com janela de histórico de
horas e horizontes preditivos de curto (
) e longo prazo (
). Os resultados empíricos na escala física desnormalizada de solicitações por hora revelaram a supremacia absoluta da arquitetura convolucional compacta CNN 1D operando sob independência de canais, que assinalou os menores desvios globais sendo seguida de perto pelos baselines sazonais. Em contrapartida, as variantes do PatchTST e a rede recorrente LSTM sofreram severos colapsos preditivos induzidos por overfitting de alta variância, dispersão de entropia de atenção e contaminação cruzada de escala, validando empiricamente a teoria do finite-sample gap sob regimes de amostragem finita. Conclui-se que a simplicidade estrutural e a regularização espacial da CNN 1D unificam exatidão e viabilidade computacional periférica, consolidando-a como o motor preditivo ideal para a orquestração dinâmica do núcleo celular 5G.
Resumo: Este projeto apresenta o Trabalho de Conclusão de Curso em Engenharia da Computação. Ele corresponde ao Volume II de uma série voltada à programação competitiva, servindo tanto de complemento aos tópicos já abordados quanto de introdução a novos temas para o leitor. O trabalho reúne um conjunto de tópicos avançados de algoritmos, cobrindo teoria dos jogos, combinatória, probabilidade e algoritmos complementares sobre grafos direcionados e árvores.
Resumo: TV Boxes apreendidas pela Receita Federal, por falta de homologação da Anatel, preservam capacidade computacional que pode ser redirecionada para fins úteis, em vez de seguirem para destruição. Uma primeira versão de um sistema de suporte a aplicações IoT baseado nesse hardware reaproveitado já havia demonstrado, por meio de sua validação no sistema de estacionamento inteligente do Instituto de Computação da Unicamp, que uma TV Box é capaz de sustentar os serviços de retaguarda de uma aplicação IoT real, ainda que restrita às necessidades específicas desse caso de uso. Este trabalho apresenta o desenvolvimento de uma nova versão desse sistema, reprojetada como uma plataforma genérica e desacoplada de qualquer aplicação específica, capaz de oferecer observabilidade, monitoramento de disponibilidade orientado a eventos, atualização remota de firmware alinhada à RFC 9019, coleta de dados de sensores em tempo real e notificações extensíveis a qualquer dispositivo IoT que implemente o protocolo de comunicação definido. O sistema é composto por um proxy de autenticação baseado em TLS mútuo, um broker de mensagens MQTT e cinco serviços independentes, apoiados por uma camada de persistência em nuvem e acessíveis por meio de bibliotecas clientes voltadas a diferentes classes de dispositivo, de computadores de placa única a microcontroladores com recursos restritos. O sistema foi validado por meio da simulação do mesmo estacionamento inteligente utilizado como referência na versão anterior, permitindo observar, ao longo de duas semanas de operação contínua, estabilidade e recuperação adequada diante de falhas de dispositivo, de rede e de energia, além do funcionamento correto dos mecanismos de detecção de falhas e de atualização remota. Os resultados obtidos indicam que a nova versão preserva a capacidade já demonstrada da TV Box reaproveitada para essa função, ao mesmo tempo em que supera as limitações identificadas na versão anterior, ampliando o potencial de reaproveitamento desse hardware para qualquer projeto de IoT que necessite de serviços básicos de suporte.
Abstract: The Signed Minimum Common Intergenic String Partition (SMCISP) problem is used in approximation algorithms for genome-rearrangement distances and is NP-hard even over binary alphabets. We experimentally compare two exact approaches--a fixed-parameter branching algorithm and integer linear programming (ILP)--and study whether heuristic information improves them. We consider (i) time to certify optimality under explicit safety limits and (ii) the best feasible solution available after a fixed solver budget. On small instances and on the
high-alphabet families (
and
), the cold ILP is substantially faster than the FPT algorithm and certifies optimality; the FPT also certifies on the small instances but frequently times out at
. The low-alphabet
family is an important exception: the ILP formulation becomes very large, while the FPT algorithm finds better feasible solutions within the tested budget. Supplying only a valid upper-bound value produces no practically meaningful runtime gain in the tested configurations. Moreover, a cost-only FPT seed may leave no materialized incumbent partition, and an ILP cutoff may leave the solver with no internal incumbent, although the heuristic partition remains available to the warm-start pipeline. Supplying the complete heuristic partition as a MIP start to the CB model avoids this loss of information: on the tested
intergenic instance, the incumbent available after the solver budget changes from
to
blocks, while the reported optimality gap changes from about
to
. The ILP does not improve upon the seeded partition within
s; its contribution in this experiment is to provide a lower bound and certify the quality of the heuristic incumbent. Overall, the results show that the usefulness of a warm start depends on both instance structure and the information passed to the solver, and that the FPT and ILP approaches are complementary on the tested benchmark.
Abstract: Cancer remains a pressing public health challenge in Brazil, demanding data-driven strategies to improve patient outcomes. The objective of this work is to develop and evaluate machine learning and deep learning models to predict the overall survival of patients with cancer at the beginning of the initial treatment, using demographic, diagnostic, and treatment-related information available at that time. This study uses a large-scale dataset from the Brazilian National Cancer Institute (INCA). By processing over 5.4 million raw longitudinal records through a PySpark pipeline to resolve severe data quality and temporal inconsistencies, we extracted a refined cohort of 73,459 high-quality samples. Our predictive modeling explored binary classification (random forest, XGBoost, multi-layer perceptron, AutoGluon, and ensembles), achieving high discriminative power with ROC-AUC scores around 0.88, and advanced survival analysis (DeepSurv and XGBoost Survival) for time-to-event dynamics, where the DeepSurv neural network reached a C-index of approximately 0.85. Interpretability analyses revealed that the primary tumor site, metastasis staging, patient age, and treatment history are the most critical predictors of mortality risk. Ultimately, these results validate the feasibility of applying artificial intelligence to Brazilian hospital oncology records, demonstrating the potential of these models for future clinical decision-support applications within the Unified Health System (SUS).
Resumo: Jogos sérios têm sido utilizados como mecanismo terapêutico complementar para auxiliar no desenvolvimento de funções executivas em crianças com Transtorno do Déficit de Atenção e Hiperatividade (TDAH). Pesquisas recentes avaliam positivamente a eficácia dessa abordagem, mas mencionam a necessidade de estudos voltados a entender e otimizar elementos de design de jogos construídos para esse propósito. Este trabalho analisa um conjunto de jogos digitais com evidências favoráveis de efetividade, buscando identificar características de design recorrentes. As características encontradas fundamentam o desenvolvimento de um jogo móvel denominado S.P.A.C.E., voltado para crianças com TDAH, implementado na linguagem Dart e framework Flutter. O jogo combina três minijogos voltados, respectivamente, ao treinamento de memória de trabalho, atenção e flexibilidade cognitiva, integrados por uma narrativa comum.
Resumo: Algoritmos de busca são componentes fundamentais em muitos jogos digitais, responsáveis por mover agentes de um ponto a outro. Em mapas estáticos, algoritmos como Dijkstra e A* oferecem garantias sobre sua otimalidade. Porém, jogos muitas vezes possuem mapas dinâmicos, com objetos que se movem em tempo real, o que exige o replanejamento do caminho e a implementação de algoritmos alternativos, como o HPA e o Flow Fields. Este trabalho implementa e compara quatro algoritmos de pathfinding: Dijkstra, A*, HPA* e Flow Fields, assim como sua visualização em um jogo simples 2D, em diferentes tipos de simulação. Os resultados demonstram que não existe uma solução universal. Em mapas estáticos, o HPA* apresentou um desempenho até 18 vezes superior ao Dijkstra. Contudo, a necessidade de reconstrução integral da hierarquia em ambientes dinâmicos tornou o HPA* até 39 vezes mais lento em tempo de parede. O Flow Field mostrou-se o mais eficiente para dezenas de agentes com um destino compartilhado e estável (0,77ms por chamada), mas seu desempenho degradou drasticamente para 6,1ms com a movimentação do objetivo. Adicionalmente, confirmou-se que A* e Dijkstra apresentam desempenhos estatisticamente idênticos em mapas com alta heterogeneidade de custos de terreno, invalidando a vantagem da heurística de Manhattan neste contexto.
Resumo: Este trabalho apresenta uma análise comparativa sobre a acessibilidade comunicacional voltada a jogadores surdos e com deficiência auditiva no contexto de jogos digitais. Avaliou-se a implementação de recursos de redundância visual e sensorial nos títulos Fortnite, Valorant e Muck com base nas diretrizes do Game Accessibility Guidelines (GAG). Os resultados revelam os impactos das barreiras de design na experiência do usuário e na integridade competitiva, propondo reflexões sobre justiça (fairness) e design participativo.
Abstract: This work presents a comparative analysis of communication accessibility for deaf and hard-of-hearing players in digital games. The implementation of visual and sensory redundancy features in Fortnite, Valorant, and Muck was evaluated based on the Game Accessibility Guidelines (GAG). The results reveal the impact of design barriers on user experience and competitive integrity, proposing reflections on fairness and participatory design.
Resumo: Este relatório apresenta o Totem de Decisões Compartilhadas, uma prova de conceito de artefato socioenativo tangível voltado a apoiar conversas sobre ética e tecnologia com crianças. O projeto parte da necessidade de tratar temas como privacidade, consentimento, uso de dados e inteligência artificial por meio de experiências educativas participativas e mediadas. O protótipo desenvolvido integra um artefato físico com botões, potenciômetro, LEDs e buzzer, firmware em MicroPython, servidor local, motor de microhistórias e interface web. A interação permite que decisões coletivas registradas fisicamente sejam convertidas em eventos e refletidas na progressão de narrativas sobre dilemas tecnológicos. Os testes em ambiente de laboratório verificaram o funcionamento do ciclo completo entre hardware, servidor e interface narrativa, demonstrando a viabilidade técnica da proposta. Embora ainda não tenha sido avaliado com crianças em contexto educativo, o trabalho consolida uma base funcional e extensível para futuras investigações sobre artefatos socioenativos tangíveis na educação ética em tecnologia.
Abstract: This report presents the Shared Decisions Totem, a proof of concept of a tangible socioenactive artifact designed to support conversations about ethics and technology with children. The project addresses the need to discuss topics such as privacy, consent, data use, and artificial intelligence through participatory and mediated educational experiences. The developed prototype integrates a physical artifact with buttons, a potentiometer, LEDs and a buzzer, MicroPython firmware, a local server, a microstory engine, and a web interface. The interaction allows collective decisions physically registered on the artifact to be converted into events and reflected in the progression of narratives about technological dilemmas. Laboratory tests verified the complete interaction cycle among hardware, server, and narrative interface, demonstrating the technical feasibility of the proposal. Although it has not yet been evaluated with children in an educational context, the work consolidates a functional and extensible basis for future investigations on tangible socioenactive artifacts in ethical technology education.
Abstract: As autonomous LLM agents become primary consumers of web services, they discover and delegate to one another in open ecosystems - a Web of Open Agents - yet existing discovery infrastructures offer no principled way to govern how agents compete for visibility, risking pay-to-win dynamics in which advertising spend, not merit, drives selection. We propose Sponsored Discovery, whose core is MACS (Match-gated Agent Composite Score): semantic domain match acts as a multiplicative gate that structurally bounds out-of-domain agents regardless of bid or reputation, coupled with a multi-dimensional behavioral reputation over accuracy, latency, and cost. Using real LLM agents that answer MMLU-Pro questions across three adversarial scenarios (honest baseline, domain-falsifying fraudster, SLA/cost-inflated agent), MACS achieves the highest delegation success across all three. Our results from a paired ablation show MACS's advantage over a purely additive composite: decisive under domain misreporting and marginal in benign settings, where behavioral reputation alone suffices, while bid-only and quality-adjusted baselines are exploited. This study further analyzes its incentive properties and limits (calibrated misrepresentation, Sybil whitewashing).
Abstract: A promoção do engajamento estudantil em ambientes digitais de aprendizagem é um desafio contínuo, exigindo abordagens que unam a absorção de conteúdo à colaboração. Para endereçar essa lacuna, este estudo propõe o Social Quizzles, uma solução que integra dinâmicas gamificadas de questionários colaborativos e puzzles de caça-palavras adaptativos, utilizando Inteligência Artificial Generativa para a criação de atividades e materiais de apoio. A solução foi avaliada empiricamente, por meio de um delineamento transversal ancorado na integração de instrumentos psicométricos consolidados. Os resultados atestaram a excelente usabilidade do sistema e altos níveis de motivação intrínseca. A análise da experiência lúdica confirmou o equilíbrio do design, demonstrando que o estímulo competitivo provido pelo ranqueamento atua em sinergia com a necessidade de coesão social e colaboração entre os pares. Conclui-se que o Social Quizzles constitui uma ferramenta eficaz de aprendizagem ativa, capaz de harmonizar o rigor acadêmico com o engajamento lúdico.
Resumo: A qualidade de um Large Language Model (LLM) depende fortemente dos dados da fase de pré-treinamento, e a curadoria desses dados é uma das alavancas mais acessíveis para melhorá-la, especialmente para idiomas com menos recursos que o inglês, como o português. Este trabalho estuda, de forma controlada, como diferentes métodos de filtragem e deduplicação aplicados ao corpus de continuação de pré-treinamento (continued pre-training, CPT) de um modelo Qwen2.5-0.5B-Instruct afetam, em português, a modelagem de linguagem e a capacidade de seguir instruções do modelo.
Realizamos sete experimentos de CPT (R1 a R7), com o objetivo de isolar o efeito da receita de curadoria sobre cada uma dessas duas capacidades do modelo resultante. Como elementos comuns a todos eles, mantivemos os mesmos pesos iniciais e os mesmos hiperparâmetros de treinamento, sempre com uma única época, e partimos sempre do mesmo corpus inicial de cerca de 5 bilhões de tokens, amostrado proporcionalmente de 19 fontes do Hugging Face e de um snapshot de 2025 do Common Crawl, de modo que a curadoria fosse a única variável entre as execuções. O que distingue cada experimento é, portanto, apenas a receita aplicada a esse corpus, combinando métodos de deduplicação (exata e MinHash, em escopo global e por fonte) e de filtragem heurística de qualidade e de repetição (em versões estrita e relaxada). Para medir o impacto de cada receita, utilizamos duas famílias de métricas, uma por eixo: a modelagem de linguagem foi medida pela perplexidade (PPL) sobre dois conjuntos held-out e por dois benchmarks de predição de última palavra (CALAME e LAMBADA-PT), ao passo que a capacidade de instrução foi medida pelo agregado do Open Portuguese LLM Leaderboard (OpenPTLLM).
Nossos resultados indicam que, em todos os sete experimentos e como pretendido, o CPT melhora a modelagem do português, o que se expressa na perplexidade e no CALAME-PT, e degrada a capacidade de instrução. A receita de melhor modelagem de linguagem, R4 (deduplicação MinHash por fonte), reduz a perplexidade held-out em cerca de 33% em relação ao modelo sem CPT (REF), ao custo de cerca de 7,5% da nota de instrução; uma penalidade positiva ocorre nas sete execuções, entre 6% e 15% do agregado do REF. Observamos também um desacoplamento entre os eixos: a receita de melhor modelagem de linguagem (R4) não é a de melhor capacidade de instrução (R1), e tampouco é a pior. Por fim, a filtragem estrita penaliza a perplexidade, e relaxar alguns poucos limiares recupera cerca de 43% da distância que separa a filtragem estrita da melhor execução do estudo.
Palavras-chave: continued pre-training; deduplicação; filtragem de qualidade; corpus em português; perplexidade; avaliação de LLM.
Abstract: The quality of a Large Language Model (LLM) depends heavily on the data of the pre-training phase, and curating that data is one of the most accessible levers for improving it, especially for languages with fewer resources than English, such as Portuguese. This work studies, in a controlled manner, how different filtering and deduplication methods applied to the continued pre-training (CPT) corpus of a Qwen2.5-0.5B-Instruct model affect, in Portuguese, the language modeling and the instruction-following ability of the model.
We ran seven CPT experiments (R1 to R7), with the goal of isolating the effect of the curation recipe on each of these two capabilities of the resulting model. As elements common to all of them, we kept the same initial weights and the same training hyperparameters, always with a single epoch, and we always started from the same initial corpus of about 5 billion tokens, sampled proportionally from 19 Hugging Face sources and from a 2025 snapshot of Common Crawl, so that curation was the only variable across the runs. What distinguishes each experiment is, therefore, only the recipe applied to that corpus, combining deduplication methods (exact and MinHash, at global and per-source scope) and heuristic quality and repetition filtering (in strict and relaxed versions). To measure the impact of each recipe, we used two families of metrics, one per axis: language modeling was measured by perplexity (PPL) over two held-out sets and by two last-word prediction benchmarks (CALAME and LAMBADA-PT), whereas instruction-following ability was measured by the aggregate of the Open Portuguese LLM Leaderboard (OpenPTLLM).
Our results indicate that, in all seven experiments and as intended, CPT improves the modeling of Portuguese, which is expressed in perplexity and in CALAME-PT, and degrades instruction-following ability. The recipe with the best language modeling, R4 (per-source MinHash deduplication), reduces held-out perplexity by about 33% relative to the model without CPT (REF), at the cost of about 7.5% of the instruction score; a positive penalty occurs in all seven runs, between 6% and 15% of the REF aggregate. We also observe a decoupling between the axes: the recipe with the best language modeling (R4) is not the one with the best instruction-following ability (R1), nor is it the worst. Finally, strict filtering penalizes perplexity, and relaxing a few thresholds recovers about 43% of the distance separating strict filtering from the best run of the study.
Keywords: continued pre-training; deduplication; quality filtering; Portuguese corpus; perplexity; LLM evaluation.
Resumo: A adoção de práticas de Continuous Software Engineering (CSE) tem se tornado cada vez mais importante para organizações que buscam aumentar a qualidade do software e reduzir o tempo de entrega de novas funcionalidades. Nesse contexto, o instrumento Zeppelin foi proposto para avaliar o nível de adoção dessas práticas e, posteriormente, recebeu extensões capazes de gerar recomendações personalizadas de acordo com o perfil e o diagnóstico de cada organização. Entretanto, as soluções existentes eram voltadas principalmente para experimentos de pesquisa, não oferecendo uma plataforma integrada para aplicação do instrumento e acompanhamento dos resultados. Este trabalho apresenta o desenvolvimento de uma plataforma web para aplicação do Zeppelin, permitindo o gerenciamento de organizações, a realização de avaliações, a visualização de diagnósticos e recomendações, além do acompanhamento da evolução das organizações ao longo do tempo. No contexto deste Projeto Final de Graduação, o foco concentrou-se no desenvolvimento do módulo de gerenciamento de organizações e das funcionalidades de análise, incluindo mecanismos para comparação entre ciclos de avaliação e benchmarking entre organizações com perfis semelhantes. Como resultado, a plataforma passou a oferecer uma experiência integrada para utilização do instrumento Zeppelin, ampliando suas capacidades por meio de funcionalidades que facilitam a interpretação dos resultados, o acompanhamento da evolução organizacional e a comparação com outras organizações, contribuindo para apoiar a adoção de práticas contínuas de desenvolvimento de software.
Abstract: The adoption of Continuous Software Engineering (CSE) practices has become increasingly important for organizations seeking to improve software quality and reduce the time required to deliver new features. In this context, the Zeppelin instrument was proposed to assess the adoption level of CSE practices and was later extended with personalized recommendations based on an organization's profile and assessment results. However, the available solutions were primarily designed for research purposes and did not provide an integrated web platform for applying the instrument and monitoring its results. This work presents the development of a web-based platform for the Zeppelin instrument, enabling organization management, questionnaire execution, diagnostic visualization, personalized recommendations, and the monitoring of organizational evolution over time. Within the scope of this Final Graduation Project, the work focused on implementing the organization management module and analysis functionalities, including mechanisms for comparing assessment cycles and benchmarking organizations with similar profiles. As a result, the platform provides an integrated environment for using the Zeppelin instrument, extending its capabilities with features that facilitate result interpretation, support the monitoring of organizational evolution, and enable comparisons between organizations, contributing to the adoption of continuous software engineering practices.
Resumo: A adoção de práticas de Engenharia de Software Contínua tem se tornado relevante para organizações que buscam melhorar continuamente seus processos de desenvolvimento de software, reduzir riscos, ampliar a previsibilidade das entregas e responder de forma mais adequada a mudanças de contexto. Nesse cenário, instrumentos de diagnóstico, como o Zeppelin, permitem avaliar o grau de adoção de práticas contínuas e apoiar a identificação de forças, fragilidades e oportunidades de evolução. Este trabalho apresenta o desenvolvimento de uma ferramenta analítica voltada à apresentação dos resultados do instrumento Zeppelin. A ferramenta organiza as saídas do diagnóstico em visualizações, recomendações e componentes de consulta histórica por ciclos de avaliação, apoiando a interpretação dos resultados e o planejamento de ações de melhoria contínua em organizações de software.
Resumo: A adoção de práticas de Engenharia Contínua de Software (ECS) tem se mostrado um diferencial competitivo na indústria. Para mensurar essa adoção, foi proposto o instrumento Zeppelin, baseado nos modelos Stairway to Heaven e Eye of CSE. Este trabalho descreve o desenvolvimento e a avaliação do módulo de Questionário para uma interface digital projetada para operacionalizar o instrumento Zeppelin. O desenvolvimento priorizou a criação de uma Single Page Application em React, implementando políticas de isolamento de contexto e mecanismos de persistência de dados. A solução foi avaliada por meio de testes automatizados de front-end e submetida à avaliação conceitual junto aos idealizadores da ferramenta. Os resultados confirmam que a interface web digitalizou o processo de diagnóstico, viabilizando integrações com motores de recomendação e de análise de dados.
Abstract: The adoption of Continuous Software Engineering (CSE) practices has proven to be a competitive advantage in the industry. To measure this adoption, the Zeppelin instrument was proposed, based on the Stairway to Heaven and Eye of CSE models. This work describes the development and evaluation of the Questionnaire module for a digital interface designed to operationalize the Zeppelin instrument. The development prioritized the creation of a Single Page Application in React, implementing context isolation policies and data persistence mechanisms. The solution was evaluated through automated front-end tests and submitted to conceptual assessment with the tool's original authors. The results confirm that the web interface digitized the diagnostic process, enabling integrations with recommendation and data analysis engines.
|
Instituto de Computação ::
Universidade Estadual de Campinas
Av. Albert Einstein, 1251 - Cidade Universitária Zeferino Vaz • 13083-852 Campinas, SP - Brasil • Fone: [19] 3521-5838 |