17th Brazilian Symposium in Information and Human Language Technology
Cuiabá, Mato Grosso, BrazilOctober 19–22, 2026
up
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
Bryan Khelven da Silva Barbosa | Aline Paes | Ariani Di Felippo
Bryan Khelven da Silva Barbosa | Aline Paes | Ariani Di Felippo
Extending Enhanced Universal Dependencies to Nheengatu: Semi-Automated Control and Raising Annotation
Dominick Maia Alexandre | Leonel Figueiredo de Alencar
Dominick Maia Alexandre | Leonel Figueiredo de Alencar
This paper presents the first Enhanced Universal Dependencies annotation effort for a Brazilian Indigenous language, focusing on XCOMP constructions in Nheengatu, an endangered Tupian language. We describe a semiautomatic pipeline for the UD Nheengatu-CompLin treebank to annotate control and raising predicates and propagated subjects. The method combines theoretical discussions on XCOMP constructions with corpus-based analysis of Nheengatu syntax to create rule-based enhancement heuristics. The work also provides annotation guidelines and expands EUD resources for Indigenous and low-resource languages within the Universal Dependencies framework.
Leakage-Aware Evaluation of Brazilian Clinical Notes for ICU Mortality Prediction: A Study on the BRATECA Dataset
Felipe André Bach Alves | Heloísa Oss Boll | Mariana Recamonde-Mendoza
Felipe André Bach Alves | Heloísa Oss Boll | Mariana Recamonde-Mendoza
Early prediction of ICU mortality can support clinical decisions, but retrospective notes can contain future-event cues that cause leakage in clinical NLP. We evaluate leakage-aware modeling of Brazilian Portuguese ICU notes for mortality prediction using BRATECA. We compare 24-hour restriction, regex and LLM leakage auditing, neural and TF-IDF representations, and unrestricted-note baselines. In the 24-hour setting, models achieved AUROC 0.78-0.83; unrestricted notes reached around 0.95, indicating outcome-related information in late documentation. Regex found leakage signals in 21.13% of the notes, and the LLM audit identified additional semantic cases. Results highlight the need for temporal control and leakage auditing in clinical NLP.
Do LLM Judges Agree with Humans? Evaluating Financial Commentaries from Material Facts
Gabriel Assis | Daniela Vianna | Livy Real | Marina Ramalhete Masid | João Nepomuceno | Eduardo Rottschaefer | Altigran Soares da Silva | Aline Paes
Gabriel Assis | Daniela Vianna | Livy Real | Marina Ramalhete Masid | João Nepomuceno | Eduardo Rottschaefer | Altigran Soares da Silva | Aline Paes
The rapid adoption of large language models (LLMs) in finance has enabled automated generation of in-domain texts such as earnings summaries, market analyses, and commentary on regulated disclosures. Generating accurate and accessible financial commentary from material facts poses challenges related to domain-specific language, strict factual faithfulness, and readability. Evaluating such outputs is difficult: traditional automatic metrics overlook financial correctness and adequacy, while human expert assessment is reliable but costly and subjective. This paper proposes a multidimensional evaluation protocol for generating financial commentary in Portuguese and investigates the use of LLMs as evaluators (“LLMs-as-judges”) in this high-stakes, low-resource setting. We systematically compare human expert judgments and LLM-based evaluation preferences, while also investigating complementary dimensions such as writing quality, factuality, usefulness, and simplicity. To the best of our knowledge, this is the first proposal of an evaluation protocol for this task in Portuguese. Furthermore, we analyze where LLM judgments align with or diverge from human assessments, providing practical insights and recommendations for evaluation methodologies in financial AI applications.
Expressões multipalavras no discurso de fóruns sobre saúde mental: desenvolvimento de um corpus em inglês e português brasileiro
Gabriela Berndt | Sofia Serrano | Mariana Jin | Adriana Pagano
Gabriela Berndt | Sofia Serrano | Mariana Jin | Adriana Pagano
Expressões multipalavras (multiword expressions, MWEs), isto é, sequências de palavras que apresentam algum grau de idiossincrasia, são centrais tanto para os estudos linguísticos quanto para o Processamento de Linguagem Natural (PLN). Este artigo apresenta a criação de um novo corpus de MWEs em postagens em inglês e português brasileiro de comunidades do Reddit dedicadas à saúde mental — um domínio ainda sub-representado nos recursos existentes de MWEs, predominantemente baseados em textos jornalísticos. O corpus foi compilado manualmente, anotado automaticamente com informações morfossintáticas e sintáticas por meio do parser UDPipe, revisado no Arborator Grew e anotado manualmente na plataforma FLAT, seguindo as diretrizes do PARSEME. A análise combina a distribuição de frequência por categoria de MWE e uma investigação contrastiva interlinguística. Os resultados evidenciam especificidades das MWEs nesse domínio e construções que funcionam como recursos convencionalizados para expressar sentimentos, avaliações e estados subjetivos no discurso sobre saúde mental nas redes sociais.
Text segmentation with mixed data: evaluating symbolic and neural approaches
Amanda Sammer do N. Brandão | Felipe Bomfim Sanches | Alfredo Sena | Laila Mota | Daniela Barreiro Claro | Rerisson Cavalcante
Amanda Sammer do N. Brandão | Felipe Bomfim Sanches | Alfredo Sena | Laila Mota | Daniela Barreiro Claro | Rerisson Cavalcante
A segmentação de texto vem sendo amplamente difundida e utilizada para extrair informação relevante de documentos. Essas informações estão distribuídas em diversos tipos de estruturas, que incluem dados heterogêneos. A extração desses dados tem sido ultimamente, utilizada por LLMs (Large Language Models). Porém, os treinamentos dos modelos de linguagem não detém características peculiares de dados mistos, tais como dados lexicais e dados fonéticos. Assim, torna-se um desafio analisar a corretude das transcrições de maneira automatizada por LLMs. Neste estudo, a segmentação textual e extração de informação foi paralelizada em duas principais abordagens com o intuito de avaliar a comparação de uma abordagem simbólica e uma abordagem neural. Os resultados demonstram as vantagens e desvantagens em ambas as abordagens para os tipos de dados mistos.
Exploring Hybrid Pre-training for Automatic Essay Scoring
Miguel M. Carpi | Igor C. Silveira | Denis D. Mauá | Marcelo Finger
Miguel M. Carpi | Igor C. Silveira | Denis D. Mauá | Marcelo Finger
Alternatives to Large Language Models have been proposed to develop smaller models that require substantially less training data. In this paper, we propose a monolingual (Portuguese) Hybrid Transformer model trained with only 260M words, whose size is comparable to that of small Encoder-based models. After pre-training, we fine-tune our model and compare it against 11 existing models on the AES-ENEM dataset — an Automatic Essay Scoring benchmark in which models are required to evaluate five distinct textual dimensions. Our experiments demonstrate that our model is always competitive with the (bigger) best available model, despite its smaller scale.
ENEM Essay Feedback Using LLM-Augmented Prompts
Flavio Carvalho | Vanessa Soares | Eduardo Bezerra | Gustavo Guedes
Flavio Carvalho | Vanessa Soares | Eduardo Bezerra | Gustavo Guedes
This paper evaluates automated feedback generation for ENEM Competency 5 by augmenting zero-shot prompts with an Evaluator Term Set (CTA), a term set proposed in this work and extracted from human evaluator comments on Competency 5. We compare CTA-augmented feedback against a zero-shot baseline on 46 essays with human reference feedback using BERTScore F1 and the Wilcoxon signed-rank test. CTA augmentation increases mean BERTScore F1 for both models, with statistically significant improvement in semantic similarity to human feedback for both evaluated models at α = 0.05.
Empirical Study Towards RBAMR-News: a Rule-Based AMR Parser for News in Portuguese
Maria Julia Bernardo Comarim | Ariani Di-Felippo
Maria Julia Bernardo Comarim | Ariani Di-Felippo
This work evaluates AMR graph construction rules, originally developed for literary texts, in Portuguese news data to support building a symbolic AMR parser for this genre. Using the AMRNews-PT gold-standard corpus, we conduct an ablation analysis to assess rule contributions to AMR representation quality. The results reveal a hierarchical organization in which a small set of core structural rules drives most parsing performance, while additional rules provide finer semantic refinements. This rule hierarchy serves as the basis for building the parser and enabling the annotation of a larger news corpus.
A Comparative Framework for Diachronic Lexical Semantic Change in Brazilian Portuguese Political Discourse
João Victor M. Correa | Oto Araújo Vale | Renato Moraes Silva
João Victor M. Correa | Oto Araújo Vale | Renato Moraes Silva
Shifts in political discourse often reflect societal changes, but quantifying how lexical usage and semantic representations vary over time remains a challenge for computational linguistics. To compare approaches under different computational constraints, we propose a cost-aware, modeland language-agnostic framework to compare lexical and semantic change signals. We apply it to Brazilian Portuguese political discourse using a shared panel of lemmas combining drift candidates, stable controls, and theory-driven seeds. We compare three families of diachronic drift signals: a TF-IDF lexical-salience baseline, aligned slice-specific Word2Vec models, and a contextual BERT approach. Results indicate disagreement between cheaper baselines, while contextual BERT remains weakly aligned with each method. A filtered contextual panel reduces stable-control leakage and highlights drift candidates such as “bloqueio” and “salário”. Rather than treating any detector as ground truth, this study presents an exploratory comparison of complementary drift sensitivities, interpretability, and computational cost in Brazilian Portuguese political discourse.
Autonomous Fact-Checking: Integrating Local Inference and Adversarial NLP Attacks
Rômulo Henrique Nascimento Duarte | Humberto Nunes de Lira | Vivianny Khatly Medeiros Pereira | Isaac Sebastian Lima de Araújo | Allan Gabriel da Cunha Vasconcelos | Yuri de Almeida Malheiros Barbosa
Rômulo Henrique Nascimento Duarte | Humberto Nunes de Lira | Vivianny Khatly Medeiros Pereira | Isaac Sebastian Lima de Araújo | Allan Gabriel da Cunha Vasconcelos | Yuri de Almeida Malheiros Barbosa
Digital misinformation threatens democratic discourse, especially in low-resource languages like Brazilian Portuguese. We present a fact-checking pipeline comparing structured claim decomposition (Claimify) against full-text extraction across four retrieval-augmented classifiers: gemini-2.5-flash-lite and three local open-weight models (Llama-3.1-8B, Qwen2.5-7B, Gemma-2-9B). Robustness is assessed under characterlevel and synonym perturbations. On a pilot sample, the API-based model shows a preliminary macro-F1 advantage for decomposition, which the three local models fail to replicate consistently. We also observe a systematic bias toward the false label across models.
A Comparison of Commonly Used Automatic Evaluation Metrics for Open-Ended Tasks in Portuguese
Eduardo D. Faé | Dennis Giovani Balreira | Viviane Pereira Moreira
Eduardo D. Faé | Dennis Giovani Balreira | Viviane Pereira Moreira
Open-ended tasks in Natural Language processing are characterized by the absence of a fixed set of outputs or short, predetermined responses. Typical examples include open-domain question answering and summarization. The automatic evaluation of these tasks is challenging, and existing metrics suffer from important limitations. Thus, many works have already been proposed to evaluate the performance of such metrics. However, the great majority of these works were conducted in English, leaving a gap for analyses in other languages, such as Portuguese. This work investigates the performance of some of the most popular automated intrinsic evaluation metrics for open-ended tasks by analyzing their correlation with human judgment. Using both the Summarization and Question Answering tasks, this study compares traditional n-gram-based metrics with metrics based on contextual embeddings generated by Pre-trained Language Models (PLMs), performing all analyses using models and datasets available for Portuguese. Results indicate that while PLM-based metrics generally show slightly higher correlation with human perception, their performance is highly reliant on the quality of the models used. Still, none of the evaluated metrics displayed a strong correlation with human judgments, suggesting the need for more robust metrics.
In this article, we present the current state of DANTE (Dependency-ANalysed corpora of TwEets), a treebank focusing on tweets (currently X posts) written in Brazilian Portuguese, featuring four subcorpora varying in size, domain, and level of annotation under the Universal Dependencies framework. This article aims to inform the Natural Language Processing and Linguistic communities about currently available corpora, as well as what to expect from the treebank in the near future, while also bringing together the tools and language resources developed within the DANTE project.
EpiCorpus-BR: A Named Entity Recognition Corpus for Epidemiological Documents in Portuguese
Christian Freitas | Lilian Berton
Christian Freitas | Lilian Berton
This paper presents EpiCorpus-BR, the first annotated corpus for Named Entity Recognition (NER) in Brazilian Portuguese epidemiological surveillance documents, covering the annual SIREVA-SUS reports (2013–2024) and complementary documents from the Brazilian Ministry of Health. The corpus comprises 8,314 textual units across 22 documents (6,358 narrative text sentences and 1,956 table rows), with 4,159 entity mentions in the silver set. The tagset consists of eight specialized categories (PATOGENO, SOROTIPO, FAIXA_ETARIA, LOCAL, PERIODO_TEMPORAL, METODO_LAB, METRICA_EPI, MANIFESTACAO_CLINICA), annotated via few-shot prompting with GPT-4o-mini and manually reviewed in a stratified sample of 280 units (180 text sentences and 100 table rows) by two independent annotators (κ = 0.76). Strict IOB2 evaluation with seqeval yields a combined micro-F1 of 0.77. METRICA_EPI is absent from narrative text but reaches F1 = 0.89 on table rows, which shows why the tabular sub-corpus must be included in the evaluation. A BERTimbau baseline fine-tuned on the silver corpus, with the gold held out, reaches micro-F1 = 0.73, showing that the corpus supports training a dedicated NER model. The corpus and code are publicly available.
Curupira: Arquiteturas Híbridas Transformer-BiLSTM para Detecção de Discurso Ofensivo em Português Brasileiro
Gabrielly Alves Gomes | Iago de Sousa Aragão | Patricia Medyna Lauritzen de Lucena Drumond
Gabrielly Alves Gomes | Iago de Sousa Aragão | Patricia Medyna Lauritzen de Lucena Drumond
Este trabalho apresenta o Curupira, estudo empírico controlado de arquiteturas neurais para detecção de discurso ofensivo em português brasileiro sob protocolo metodológico rigoroso: split treino/validação/teste honesto, cinco sementes aleatórias, controle explícito de capacidade paramétrica e teste de significância via bootstrap pareado. Oito configurações são avaliadas no OLID-BR, cobrindo quatro ordens de magnitude em parâmetros. Os resultados devem ser interpretados para este conjunto de dados e regime de treinamento, e indicam cinco achados principais: (i) o desempenho se concentra próximo de Macro-F1 = 0,70, com o BERTimbau (110M de parâmetros) superando um híbrido Transformer→BiLSTM leve (350K) em 4,3 pontos; (ii) a atenção global produz ganho estatisticamente significativo sobre uma BiLSTM equiparada em capacidade; (iii) aumentar a capacidade neural não melhora o desempenho no cenário avaliado; (iv) a ordem de composição importa, com Transformer→BiLSTM superando BiLSTM→Transformer em 6,3 pontos; (v) codificação posicional senoidal sobre embeddings congelados degrada substancialmente o desempenho, reduzindo o Macro-F1 de 0,66 para 0,26.
CorPop26: Uma atualização das 3.000 Palavras Mais Frequentes do CorPop de 2018
Roges Horacio Grandi | Bianca Pasqualini | Maria Jose Bocorny Finatto | Leandro Krug Wives | Raquel Salcedo Gomes
Roges Horacio Grandi | Bianca Pasqualini | Maria Jose Bocorny Finatto | Leandro Krug Wives | Raquel Salcedo Gomes
Este estudo teve como objetivo atualizar a lista das 3.000 palavras mais frequentes do português do Brasil com base no CorPop de 2018, formado por textos baseados no letramento médio dos leitores do país. A metodologia de atualização utilizada foi comparar frequências do CorPop original com as de outros dois corpora, um baseado no Carolina da USP e outro na Wikipédia, ampliando a base textual. Como resultado, obteve-se uma renovação de 659 palavras, representando 21,97% das originais. Testes comparativos em diferentes ferramentas de análise textual (NILC Metrix, Vidya Text com CorPop original e Vidya Text com CorPop26) evidenciam a influência da lista de palavras mais frequentes no resultado da fórmula de Dale e Chall de 1995.
Vidya Syl: A syllable division algorithm for Brazilian Portuguese adhering to the Common Orthographic Vocabulary of the Portuguese Language
Roges Horacio Grandi | Leandro Krug Wives | Maria Jose Bocorny Finatto | Raquel Salcedo Gomes | Bianca Pasqualini
Roges Horacio Grandi | Leandro Krug Wives | Maria Jose Bocorny Finatto | Raquel Salcedo Gomes | Bianca Pasqualini
A divisão silábica é uma tarefa fundamental em aplicações de processamento de linguagem natural (PLN), especialmente na avaliação de leiturabilidade por meio de métricas como o Índice Flesch. Este artigo apresenta o Vidya Syl, um novo algoritmo de divisão silábica implementado em Java, desenvolvido em conformidade com a seção brasileira do Vocabulário Ortográfico Comum da Língua Portuguesa, denominada VOC. A abordagem metodológica adotada consistiu em incrementar, com regras morfológicas e ortográficas, um algoritmo baseado em regras fonológicas e gráficas, até que se tornasse aderente ao VOC. Os resultados experimentais demonstram melhorias tanto em acurácia quanto em cobertura lexical.
Developing Multilingual Multiword Expressions (MWEs) Resources: An Annotated Corpus of Fables following the PARSEME guidelines
Letícia Guedes Guimarães | Adriana Pagano | André V. Lopes Coneglian | Aline Villavicencio
Letícia Guedes Guimarães | Adriana Pagano | André V. Lopes Coneglian | Aline Villavicencio
This paper introduces a Brazilian Portuguese corpus of fables developed as part of a broader multilingual initiative. It comprises the narratives and their concluding moral statements (epimythia), annotated for morphosyntax and multiword expressions (MWEs) according to the Universal Dependencies (UD) and PARSEME guidelines, respectively. The analysis reveals that 53.59% of the sentences contain at least one MWE, with inherently reflexive verbs (IRVs) constituting the most frequent category. MWEs are also distributed differently: narratives contain a higher proportion of adverbial MWEs, whereas adpositional MWEs are frequent in epimythia. Future work will enrich the corpus through semantic annotation based on Uniform Meaning Representation (UMR).
Beyond Aggregate Scores: A Diagnostic Analysis of Portuguese LLM Evaluation Suites
Gustavo Hochgraf | Gabriel Assis | Aline Paes | Fabio G. Cozman
Gustavo Hochgraf | Gabriel Assis | Aline Paes | Fabio G. Cozman
Benchmarks play a central role in evaluating large language models (LLMs), providing standardized comparisons across models, tasks, and adaptation strategies. However, aggregate benchmark scores often compress performance into a single number, obscuring important variation across tasks. This issue is especially relevant for less-resourced languages like Portuguese, where benchmarks may combine native tasks with translated datasets spanning heterogeneous categories and subareas. In this work, we examine this issue using PoETa v2, a broad Portuguese evaluation benchmark, as a diagnostic setting to evaluate three Qwen3 1.7B variants under different Portuguese adaptation settings. Our results show that, although overall scores differ by less than one percentage point across models, disaggregated analyses reveal substantially different patterns across task origin, category, and subarea. In particular, gains on native Portuguese tasks may coexist with losses on translated tasks, while different adaptation corpora redistribute performance in distinct ways. Taken together, our findings highlight the importance of complementing aggregate scores with multi-level analyses when evaluating Portuguese LLMs, particularly in the context of language-specific adaptation.
Balancing Coherence and Granularity in Legal Topic Modeling: A BERTopic-based Study on Portuguese Appellate Court Decisions
Marjory S. S. Lima | Felipe R. Ahad | Vih A. S. Silva | Thiago M. Ventura | Josiel M. Figueiredo | Allan G. de Oliveira
Marjory S. S. Lima | Felipe R. Ahad | Vih A. S. Silva | Thiago M. Ventura | Josiel M. Figueiredo | Allan G. de Oliveira
The growing backlog of the Brazilian Judiciary demands scalable semantic organization beyond keyword-based retrieval. This study investigates the trade-off between topic coherence and thematic granularity in neural topic modeling for legal texts. We cluster 1,831 Brazilian labor summaries using BERTopic with LegalBERT-pt embeddings and evaluate the impact of the min_topic_size parameter on coherence (Cv), granularity, and diversity. We propose a balanced evaluation score integrating coherence and granularity. Results show higher coherence (Cv ≈ 0.78) than Latent Dirichlet Allocation (Cv ≈ 0.49), while enabling controlled topic resolution. These findings provide a practical criterion for tuning topic models in large-scale legal systems.
Bootstrapping Text Anomaly Detection with LLM-Generated Weak Supervision
Fabio Masaracchia Maia | Anna Helena Reali Costa
Fabio Masaracchia Maia | Anna Helena Reali Costa
Text anomaly detection is challenging because anomalous instances often share vocabulary and surface form with normal data, making them hard to distinguish without semantic understanding. Semi-supervised methods can significantly outperform unsupervised baselines, but rely on labeled anomalies that are rarely available in practice. LLMs encode rich semantic knowledge that can approximate human judgments, yet using them directly as detectors is costly at inference time and sensitive to prompt design, while generating synthetic outliers risks distribution mismatch with real anomalies. We propose a different strategy: treating a compact, locally deployed LLM as a noisy annotator over real data. The LLM scores a small subset of unlabeled documents once at training time, producing weak labels that refine a sentence encoder via contrastive fine-tuning and train a lightweight downstream detector — without cloud APIs, human annotation, or curated anomaly datasets. Across four datasets spanning two languages and two tasks, the approach recovers up to 79% of the gap to oracle upper bounds while using 14–91× fewer labeled anomalies. We further identify three failure modes that explain when LLM-generated weak supervision succeeds or breaks down.
Evaluating Portuguese Tokenizers as Morpheme Sequence in Relation to LLM Downstream Performance
Guilherme L. Mello | Marcelo Finger
Guilherme L. Mello | Marcelo Finger
Sub-word tokenizers allow us to handle open vocabulary problems using a relatively small set of tokens. Despite its ease of use, it usually relies on a data-driven approach that does not directly employ linguistic or morphologic features for text tokenization. [Bostrom and Durrett 2020] and [Hofmann et al. 2021] demonstrate that morphemes improve LLM performance on English texts. In this work, we explore the hypothesis that tokenizers that are capable of producing a token sequence better aligned with a morpheme sequence can improve LLMs performance on Brazilian Portuguese. To evaluate how the presence of morphemes can impact LLMs for Brazilian Portuguese, we propose MorphEval-PT, a new evaluation procedure based on the psycholinguistic concept of morphological models of word processing. We build new BPE and Unigram vocabularies that are evaluated on MorphEval-PT and, in order to validate the impact of morphemes on LLMs performance, train new LLMs from scratch and evaluate its performance on downstream tasks. Consistently, BPE demonstrates a higher precision score than Unigram in its ability to represent morphemes, as well as better performance on every downstream task. These promising results indicate that accessing the ability of tokenizers to represent morphemes is an important feature in the development of LLMs for Brazilian Portuguese and that MorphEval-PT is a good and lightweight method to improve LLM performance before any pre-training.
Tail Smoothing and Cross-Lingual Volatility: Evaluating Estimative Uncertainty in Large Language Models for Brazilian Portuguese
Renato O. Miyaji | Pedro L. P. Corrêa
Renato O. Miyaji | Pedro L. P. Corrêa
This study evaluates how LLMs interpret Words of Estimative Probability (WEPs) in Brazilian Portuguese compared to English. We translated an English benchmark and compared multilingual models (GPT-5.1, Gemini 3 Flash) against a region-specific model (Sabiá 4). Our findings reveal a “tail smoothing” phenomenon, where models systematically compress extreme probabilities. Notably, while Gemini 3 Flash demonstrated remarkable cross-lingual stability, GPT-5.1 exhibited significant calibration degradation. Counterintuitively, when measured against the English human baseline, Sabiá 4 displayed the most aggressive distribution compression. These results suggest a complex dynamic: either linguistic fine-tuning does not ensure alignment, or it actively captures a culturally specific pragmatic ambiguity in Brazilian Portuguese. This exposes the vulnerabilities and nuances of deploying LLMs in nuanced semantic tasks in Brazilian Portuguese.
Textbook-Enriched Training for Language Models: Boosting Answer Quality in Specialized Contexts
Lucas B. Bulcão Mota | Larrissa Dantas | Daniela Barreiro Claro | Aline Paes | Claudia Freitas | Marlo Souza | Helena Caseli | Livy Real
Lucas B. Bulcão Mota | Larrissa Dantas | Daniela Barreiro Claro | Aline Paes | Claudia Freitas | Marlo Souza | Helena Caseli | Livy Real
The use of textbooks as primary sources of information has increasingly given way to tools based on Large Language Models (LLMs), raising concerns about the reliability of generated answers. This study investigates how different adaptation strategies shape the behavior of small language models in educational Question Answering (QA) tasks in Portuguese. To support this analysis, we built a question-answer dataset derived from an NLP textbook and compared base models and the Retrieval-Augmented Generation (RAG) pipeline with models adapted through supervised fine-tuning and Continued Pretraining. The evaluation relies on questions from the LARI dataset, which has been validated by human specialists, and combines automatic and qualitative assessment procedures. The findings indicate that small models tuned with structured instructional knowledge achieve stronger semantic alignment and produce more pertinent answers in Portuguese educational QA scenarios.
Towards Uniform Meaning Representation for Brazilian Portuguese: Building a First UMR-Annotated Dataset
Adriana S. Pagano | Magali Duran | Federica Gamba | Daniel Zeman
Adriana S. Pagano | Magali Duran | Federica Gamba | Daniel Zeman
This paper presents the first Brazilian Portuguese dataset annotated for Uniform Meaning Representation (UMR). It contains 96 sentences from the Brazilian Portuguese portion of the Parallel Universal Dependencies treebank, parallel to existing UMR annotations in English, Czech, and Italian. The sentences were parsed with PortParser, revised in Arborator-Grew, converted from CoNLL-U into preliminary sentence-level UMR graphs, and manually revised in PENMAN format. The results show that CoNLL-U is a useful starting point, but semantic graph construction requires manual interpretation and language-specific lexical resources. The dataset expands multilingual UMR coverage and supports future Portuguese semantic annotation.
Novo CorPop Saúde: Data Collection for Simplified Health Communication in a Brazilian Patient Information Leaflet Corpus
Bianca Pasqualini | Maria J. B. Finatto | Eduarda Bertotto | Paula Salem Carpio | Roges Horacio Grandi | Leandro Krug Wives
Bianca Pasqualini | Maria J. B. Finatto | Eduarda Bertotto | Paula Salem Carpio | Roges Horacio Grandi | Leandro Krug Wives
This paper presents exploratory results from the "Novo CorPop Saúde" project, evaluating whether validation by expert linguists improves readability levels compared to AI-generated simplifications. We analyzed original, AI-generated, and human-validated versions of thirty Patient Information leaflets. Using the Flesch Reading Ease Index, two adapted Dale-Chall metrics, and lexicometric analysis, we assessed automatic simplification against human strategies. Results indicate that while AI improves readability scores primarily through text compression, expert linguists prioritize elaborative strategies, maintaining key terminology while providing didactic explanations to fill semantic gaps. This suggests that human intervention plays a key role in balancing terminological precision with communicative accessibility, a nuance that purely reductive AI strategies might overlook. This study provided evidence on the use of the complex and simplified lexical repertoire of medicine leaflets for the "Novo CorPop Saúde".
Legal Nugget Extraction for Granular Retrieval over Long Jurisprudential Texts
Lucas Pereira | Erick Brito | Roberto Lotufo | Jayr Pereira
Lucas Pereira | Erick Brito | Roberto Lotufo | Jayr Pereira
Legal retrieval over jurisprudential collections is challenging because court decisions are long, heterogeneous documents whose relevant legal thesis may occupy only a small portion of the text. This paper asks whether legal nuggets, defined as short and self-contained legal theses extracted from source documents, can improve dense retrieval over Brazilian legal collections. We propose a pipeline that extracts nuggets from each document, indexes them with embeddings, retrieves nugget-level evidence, and aggregates the retrieved nuggets back to document-level rankings. We evaluate this approach on four Portuguese legal retrieval benchmarks from the JUA ecosystem, reporting NDCG@10, MAP@10, and MRR@10. Nugget retrieval substantially improves the two jurisprudential datasets: on JUA-Juris, NDCG@10 increases from 0.10265 to 0.20461, and on JurisTCU from 0.20898 to 0.32696. However, it underperforms full-document retrieval on NormasTCU and BR-TaxQA, and an embedding-model ablation shows that strong domain-adapted retrievers can remain better in the full-document setting. The results demonstrate that legal nuggets can be useful for jurisprudence search, especially when queries are formulated as legal theses, but they may not transfer equally well to other legal retrieval scenarios.
The Impact of Language and Portuguese Intralinguistic Variation on NL2SQL
Ricardo Trainotti Rabonato | Lilian Berton
Ricardo Trainotti Rabonato | Lilian Berton
Natural Language to Structured Query Language (NL2SQL) systems have advanced with large language models (LLMs), yet evaluations remain centered on English, leaving open how these systems behave across languages and language varieties. We aim to contribute to this by analyzing two state-of-the-art LLMs (LLaMA 3.3 70B and Qwen 3.6 35B, both zero-shot) on the WikiSQL benchmark in English, Brazilian Portuguese (PT-BR), and European Portuguese (PT-PT), keeping database schemas and inference configuration fixed. Translations were validated through distance metrics (cosine similarity 0.966), contrastive linguistic analysis confirming varietal features (e.g., cleft constructions 36.8× more frequent in PT-PT), and multi-model judgment (85% / 81% semantic equivalence, 95.5% PT-BR and 96.0% PT-PT inter-judge agreement). Results show a marked drop from English (47.25% EX) to Portuguese (PT-BR: 40.03%; PT-PT: 39.34%), with the PT-BR vs. PT-PT difference reaching statistical significance (p = 0.019). English-only successes outnumber Portuguese-only successes nearly 10:1. A replication on a second model (Qwen 3.6 35B) confirms the English-Portuguese gap but suggests that intralinguistic effects may be model-dependent. Stratified analyses show semantic complexity and quantification amplify degradation, particularly for COUNT queries. These findings point to persistent English bias in NL2SQL and measurable effects of intralinguistic variation, even between closely related varieties.
Como Nossos Pais: Princípios Clássicos para a Avaliação de Sistemas de IA
Livy Real | Altigran Soares da Silva
Livy Real | Altigran Soares da Silva
Este trabalho retoma bases epistemológicas e metodológicas de diversas áreas da ciência, como psicologia, linguística de corpus, sociologia e neurociência, para fundamentar princípios básicos da avaliação de sistemas baseados em Processamento de Linguagem Natural e Inteligência Artificial. Apresentamos em detalhe o estado da arte da avaliação na área, discutindo os motivos que nos levam à necessidade de automatizar a avaliação de sistemas (paradigma LLM-as-a-Judge). Introduzimos Cinco Princípios Metodológicos básicos que devem fundamentar a avaliação de sistemas baseados em IA, fundamentados tanto na teoria e experimentos destas áreas que já pesquisam a percepção humana há décadas quanto em evidências empíricas do próprio PLN.
Clonagem de Voz por IA para o Português Brasileiro em Contexto Assistivo: Desafios Comparativos em Cinco Ferramentas de Síntese de Fala
Luiz G. dos Santos | Nathalia Borges | Matheus Sales | Luciana C. L. F. Borges | Thais R. Kempner | Eunice P. S. Nunes
Luiz G. dos Santos | Nathalia Borges | Matheus Sales | Luciana C. L. F. Borges | Thais R. Kempner | Eunice P. S. Nunes
Modelos de síntese neural de fala apresentam desempenho reduzido para o português brasileiro (PT-BR) em vozes infantis, prosódia emocional e fonemas sublexicais. Este trabalho avalia cinco ferramentas de síntese por IA em contexto assistivo, com 170 gravações como corpus controlado. Dois desafios persistiram: prosódia emocional e fonemas do PT-BR ausentes do inglês. A incorporação do dataset multilingual-phonemes-10k-alpha ao StyleTTS 2 produziu melhoria consistente na qualidade fonética regional. Os achados oferecem avaliação comparativa e evidência de estratégia de baixo custo para ampliar a cobertura fonética do PT-BR.
Evaluating LLM-based Triple Extraction for Knowledge Graph Fact-Checking in Portuguese
Roney Lira de Sales Santos | Lucas dos Santos | João Pedro Holanda Souza
Roney Lira de Sales Santos | Lucas dos Santos | João Pedro Holanda Souza
Automatic fake news detection in Portuguese is still often treated as a text classification task, without explicitly representing the factual veracity of the claims. In this work, we evaluate LLM-based triple extraction in a knowledge graph (KG)-based fact-checking system. We replace the Open Information Extraction component of a previous approach with triples generated by Sabiá 4, while keeping the remaining pipeline unchanged. The graph is built only from triples extracted from true news articles and is used as factual support to verify new instances. The experiments use true and fake news articles across four evaluation settings. In the closed setting with the complete KG, LLM-based extraction achieves an F1 score of 0.9992, outperforming the OIE-based configuration. However, in more restrictive evaluation settings, expressive triples require entity normalization, relation standardization, and semantic consolidation to provide factual support beyond direct evidence.
Prompt Engineering for Small Language Models: Evaluating ICL for Portuguese Sentiment Analysis
André da F. Schuck | Gabriel L. Garcia | João Renato R. Manesco | Pedro Henrique Paiola | Leandro A. Passos | João Paulo Papa
André da F. Schuck | Gabriel L. Garcia | João Renato R. Manesco | Pedro Henrique Paiola | Leandro A. Passos | João Paulo Papa
The In-Context Learning (ICL) paradigm enables adapting LLMs without parameter tuning. This work evaluates the impact of prompt engineering on 9B models for Brazilian Portuguese sentiment classification, comparing six prompting formats (fewand zero-shot) across three linguistically diverse models (Gemma2-9B-it, Boto-9B-IT, Qwen3.5-9B) and four public datasets, anchored by a fine-tuned encoder (MSA-DistilBERT, ∼0.1B) and a 685B MoE model (DeepSeek-V3.2) under a unified protocol. Results show that all 9B models outperform the encoder and recover 71–101% of the weak-to-strong gap, with Qwen3.5-9B achieving the highest mean coverage (94.5%). Statistical tests indicate that well-defined instructions are the main driver of ICL performance, capturing most of the achievable accuracy even in zero-shot settings, while elaborate formats (roleplay, JSON schema, meta-prompting) add no consistent gain over a minimal instruction-plus-demonstrations prompt, offering practical guidance for deploying SLMs in resource-constrained PT-BR NLP scenarios.
Compression-Based Linguistic Complexity Metrics in Automatic Essay Scoring
Felipe Ribas Serras | Igor Cataneo Silveira | Denis Deratani Mauá | Marcelo Finger
Felipe Ribas Serras | Igor Cataneo Silveira | Denis Deratani Mauá | Marcelo Finger
Compression-based linguistic complexity metrics enable cross-linguistic comparison without prior annotation. Their sensitivity to variation across languages and Portuguese registers highlights their applicability in NLP tasks. This study investigates their use as readability proxies and complementary features in Automatic Essay Scoring. We analyze how these metrics capture variation in essay quality across traits, genres, and educational levels in Brazilian Portuguese. In addition, we evaluate their sensitivity to differences between humanand AI-generated essays. Our results suggest that complexity metrics are effective (i) in differentiating educational levels, (ii) in detecting whether they were written by humans and (iii) as predictors of essay quality.
Validating Semantic Content in Sentence Simplification using OpenIE and Relational Graphs
Samuel Rios da Silva | Larrissa Dantas | Daniela Barreiro Claro | Aline Paes | Maria José Finatto | Rerisson Cavalcante | Silvana Ribeiro
Samuel Rios da Silva | Larrissa Dantas | Daniela Barreiro Claro | Aline Paes | Maria José Finatto | Rerisson Cavalcante | Silvana Ribeiro
A simplificação de sentenças frequentemente altera a estrutura textual enquanto preserva o significado, tornando a fidelidade semântica difícil de avaliar. Neste trabalho, investigamos se representações baseadas em grafos derivadas de Extração Aberta de Informação (Open IE) podem capturar a preservação semântica em diferentes níveis de simplificação. Utilizando o corpus PorSimplesSent, extraímos triplas relacionais de sentenças originais e simplificadas para construir grafos semânticos comparáveis. Os resultados fornecem indícios exploratórios de que a análise baseada em grafos pode capturar diferenças semânticas relevantes e fornece sinais complementares além da sobreposição lexical superficial para avaliar a qualidade da simplificação.
Fusão Híbrida para Recuperação de Informação Jurídica Brasileira
Flávio Soriano | Guilherme Evangelista | Celso França | Gisele Pappa | Wagner Meira Jr. | Marcos Gonçalves
Flávio Soriano | Guilherme Evangelista | Celso França | Gisele Pappa | Wagner Meira Jr. | Marcos Gonçalves
A recuperação de informação jurídica brasileira envolve regimes heterogêneos de busca que exigem simultaneamente correspondência lexical precisa e generalização semântica. Embora a recuperação híbrida seja consolidada na recuperação de informação geral, ainda não está claro quando sinais lexicais e semânticos se complementam efetivamente em coleções jurídicas brasileiras diversas. Investigamos essa questão no benchmark JUÁ, que abrange múltiplos cenários: jurisprudência, atos normativos, recuperação legislativa e perguntas tributárias. Comparamos BM25, recuperadores densos da família Qwen3, variantes ajustadas ao domínio jurídico, reranqueadores e fusão híbrida via Reciprocal Rank Fusion (RRF). Nossa hipótese é que a fusão léxico-densa oferece maior robustez ao combinar sinais complementares sem necessidade de calibração direta de scores. Os resultados mostram que sistemas baseados em RRF alcançam a melhor efetividade agregada: o modelo jurídico ajustado de 4B lidera em NDCG@10 e MRR@10, enquanto o de 8B lidera em MAP@10 e Recall@10. Testes estatísticos pareados indicam ganhos robustos do RRF sobre BM25 e parte dos modelos densos, embora não domine todos os reranqueadores individualmente. No geral, a fusão híbrida léxico-semântica revela-se uma configuração particularmente robusta para busca jurídica heterogênea.
Sector-Specific Financial Sentiment Lexicons for Portuguese: Evidence from Brazilian Stock News
Antônio Artur de Souza | Mateus Binda | Adriana S. Pagano
Antônio Artur de Souza | Mateus Binda | Adriana S. Pagano
This paper investigates whether sector-specific financial sentiment lexicons improve the analysis of Brazilian stock-market news in Portuguese. We use 19,460 news items about 38 firms in the financial, electric, and manufacturing sectors, published between 2020 and 2025. Starting from OpLexicon, we build sector-specific lexicons through unsupervised expansion based on PMI and conditional word-polarity association. The lexicons are evaluated by lexical heterogeneity and through LSTM price forecasting. Results show sectoral variation and moderate classification performance, but limited predictive gains. Sentiment improves forecasting only in manufacturing, while other sectors do not benefit from its inclusion. The findings indicate that sector-specific lexicons are useful resources, although their predictive value are context dependent.
MultiDomainYT-ToxBR: Um Corpus Multidomínio de Comentários Tóxicos do YouTube em Português Brasileiro
Gabriel Z. de Souza | Isabel H. Manssour
Gabriel Z. de Souza | Isabel H. Manssour
Este trabalho apresenta o MultiDomainYT-ToxBR, um corpus de 5.000 comentários do YouTube anotados em nove categorias de toxicidade e distribuídos em cinco domínios temáticos no contexto brasileiro. A análise de concordância entre anotadores evidencia desafios inerentes à tarefa, com índices moderados em categorias como racismo e xenofobia, cujas manifestações veladas e dependentes de contexto dificultam o consenso. A comparação com o ToLD-Br revela padrões complementares: o novo corpus supera o anterior em concordância para homofobia (α = 0,73 vs. 0,68) e introduz categorias inéditas como intolerância política e religiosa. Como validação, o BERTweet.BR, após fine-tuning, atingiu F1 de 0,78 na classificação binária.
An Exploratory Study of Discursive Signals Annotation in User-Generated Content
Rivânia da Paixão de Jesus Carvalho | Mateus Araújo Pereira | Jackson Wilke da Cruz Souza
Rivânia da Paixão de Jesus Carvalho | Mateus Araújo Pereira | Jackson Wilke da Cruz Souza
Nesse artigo, apresentamos a anotação de Sinalizadores Discursivos (SDs) em Conteúdos Gerados por Usuários (UGC), com base em uma amostra de tweets/posts do domínio do mercado financeiro, anotados de acordo com o modelo da Enhanced Rhetorical Structure Theory (eRST). Os resultados revelam a presença de relações discursivas recorrentes nesse tipo de texto e seus respectivos SDs, contribuindo para a expansão da taxonomia previamente estabelecida.
Do pequeno Asteróide B-612 ao universo: a anotação de O Pequeno Príncipe segundo o modelo Universal Dependencies
Magali Sanches Duran | Lucelene Lopes | Maria das Graças Volpe Nunes | Thiago Alexandre Salgueiro Pardo
Magali Sanches Duran | Lucelene Lopes | Maria das Graças Volpe Nunes | Thiago Alexandre Salgueiro Pardo
Relatamos, neste artigo, o processo de anotação do icônico livro O Pequeno Príncipe segundo o modelo internacional Universal Dependencies, como parte de um esforço de expansão dos dados anotados atualmente disponíveis para o português do Brasil. Em especial, apresentamos o protocolo de anotação e as decisões linguísticas envolvidas, além de uma análise quantitativa do córpus.
Classificação automática de sentenças faladas com arquitetura híbrida: análise de estruturas topicalizadas, anti-topicalizadas e canônicas
Gerson Vitor P. Fernandes | Vitoria Maria A. Silva | Cid Ivan C. Carvalho
Gerson Vitor P. Fernandes | Vitoria Maria A. Silva | Cid Ivan C. Carvalho
O presente artigo investiga o desempenho de um sistema de classificação automática de sentenças faladas do português brasileiro, considerando estruturas canônicas, topicalizadas e antitopicalizadas, por meio de uma arquitetura híbrida baseada em Redes Neurais Recorrentes (RNNs) e Redes Neurais Convolucionais (CNNs). A pesquisa articula contribuições sintáticas, prosódicas e computacionais com a finalidade de contextualizar o corpus e delimitar o tratamento das sentenças faladas, porém o estudo concentra-se na avaliação experimental de uma arquitetura híbrida de redes neurais aplicada à classificação automática dessas sentenças. O corpus analisado é composto por 612 sentenças declarativas gravadas em ambiente controlado, produzidas por 20 falantes do português brasileiro. A metodologia caracteriza-se como quantitativa e experimental, utilizando aprendizagem supervisionada e avaliação baseada em métricas como precisão, recall, f-score e acurácia, por meio da matriz de confusão. Foram realizados testes com diferentes configurações de hiperparâmetros, variando filtros convolucionais, unidades LSTM, taxas de Dropout e número de épocas de treinamento. Os resultados demonstraram que modelos mais robustos apresentaram maior capacidade de memorização dos dados de treino, mas também maior tendência ao overfitting. Em contrapartida, arquiteturas mais enxutas associadas a maiores taxas de regularização obtiveram melhor capacidade de generalização e maior estabilidade durante a validação. O melhor desempenho foi observado no cenário com 30% de Dropout, em que houve redução significativa do hiato de generalização entre treino e teste. Conclui-se que a combinação entre RNNs e CNNs mostra-se promissora para a classificação automática de sentenças faladas, embora ainda existam limitações relacionadas à generalização do modelo em dados não vistos.
A Comparative Analysis of Adjectives in Image Descriptions in Brazilian Portuguese and English
Maucha Andrade Gamonal | Adriana Pagano | Felix Engler | André V. Lopes Coneglian | Ely E. S. Mattos
Maucha Andrade Gamonal | Adriana Pagano | Felix Engler | André V. Lopes Coneglian | Ely E. S. Mattos
Este artigo investiga o modo como os adjetivos representam a experiência visual em descrições, em português brasileiro e em inglês, do conjunto de dados Framed Multi30K. Com base na Gramática Sistêmico-Funcional e na Semântica de Frames, o estudo classifica os adjetivos em Epítetos experienciais, Epítetos interpessoais e Classificadores, além de examinar os frames por eles evocados. Os resultados mostram que os Epítetos experienciais são predominantes, o que indica que os adjetivos são empregados principalmente para representar propriedades visualmente salientes. A anotação semântica também revela que Color é o frame mais frequente. Ao identificar os significados adjetivais mais salientes, o estudo contribui para compreender quais atributos visuais tendem a receber maior destaque por parte dos observadores.
Clause Linkage in Brazilian Portuguese Narratives: Evidence from Enhanced Dependency Annotation
Letícia Guedes Guimarães | Adriana Pagano | André V. Lopes Coneglian | Magali Duran
Letícia Guedes Guimarães | Adriana Pagano | André V. Lopes Coneglian | Magali Duran
This paper explores the potential of Enhanced and Extended Enhanced Universal Dependencies for narrative analysis in Brazilian Portuguese, focusing on how enhanced dependency relations contribute to clause linkage. The study examines narrative sentences annotated in CoNLL-U format and compares basic and enhanced dependency layers. The results show that enhanced dependencies are particularly useful for recovering implicit subject relations in Portuguese and for enriching clause relations through information from prepositions and conjunctions. These enhancements enable a more explicit representation of participant continuity and event relations in narratives, supporting the transition from syntactic dependency analysis to richer semantic annotation.
Inferência Textual Zero-Shot em Português: Especialização Linguística vs. Raciocínio Explícito em Modelos de Linguagem Compactos
Gabriel Silvestre Mancini | Marcos Lopes
Gabriel Silvestre Mancini | Marcos Lopes
Este trabalho investiga a capacidade inferencial de modelos de linguagem de pequeno e médio porte (até 9B de parâmetros) na tarefa de Inferência em Linguagem Natural (NLI) em português brasileiro, em regime estritamente zero-shot. Partindo da definição formal de acarretamento como preservação de condições de verdade, uma relação dedutiva na classificação peirceana [Peirce 1932], comparamos modelos especializados em português (Sabiá, Bode, Gaia) com modelos multilíngues equipados com mecanismos explícitos de raciocínio e destilação de conhecimento (Qwen3, Gemma 2, Ministral 3) no ASSIN 2 e em um dataset sintético controlado, fundamentado em acarretamento por inclusão lexical (hiponímia / hiperonímia). Os resultados indicam que raciocínio explícito e destilação são mais decisivos do que adaptação monolíngue isolada, e que acurácia elevada no ASSIN 2 pode superestimar a competência inferencial ao confundir similaridade distribucional indutiva com preservação dedutiva de condições de verdade.
Quando o "..." importa: análise comparada de modalidades de transcrição de hesitações em entrevistas do Corpus Roda Viva
Valeria Vieira dos Santos
Valeria Vieira dos Santos
Este trabalho investiga como as hesitações — pausas, prolongamentos, truncamentos, repetições e preenchimentos lexicais — são representadas em diferentes modalidades de transcrição de entrevistas jornalísticas do português brasileiro. A partir de um corpus piloto de 95 turnos de fala do programa Roda Viva (TV Cultura), comparamos uma transcrição fiel (com marcas hesitativas) com uma versão higienizada e com uma transcrição em protocolos conversacionais (Jefferson; GAT2). Os resultados mostram que cada modalidade trata sistematicamente as marcas hesitativas de forma distinta, revelando a necessidade de um protocolo de anotação explícito. Propomos uma tipologia funcional inicial em cinco categorias formais e discutimos implicações para a construção de corpora orais e tarefas de anotação em PLN.
Da sintaxe ao discurso: Evidências introdutórias da correlação entre Universal Dependencies e Rhetorical Structure Theory
Jackson Wilke da Cruz Souza | Paula Christina Figueira Cardoso
Jackson Wilke da Cruz Souza | Paula Christina Figueira Cardoso
A identificação automática de relações discursivas constitui um desafio central no Processamento de Línguas Naturais, especialmente para o português brasileiro, devido à escassez de recursos anotados e à variabilidade dos mecanismos de sinalização discursiva. Neste trabalho introdutório investigamos a correlação entre relações discursivas da Rhetorical Structure Theory (RST) e relações de dependência sintática do modelo Universal Dependencies (UD) em textos jornalísticos. Analisamos cinco relações RST frequentes no gênero, combinando análises quantitativas e qualitativas. Os resultados indicam que cada relação discursiva apresenta características sintático-discursivas distintas.
Classificação de Textos com Matrizes de Similaridade: Um Estudo de Caso em um Corpus com Nomes de Produtos
Antonio Ferreira de Castro Barbosa | Eduardo Corrêa Gonçalves
Antonio Ferreira de Castro Barbosa | Eduardo Corrêa Gonçalves
Este trabalho aborda o problema da comparação semântica de pares de strings curtas em português. Mais especificamente, o trabalho avalia uma abordagem não supervisionada baseada em matrizes de similaridade para classificar nomes de produtos contendo diferentes tipos de especificações. As matrizes foram utilizadas de forma isolada e combinadas aos pares. Em experimentos realizados sobre um corpus composto por 1.000 instâncias, a melhor acurácia foi obtida através da combinação da matriz TF-IDF com matrizes de embeddings pré-treinados da família BERT.
Uso de modelos de linguagem na identificação de relações de coerência da Rhetorical Structure Theory em textos de User-Generated Content
Pedro Moreno Niella de Souza Sales Evangelista | Jackson Wilke da Cruz Souza
Pedro Moreno Niella de Souza Sales Evangelista | Jackson Wilke da Cruz Souza
Este trabalho investiga a identificação automática de relações retóricas Rhetorical Structure Theory (RST) em User-Generated Content, utilizando Sinalizadores Discursivos (SDs) como evidências de coerência sob a ótica da RST. A baixa cobertura de conectivos clássicos (19%) motiva um pipeline comparativo com heurísticas léxicas, Support Vector Machine e fine-tuning do BERTimbau no corpus DANTEStocks (4.048 tweets financeiros). O BERTimbau alcançou 95% de acurácia e 93% de F1-Score ponderado; contudo, o desbalanceamento entre classes restringe o F1-Macro a 53%, evidenciando que a modelagem contextual profunda mitiga o ruído linguístico do UGC, mas não resolve o problema de desbalanceamento.
Expansão da Ferramenta Doccano para a Anotação de Análise de Sentimento Estruturada
Antonio Paulo Martins Ferri | Guilherme Dallmann Lima | Larissa Astrogildo de Freitas | Andrew Campos
Antonio Paulo Martins Ferri | Guilherme Dallmann Lima | Larissa Astrogildo de Freitas | Andrew Campos
Ferramentas de anotação são fundamentais para a construção de conjuntos de dados em Processamento de Linguagem Natural (PLN). Contudo, a versão do Doccano adaptada para Análise de Sentimento Baseada em Aspectos (ASBA) não representa explicitamente o autor de uma opinião. Este trabalho apresenta uma extensão dessa ferramenta que incorpora o opinion holder à estrutura de anotação, modificando o modelo de dados, os fluxos de importação e exportação e a interface. A avaliação preliminar anotou 30 avaliações de hotéis em ambas as versões: 10 continham um autor explicitamente identificável, casos em que a extensão permitiu registrar uma associação indisponível na versão base.
A Comparative Study of Discourse Signal Proposals in Rhetorical Structure Theory
Gabriela Fortalesa | Jackson Wilke da Cruz Souza
Gabriela Fortalesa | Jackson Wilke da Cruz Souza
This paper presents a comparative literature review on the Discourse Signals (DSs) of Rhetorical Structure Theory (RST) across six languages. The analysis demonstrates that coherence signaling is not universal, depending heavily on linguistic typology and textual modality. It becomes evident that typologically distant languages and new modalities require profound structural, syntactic, and hypertextual adaptations of the theory’s original taxonomy.
Identificação e classificação de trechos racistas e sexistas em processos judiciais
Yasmin Francisquetti Barnes | Marcelo Finger
Yasmin Francisquetti Barnes | Marcelo Finger
Este estudo descreve o desenvolvimento de uma ferramenta de inteligência artificial para identificar e classificar discursos racistas e sexistas proferidos por agentes jurídicos. Focado em processos de violência sexual do Tribunal de Justiça de São Paulo (TJSP), a pesquisa visa evidenciar vieses que corroboram a vitimização secundária. A solução computacional baseia-se em um modelo de Processamento de Linguagem Natural com arquitetura Transformer, utilizando um modelo derivado do BERT pré-treinado para o português brasileiro. O modelo é treinado com dados textuais categorizados por uma ontologia de estereótipos de gênero e seu desempenho é avaliado por validação cruzada (k = 5) com métricas de acurácia, precisão, revocação e medida-F.
Data-Faithful Natural Language Generation for Explaining Fitness-Market Anomalies
Kauan Divino Pouso Mariano | Fabrycio Leite Nakano Almada | Victor Emanuel da Silva Monteiro | Maykon Adriell Dutra | Jefferson Felex de Faria | Jennifer Vitória da Silva Peixoto | Kamylla Sejane Pouso Freitas
Kauan Divino Pouso Mariano | Fabrycio Leite Nakano Almada | Victor Emanuel da Silva Monteiro | Maykon Adriell Dutra | Jefferson Felex de Faria | Jennifer Vitória da Silva Peixoto | Kamylla Sejane Pouso Freitas
This study presents an integrated pipeline that transforms anomaly-detection outputs from global fitness-market data into data-faithful narratives. Using a 132-country panel and a 2019 baseline, we analyze observed post-COVID-19 recovery through 2025, while treating 2026 only as a modelled extension. Four complementary detectors—regional-median deviations, linear-regression residuals, Random Forest residuals, and Isolation Forest—are combined through method agreement and mapped to a rule-based typology. A deterministic, template-based Natural Language Generation (NLG) component then produces short, medium, and complete explanations from tabular evidence. In 2025, 14 countries were consensus anomalies; Guyana exemplified market growth without participatory expansion, with revenue recovery of +401.43%, participation recovery of -2.06%, and a 403.50-point gap. All 132 narratives passed automatic factual-consistency checks. These checks validate field preservation rather than fluency, usefulness, or explanatory quality; human evaluation remains future work.
OABench-Consumidor: Um benchmark para avaliação de modelos de linguagem em Direito do Consumidor
Lucas B. Bulcão Mota | Aline Athaydes | Babacar Mane | Daniela Barreiro Claro
Lucas B. Bulcão Mota | Aline Athaydes | Babacar Mane | Daniela Barreiro Claro
Avaliar modelos de linguagem em domínios específicos, como o Direito do Consumidor, é um desafio devido à escassez de recursos padronizados em português brasileiro. Para resolver esse problema, introduzimos o OABench-Consumidor, um benchmark composto exclusivamente por questões de Direito do Consumidor da primeira fase do Exame de Ordem Unificado (OAB), cobrindo as edições de 2010.1 a 2025.2. Este artigo descreve a coleta e a estruturação dos dados. Além disso, a utilidade do benchmark é demonstrada através da avaliação do modelo fundacional Qwen3-8B e de uma versão ajustada. O modelo especializado obteve 64,84% de acurácia (59/91), superando os 51,65% (47/91) do modelo base. O benchmark oferece um recurso direto para avaliar sistemas de Inteligência Artificial nessa subárea do Direito.
Análise de comportamento do modelo NotebookLM em transcrição automática
Brenda R. F. de Oliveira | Oto Araújo Vale
Brenda R. F. de Oliveira | Oto Araújo Vale
Esta pesquisa analisa o comportamento do modelo NotebookLM na transcrição automática da fala, tomando como corpus a transcrição de 55 entrevistas de economia do programa Roda Viva. O estudo parte da hipótese de que as escolhas de registro textual do modelo revelam tanto suas capacidades quanto suas limitações diante da fala espontânea. Com a identificação e organização de padrões de comportamento, construiu-se uma tipologia que representa as particularidades de comportamento do modelo para compor uma diretriz de anotação. Os resultados obtidos até o momento demonstram que o modelo alterna entre sensibilidade às disfluências da fala e limitações na organização textual.
Desafios Tipológicos na Construção de Treebanks: O Mapeamento Morfossintático da Língua Kubeo no Padrão UD
Pedro Paulo Freire Oliveira | Thiago Blanch Pires
Pedro Paulo Freire Oliveira | Thiago Blanch Pires
A inserção de línguas indígenas amazônicas no campo do Processamento de Linguagem Natural (PLN) esbarra na ausência de treebanks e recursos estruturados. Este artigo descreve a fase inicial de modelagem morfossintática da língua Kubeo (família Tukano-Oriental) sob as diretrizes das Dependências Universais (UD). O Kubeo apresenta alta complexidade tipológica, caracterizada por processos aglutinantes, classificadores nominais pervasivos e marcadores pragmáticos que desafiam as categorias gramaticais estáticas do padrão UD. O escopo desta etapa concentra-se na extração e etiquetagem de sentenças nativas, com foco metodológico na mensuração da distância estrutural entre o sujeito nominal explícito e o verbo núcleo. A partir de dados da cartilha Pamiene Mama Buei-Tukubo, o estudo propõe soluções de mapeamento de tokens, utilizando a camada de traços morfológicos FEATS para preservar a riqueza morfossintática da língua sem fragmentar excessivamente as árvores de dependência. A criação deste corpus visa estabelecer um protocolo de anotação reprodutível para futuras ferramentas focadas no Kubeo.
Unsupervised Subword Segmentation for POS Tagging in Low-Resource Agglutinative Languages
Jonas Oliveira Pereira | Lilian Teixeira de Sousa | Marlo Souza
Jonas Oliveira Pereira | Lilian Teixeira de Sousa | Marlo Souza
While Part-of-speech tagging is considered a well-understood task in the literature, most work has focused on indo-european languages with fusional morphology. For low-resource agglutinative languages, such as brazillian indigenous languages, the task is commonly constrained by small annotated corpora, high lexical sparsity, and morphological patterns that are poorly represented by word-level models. This paper investigates the impact of unsupervised subword segmentation techniques on POS tagging for brazillian indigenous languages. We compare a word-level baseline with Byte Pair Encoding, Morfessor, and FlatCat on Bororo, Nheengatu, and Tupinamba corpora, including a controlled experiment on the size of the training corpus. Our findings suggest that unsupervised segmentation can reduce sparsity in low-resource POS tagging, although its benefit depends on the language, corpus size, and segmentation method.
Explorando a Integração de Múltiplas Modalidades Visuais no Reconhecimento Contínuo de Libras
Guilherme Galvão de Oliveira Pinto | Guilherme Vieira Leite | Hélio Pedrini | José Mario De Martino
Guilherme Galvão de Oliveira Pinto | Guilherme Vieira Leite | Hélio Pedrini | José Mario De Martino
O reconhecimento contínuo de Língua Brasileira de Sinais (Libras) apresenta desafios relacionados à natureza multimodal da sinalização e à modelagem de dependências espaço-temporais complexas. Este trabalho em andamento busca investigar a adaptação de arquiteturas neurais para o reconhecimento contínuo de Libras utilizando vídeos RGB, keypoints corporais, faciais e manuais, além de anotações linguísticas multi-tier produzidas no ELAN. O método proposto combina extração de características visuais, integração multimodal e modelagem temporal. A avaliação será realizada por meio da métrica Word Error Rate (WER) e estudos de ablação. Espera-se analisar o impacto da multimodalidade e das anotações multicamadas no desempenho de modelos de reconhecimento contínuo de Libras.
Da Definição das Entidades à Anotação do Corpus: Desafios da tarefa no Direito do Consumidor
Samuel Rios da Silva | Aline Athaydes | Babacar Mane | Daniela Barreiro Claro
Samuel Rios da Silva | Aline Athaydes | Babacar Mane | Daniela Barreiro Claro
A anotação de dados é uma etapa crucial para a construção de modelos de apredizado de máquina voltados ao Reconhecimento de Entidades Nomeadas (REN). Nesse sentido, percebida a necessidade e a ausência de Modelos REN especialistas no contexto do Código de Defesa do Consumidor (CDC), este trabalho apresenta o processo de anotação de um corpus com entidades específicas relacionadas ao CDC, assim como os desafios encontrados, os aprendizados, principais resultados obtidos e nossos próximos passos.
Anotação de Metáforas em Saúde Mental: Análise de Postagens Baseada no Procedimento MIPVU
Isabela C. Rodrigues | Helena de Medeiros Caseli
Isabela C. Rodrigues | Helena de Medeiros Caseli
Este trabalho apresenta os resultados preliminares de uma investigação sistemática sobre o uso de metáforas em postagens de redes sociais relacionadas à depressão em português do Brasil. Com base no procedimento de anotação MIPVU e na Linguística Cognitiva, foram identificadas 743 expressões metafóricas distribuídas em 13 domínios conceituais. Os resultados destacam a centralidade dos domínios de Jornada e Espaço Delimitado/Recipiente, além da importância da diferenciação entre as perspectivas de Primeira Pessoa (1P) e Outra Pessoa (OP) para capturar a vivência subjetiva e evitar falsos positivos em modelos de PLN. O estudo também propõe domínios emergentes como Quantidade/Tamanho e Percepção Sensorial.
Esquecida no Churrasco: Um método para validação e correção responsável de traduções automáticas do BBQ para Português do Brasil
Luiza Rodrigues Cardoso | Leo Sampaio Ferraz Ribeiro
Luiza Rodrigues Cardoso | Leo Sampaio Ferraz Ribeiro
Com os rápidos avanços em Processamento de Linguagem Natural, torna-se necessário o desenvolvimento de ferramentas de avaliação de performances dos modelos linguísticos diante da destilação de vieses sociais. Neste artigo, então, apresentamos um método de adaptação de datasets que contempla adequações de fatores linguísticos e socioculturais do Brasil, uma demonstração de aplicação do método ao dataset BBQ e a descrição da implementação da nossa plataforma autoral de validação.
Integração de Conhecimento Linguístico Estruturado em LLMs para a Tarefa de Sumarização Extrativa
Carlos Vitor Cardoso da Silva | Paula Christina Figueira Cardoso
Carlos Vitor Cardoso da Silva | Paula Christina Figueira Cardoso
Este trabalho investiga a integração da Rhetorical Structure Theory (RST) em LLMs (Gemma 3, Llama 3.2, Ministral) para sumarização extrativa. Avaliamos doze configurações (zero/one-shot, formatos plain/RST) contra o baseline de Ono et al. e sumários humanos do corpus CSTNews. O baseline de Ono manteve-se competitivo (ROUGE-L = 0,428), não sendo superado pela melhor configuração LLM (Ministral/zero-shot/RST, ROUGE-L = 0,422). O formato RST produziu efeitos divergentes e dependentes do modelo nas métricas ROUGE e BERTScore, com impacto variável na qualidade da extração.
Concatenative Synthesis for Brazilian Sign Language
Gustavo Borba da Silva | Ângelo Brandão Benetti | José Mario De Martino
Gustavo Borba da Silva | Ângelo Brandão Benetti | José Mario De Martino
This paper presents an enhanced concatenative synthesis framework for Brazilian Sign Language (Libras) based on motion-capture (MoCap) data. The proposed method extends previous work by incorporating movement dynamics into the unit-selection process, allowing fragment selection to consider both pose similarity and velocity continuity. In addition, a quaternion-based transition smoothing mechanism is introduced to reduce discontinuities between independently recorded sign segments. The framework also employs a compact quaternion-only motion representation and a web-native architecture for real-time synthesis and visualization.
Heurísticas vs. LLMs na triagem de tweets: avaliando pistas linguísticas para tarefas de PLN em português
Laura Pessine Teixeira | Helena de Medeiros Caseli
Laura Pessine Teixeira | Helena de Medeiros Caseli
Este artigo apresenta um pipeline de triagem inteligente para pré-processamento de textos informais em tarefas de Processamento de Linguagem Natural (PLN). O pipeline pontua a utilidade textual usando pistas linguísticas fundamentadas na dimensão retórica da argumentação (clareza, credibilidade, apelo emocional e organização). Uma avaliação intrínseca comparou o pipeline proposto com um Large Language Model (LLM) utilizando um padrão ouro humano. Os resultados mostram que o pipeline obteve maior precisão em características objetivas, enquanto elementos subjetivos exigem modelos contextuais. Esses resultados indicam que uma arquitetura híbrida pode ser uma estratégia mais eficaz para a curadoria de dados textuais.