Raquel Salcedo Gomes
Author directory2026
Vidya Syl: A syllable division algorithm for Brazilian Portuguese adhering to the Common Orthographic Vocabulary of the Portuguese Language
Roges Horacio Grandi | Leandro Krug Wives | Maria Jose Bocorny Finatto | Raquel Salcedo Gomes | Bianca Pasqualini
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
Roges Horacio Grandi | Leandro Krug Wives | Maria Jose Bocorny Finatto | Raquel Salcedo Gomes | Bianca Pasqualini
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
A divisão silábica é uma tarefa fundamental em aplicações de processamento de linguagem natural (PLN), especialmente na avaliação de leiturabilidade por meio de métricas como o Índice Flesch. Este artigo apresenta o Vidya Syl, um novo algoritmo de divisão silábica implementado em Java, desenvolvido em conformidade com a seção brasileira do Vocabulário Ortográfico Comum da Língua Portuguesa, denominada VOC. A abordagem metodológica adotada consistiu em incrementar, com regras morfológicas e ortográficas, um algoritmo baseado em regras fonológicas e gráficas, até que se tornasse aderente ao VOC. Os resultados experimentais demonstram melhorias tanto em acurácia quanto em cobertura lexical.
CorPop26: Uma atualização das 3.000 Palavras Mais Frequentes do CorPop de 2018
Roges Horacio Grandi | Bianca Pasqualini | Maria Jose Bocorny Finatto | Leandro Krug Wives | Raquel Salcedo Gomes
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
Roges Horacio Grandi | Bianca Pasqualini | Maria Jose Bocorny Finatto | Leandro Krug Wives | Raquel Salcedo Gomes
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
Este estudo teve como objetivo atualizar a lista das 3.000 palavras mais frequentes do português do Brasil com base no CorPop de 2018, formado por textos baseados no letramento médio dos leitores do país. A metodologia de atualização utilizada foi comparar frequências do CorPop original com as de outros dois corpora, um baseado no Carolina da USP e outro na Wikipédia, ampliando a base textual. Como resultado, obteve-se uma renovação de 659 palavras, representando 21,97% das originais. Testes comparativos em diferentes ferramentas de análise textual (NILC Metrix, Vidya Text com CorPop original e Vidya Text com CorPop26) evidenciam a influência da lista de palavras mais frequentes no resultado da fórmula de Dale e Chall de 1995.