Raquel Salcedo Gomes

Author directory

2026

A divisão silábica é uma tarefa fundamental em aplicações de processamento de linguagem natural (PLN), especialmente na avaliação de leiturabilidade por meio de métricas como o Índice Flesch. Este artigo apresenta o Vidya Syl, um novo algoritmo de divisão silábica implementado em Java, desenvolvido em conformidade com a seção brasileira do Vocabulário Ortográfico Comum da Língua Portuguesa, denominada VOC. A abordagem metodológica adotada consistiu em incrementar, com regras morfológicas e ortográficas, um algoritmo baseado em regras fonológicas e gráficas, até que se tornasse aderente ao VOC. Os resultados experimentais demonstram melhorias tanto em acurácia quanto em cobertura lexical.
Este estudo teve como objetivo atualizar a lista das 3.000 palavras mais frequentes do português do Brasil com base no CorPop de 2018, formado por textos baseados no letramento médio dos leitores do país. A metodologia de atualização utilizada foi comparar frequências do CorPop original com as de outros dois corpora, um baseado no Carolina da USP e outro na Wikipédia, ampliando a base textual. Como resultado, obteve-se uma renovação de 659 palavras, representando 21,97% das originais. Testes comparativos em diferentes ferramentas de análise textual (NILC Metrix, Vidya Text com CorPop original e Vidya Text com CorPop26) evidenciam a influência da lista de palavras mais frequentes no resultado da fórmula de Dale e Chall de 1995.