Alfredo Sena
Author directory2026
Text segmentation with mixed data: evaluating symbolic and neural approaches
Amanda Sammer do N. Brandão | Felipe Bomfim Sanches | Alfredo Sena | Laila Mota | Daniela Barreiro Claro | Rerisson Cavalcante
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
Amanda Sammer do N. Brandão | Felipe Bomfim Sanches | Alfredo Sena | Laila Mota | Daniela Barreiro Claro | Rerisson Cavalcante
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
A segmentação de texto vem sendo amplamente difundida e utilizada para extrair informação relevante de documentos. Essas informações estão distribuídas em diversos tipos de estruturas, que incluem dados heterogêneos. A extração desses dados tem sido ultimamente, utilizada por LLMs (Large Language Models). Porém, os treinamentos dos modelos de linguagem não detém características peculiares de dados mistos, tais como dados lexicais e dados fonéticos. Assim, torna-se um desafio analisar a corretude das transcrições de maneira automatizada por LLMs. Neste estudo, a segmentação textual e extração de informação foi paralelizada em duas principais abordagens com o intuito de avaliar a comparação de uma abordagem simbólica e uma abordagem neural. Os resultados demonstram as vantagens e desvantagens em ambas as abordagens para os tipos de dados mistos.