Rerisson Cavalcante

Author directory

2026

A segmentação de texto vem sendo amplamente difundida e utilizada para extrair informação relevante de documentos. Essas informações estão distribuídas em diversos tipos de estruturas, que incluem dados heterogêneos. A extração desses dados tem sido ultimamente, utilizada por LLMs (Large Language Models). Porém, os treinamentos dos modelos de linguagem não detém características peculiares de dados mistos, tais como dados lexicais e dados fonéticos. Assim, torna-se um desafio analisar a corretude das transcrições de maneira automatizada por LLMs. Neste estudo, a segmentação textual e extração de informação foi paralelizada em duas principais abordagens com o intuito de avaliar a comparação de uma abordagem simbólica e uma abordagem neural. Os resultados demonstram as vantagens e desvantagens em ambas as abordagens para os tipos de dados mistos.
A simplificação de sentenças frequentemente altera a estrutura textual enquanto preserva o significado, tornando a fidelidade semântica difícil de avaliar. Neste trabalho, investigamos se representações baseadas em grafos derivadas de Extração Aberta de Informação (Open IE) podem capturar a preservação semântica em diferentes níveis de simplificação. Utilizando o corpus PorSimplesSent, extraímos triplas relacionais de sentenças originais e simplificadas para construir grafos semânticos comparáveis. Os resultados fornecem indícios exploratórios de que a análise baseada em grafos pode capturar diferenças semânticas relevantes e fornece sinais complementares além da sobreposição lexical superficial para avaliar a qualidade da simplificação.

2024

2023