Rerisson Cavalcante
Author directory2026
Text segmentation with mixed data: evaluating symbolic and neural approaches
Amanda Sammer do N. Brandão | Felipe Bomfim Sanches | Alfredo Sena | Laila Mota | Daniela Barreiro Claro | Rerisson Cavalcante
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
Amanda Sammer do N. Brandão | Felipe Bomfim Sanches | Alfredo Sena | Laila Mota | Daniela Barreiro Claro | Rerisson Cavalcante
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
A segmentação de texto vem sendo amplamente difundida e utilizada para extrair informação relevante de documentos. Essas informações estão distribuídas em diversos tipos de estruturas, que incluem dados heterogêneos. A extração desses dados tem sido ultimamente, utilizada por LLMs (Large Language Models). Porém, os treinamentos dos modelos de linguagem não detém características peculiares de dados mistos, tais como dados lexicais e dados fonéticos. Assim, torna-se um desafio analisar a corretude das transcrições de maneira automatizada por LLMs. Neste estudo, a segmentação textual e extração de informação foi paralelizada em duas principais abordagens com o intuito de avaliar a comparação de uma abordagem simbólica e uma abordagem neural. Os resultados demonstram as vantagens e desvantagens em ambas as abordagens para os tipos de dados mistos.
Validating Semantic Content in Sentence Simplification using OpenIE and Relational Graphs
Samuel Rios da Silva | Larrissa Dantas | Daniela Barreiro Claro | Aline Paes | Maria José Finatto | Rerisson Cavalcante | Silvana Ribeiro
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
Samuel Rios da Silva | Larrissa Dantas | Daniela Barreiro Claro | Aline Paes | Maria José Finatto | Rerisson Cavalcante | Silvana Ribeiro
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
A simplificação de sentenças frequentemente altera a estrutura textual enquanto preserva o significado, tornando a fidelidade semântica difícil de avaliar. Neste trabalho, investigamos se representações baseadas em grafos derivadas de Extração Aberta de Informação (Open IE) podem capturar a preservação semântica em diferentes níveis de simplificação. Utilizando o corpus PorSimplesSent, extraímos triplas relacionais de sentenças originais e simplificadas para construir grafos semânticos comparáveis. Os resultados fornecem indícios exploratórios de que a análise baseada em grafos pode capturar diferenças semânticas relevantes e fornece sinais complementares além da sobreposição lexical superficial para avaliar a qualidade da simplificação.
2024
TransAlign: An Automated Corpus Generation through Cross-Linguistic Data Alignment for Open Information Extraction
Alan Rios | Bruno Cabral | Daniela Claro | Rerisson Cavalcante | Marlo Souza
Proceedings of the 16th International Conference on Computational Processing of Portuguese - Vol. 1
Alan Rios | Bruno Cabral | Daniela Claro | Rerisson Cavalcante | Marlo Souza
Proceedings of the 16th International Conference on Computational Processing of Portuguese - Vol. 1