Hervé Le Borgne

2025

Génération augmentée de récupération multi-niveau pour répondre à des questions visuelles
Omar Adjali | Olivier Ferret | Sahar Ghannay | Hervé Le Borgne
Actes de la 20e Conférence en Recherche d’Information et Applications (CORIA)

La tâche de réponse à des questions visuelles à propos d’entités nommées, qui s’appuie sur la désambiguïsation des entités à l’aide d’informations textuelles et visuelles ainsi que de connaissances, se décompose principalement en deux étapes : recherche d’information puis recherche des réponses, souvent abordées indépendamment l’une de l’autre. La génération augmentée de récupération (RAG) offre une solution à ce manque d’interaction en utilisant les réponses générées comme signal pour l’entraînement de la recherche d’information. Le RAG s’appuie généralement sur des passages pseudo-pertinents extraits de bases de connaissances externes, ce qui peut conduire à des erreurs au niveau de la génération de réponses. Dans ce travail, nous proposons une approche de RAG à plusieurs niveaux améliorant la génération de réponses en associant recherche d’entités et expansion de requête. Plus précisément, nous définissons une fonction de perte RAG permettant de conditionner la génération de réponses à la fois par la recherche d’entités et celle de passages. Cette approche permet de dépasser les travaux existants sur le jeu d’évaluation ViQuAE, démontrant ainsi que les connaissances qu’elle va chercher sont plus pertinentes pour la génération de réponses.

2024

pdf bib abs

Multi-Level Information Retrieval Augmented Generation for Knowledge-based Visual Question Answering
Omar Adjali | Olivier Ferret | Sahar Ghannay | Hervé Le Borgne
Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing

The Knowledge-Aware Visual Question Answering about Entity task aims to disambiguate entities using textual and visual information, as well as knowledge. It usually relies on two independent steps, information retrieval then reading comprehension, that do not benefit each other. Retrieval Augmented Generation (RAG) offers a solution by using generated answers as feedback for retrieval training. RAG usually relies solely on pseudo-relevant passages retrieved from external knowledge bases which can lead to ineffective answer generation. In this work, we propose a multi-level information RAG approach that enhances answer generation through entity retrieval and query expansion. We formulate a joint-training RAG loss such that answer generation is conditioned on both entity and passage retrievals. We show through experiments new state-of-the-art performance on the VIQuAE KB-VQA benchmark and demonstrate that our approach can help retrieve more actual relevant knowledge to generate accurate answers.

2022

pdf bib

Un jeu de données pour répondre à des questions visuelles à propos d’entités nommées [A dataset for answering visual questions about named entities]
Paul Lerner | Salem Messoud | Olivier Ferret | Camille Guinaudeau | Hervé Le Borgne | Romaric Besançon | Jose G. Moreno | Jesús Lovón Melgarejo
Traitement Automatique des Langues, Volume 63, Numéro 2 : Traitement automatique des langues intermodal et multimodal [Cross-modal and multimodal natural language processing]

pdf bib abs

Un jeu de données pour répondre à des questions visuelles à propos d’entités nommées en utilisant des bases de connaissances (ViQuAE, a Dataset for Knowledge-based Visual Question Answering about Named Entities)
Paul Lerner | Olivier Ferret | Camille Guinaudeau | Hervé Le Borgne | Romaric Besançon | Jose Moreno | Jesús Lovón-Melgarejo
Actes de la 29e Conférence sur le Traitement Automatique des Langues Naturelles. Volume 1 : conférence principale

Dans le contexte général des traitements multimodaux, nous nous intéressons à la tâche de réponse à des questions visuelles à propos d’entités nommées en utilisant des bases de connaissances (KVQAE). Nous mettons à disposition ViQuAE, un nouveau jeu de données de 3 700 questions associées à des images, annoté à l’aide d’une méthode semi-automatique. C’est le premier jeu de données de KVQAE comprenant des types d’entités variés associé à une base de connaissances composée d’1,5 million d’articles Wikipédia, incluant textes et images. Nous proposons également un modèle de référence de KVQAE en deux étapes : recherche d’information puis extraction des réponses. Les résultats de nos expériences démontrent empiriquement la difficulté de la tâche et ouvrent la voie à une meilleure représentation multimodale des entités nommées.

2020

pdf bib abs

Building a Multimodal Entity Linking Dataset From Tweets
Omar Adjali | Romaric Besançon | Olivier Ferret | Hervé Le Borgne | Brigitte Grau
Proceedings of the Twelfth Language Resources and Evaluation Conference

The task of Entity linking, which aims at associating an entity mention with a unique entity in a knowledge base (KB), is useful for advanced Information Extraction tasks such as relation extraction or event detection. Most of the studies that address this problem rely only on textual documents while an increasing number of sources are multimedia, in particular in the context of social media where messages are often illustrated with images. In this article, we address the Multimodal Entity Linking (MEL) task, and more particularly the problem of its evaluation. To this end, we propose a novel method to quasi-automatically build annotated datasets to evaluate methods on the MEL task. The method collects text and images to jointly build a corpus of tweets with ambiguous mentions along with a Twitter KB defining the entities. We release a new annotated dataset of Twitter posts associated with images. We study the key characteristics of the proposed dataset and evaluate the performance of several MEL approaches on it.

2016

pdf bib abs

Utilisation des relations d’une base de connaissances pour la désambiguïsation d’entités nommées (Using the Relations of a Knowledge Base to Improve Entity Linking )
Romaric Besançon | Hani Daher | Olivier Ferret | Hervé Le Borgne
Actes de la conférence conjointe JEP-TALN-RECITAL 2016. volume 2 : TALN (Articles longs)

L’identification des entités nommées dans un texte est une tâche essentielle des outils d’extraction d’information dans de nombreuses applications. Cette identification passe par la reconnaissance d’une mention d’entité dans le texte, ce qui a été très largement étudié, et par l’association des entités reconnues à des entités connues, présentes dans une base de connaissances. Cette association repose souvent sur une mesure de similarité entre le contexte textuel de la mention de l’entité et un contexte textuel de description des entités de la base de connaissances. Or, ce contexte de description n’est en général pas présent pour toutes les entités. Nous proposons d’exploiter les relations de la base de connaissances pour ajouter un indice de désambiguïsation pour ces entités. Nous évaluons notre travail sur des corpus d’évaluation standards en anglais issus de la tâche de désambiguïsation d’entités de la campagne TAC-KBP.

Co-authors

Paul Lerner 2

Jesús Lovón-Melgarejo 2

Venues

Fix author