@inproceedings{jourdain-hellal-2025-generer,
title = "G{\'e}n{\'e}rer pour mieux tester : vers des datasets diversifi{\'e}s pour une {\'e}valuation fiable des syst{\`e}mes de Question Answering",
author = "Jourdain, Louis and
Hellal, Skander",
editor = "Bechet, Fr{\'e}d{\'e}ric and
Chifu, Adrian-Gabriel and
Pinel-sauvagnat, Karen and
Favre, Benoit and
Maes, Eliot and
Nurbakova, Diana",
booktitle = "Actes de l'atelier {\'E}valuation des mod{\`e}les g{\'e}n{\'e}ratifs (LLM) et challenge 2025 (EvalLLM)",
month = "6",
year = "2025",
address = "Marseille, France",
publisher = "ATALA {\&} ARIA",
url = "https://aclanthology.org/2025.jeptalnrecital-evalllm.18/",
pages = "204--227",
language = "fra",
abstract = "L'{\'e}valuation des mod{\`e}les d{'}IA g{\'e}n{\'e}rative repose sur des datasets contenant des valeurs de r{\'e}f{\'e}rence attendues pour une entr{\'e}e donn{\'e}e. Cependant, la constitution de ces jeux de donn{\'e}es est un processus complexe et co{\^u}teux. Cet article explore la g{\'e}n{\'e}ration automatique de datasets de questions diversifi{\'e}es pour tester notamment les syst{\`e}mes de RAG (Retrieval Augmented Generation). Nous proposons un cadre m{\'e}thodologique combinant mod{\`e}les de langage {\`a} grande {\'e}chelle (LLMs) et techniques traditionnelles de traitement du langage naturel (NLP) et de data science, incluant les graphes de connaissances, la similarit{\'e} s{\'e}mantique voire le topic modeling. L{'}approche propos{\'e}e repose sur un syst{\`e}me modulaire exploitant diverses sources documentaires et int{\'e}grant des m{\'e}canismes avanc{\'e}s de filtrage afin de garantir la qualit{\'e} et la diversit{\'e} des questions produites."
}<?xml version="1.0" encoding="UTF-8"?>
<modsCollection xmlns="http://www.loc.gov/mods/v3">
<mods ID="jourdain-hellal-2025-generer">
<titleInfo>
<title>Générer pour mieux tester : vers des datasets diversifiés pour une évaluation fiable des systèmes de Question Answering</title>
</titleInfo>
<name type="personal">
<namePart type="given">Louis</namePart>
<namePart type="family">Jourdain</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Skander</namePart>
<namePart type="family">Hellal</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<originInfo>
<dateIssued>2025-06</dateIssued>
</originInfo>
<typeOfResource>text</typeOfResource>
<language>
<languageTerm type="text">fra</languageTerm>
</language>
<relatedItem type="host">
<titleInfo>
<title>Actes de l’atelier Évaluation des modèles génératifs (LLM) et challenge 2025 (EvalLLM)</title>
</titleInfo>
<name type="personal">
<namePart type="given">Frédéric</namePart>
<namePart type="family">Bechet</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Adrian-Gabriel</namePart>
<namePart type="family">Chifu</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Karen</namePart>
<namePart type="family">Pinel-sauvagnat</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Benoit</namePart>
<namePart type="family">Favre</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Eliot</namePart>
<namePart type="family">Maes</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Diana</namePart>
<namePart type="family">Nurbakova</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<originInfo>
<publisher>ATALA & ARIA</publisher>
<place>
<placeTerm type="text">Marseille, France</placeTerm>
</place>
</originInfo>
<genre authority="marcgt">conference publication</genre>
</relatedItem>
<abstract>L’évaluation des modèles d’IA générative repose sur des datasets contenant des valeurs de référence attendues pour une entrée donnée. Cependant, la constitution de ces jeux de données est un processus complexe et coûteux. Cet article explore la génération automatique de datasets de questions diversifiées pour tester notamment les systèmes de RAG (Retrieval Augmented Generation). Nous proposons un cadre méthodologique combinant modèles de langage à grande échelle (LLMs) et techniques traditionnelles de traitement du langage naturel (NLP) et de data science, incluant les graphes de connaissances, la similarité sémantique voire le topic modeling. L’approche proposée repose sur un système modulaire exploitant diverses sources documentaires et intégrant des mécanismes avancés de filtrage afin de garantir la qualité et la diversité des questions produites.</abstract>
<identifier type="citekey">jourdain-hellal-2025-generer</identifier>
<location>
<url>https://aclanthology.org/2025.jeptalnrecital-evalllm.18/</url>
</location>
<part>
<date>2025-6</date>
<extent unit="page">
<start>204</start>
<end>227</end>
</extent>
</part>
</mods>
</modsCollection>
%0 Conference Proceedings
%T Générer pour mieux tester : vers des datasets diversifiés pour une évaluation fiable des systèmes de Question Answering
%A Jourdain, Louis
%A Hellal, Skander
%Y Bechet, Frédéric
%Y Chifu, Adrian-Gabriel
%Y Pinel-sauvagnat, Karen
%Y Favre, Benoit
%Y Maes, Eliot
%Y Nurbakova, Diana
%S Actes de l’atelier Évaluation des modèles génératifs (LLM) et challenge 2025 (EvalLLM)
%D 2025
%8 June
%I ATALA & ARIA
%C Marseille, France
%G fra
%F jourdain-hellal-2025-generer
%X L’évaluation des modèles d’IA générative repose sur des datasets contenant des valeurs de référence attendues pour une entrée donnée. Cependant, la constitution de ces jeux de données est un processus complexe et coûteux. Cet article explore la génération automatique de datasets de questions diversifiées pour tester notamment les systèmes de RAG (Retrieval Augmented Generation). Nous proposons un cadre méthodologique combinant modèles de langage à grande échelle (LLMs) et techniques traditionnelles de traitement du langage naturel (NLP) et de data science, incluant les graphes de connaissances, la similarité sémantique voire le topic modeling. L’approche proposée repose sur un système modulaire exploitant diverses sources documentaires et intégrant des mécanismes avancés de filtrage afin de garantir la qualité et la diversité des questions produites.
%U https://aclanthology.org/2025.jeptalnrecital-evalllm.18/
%P 204-227
Markdown (Informal)
[Générer pour mieux tester : vers des datasets diversifiés pour une évaluation fiable des systèmes de Question Answering](https://aclanthology.org/2025.jeptalnrecital-evalllm.18/) (Jourdain & Hellal, JEP/TALN/RECITAL 2025)
ACL