@inproceedings{gibier-etal-2025-evaluation,
title = "{\'E}valuation de la description automatique de sc{\`e}nes audio par la t{\^a}che d{'}Audio Question Answering",
author = {Gibier, Marcel and
Duroselle, Rapha{\"e}l and
Serrano, Pierre and
Bo{\"e}ffard, Olivier and
Bonastre, Jean-Fran{\c{c}}ois},
editor = "Bechet, Fr{\'e}d{\'e}ric and
Chifu, Adrian-Gabriel and
Pinel-sauvagnat, Karen and
Favre, Benoit and
Maes, Eliot and
Nurbakova, Diana",
booktitle = "Actes de l'atelier {\'E}valuation des mod{\`e}les g{\'e}n{\'e}ratifs (LLM) et challenge 2025 (EvalLLM)",
month = "6",
year = "2025",
address = "Marseille, France",
publisher = "ATALA {\&} ARIA",
url = "https://aclanthology.org/2025.jeptalnrecital-evalllm.14/",
pages = "164--177",
language = "fra",
abstract = "Nous explorons l'{\'e}valuation de la t{\^a}che de description automatique de sc{\`e}nes audio {\`a} travers une approche indirecte bas{\'e}e sur la r{\'e}ponse aux questions sur des documents audio. En l{'}absence de m{\'e}triques d'{\'e}valuation robustes et automatiques pour la t{\^a}che de description automatique de sc{\`e}nes audio, nous nous appuyons sur le benchmark MMAU, un jeu de questions {\`a} choix multiple sur des extraits audio vari{\'e}s. Nous introduisons une architecture en cascade qui d{\'e}passe les performances de certains mod{\`e}les de r{\'e}f{\'e}rence de taille comparable. Toutefois, nos r{\'e}sultats mettent en {\'e}vidence des limitations du benchmark MMAU, notamment un biais textuel et une capacit{\'e} limit{\'e}e {\`a} {\'e}valuer l{'}int{\'e}gration conjointe des informations relatives {\`a} la parole et aux {\'e}v{\'e}nements sonores. Nous sugg{\'e}rons des pistes d{'}am{\'e}lioration pour rendre les {\'e}valuations futures plus fid{\`e}les aux enjeux de la t{\^a}che de description automatique de sc{\`e}nes audio."
}<?xml version="1.0" encoding="UTF-8"?>
<modsCollection xmlns="http://www.loc.gov/mods/v3">
<mods ID="gibier-etal-2025-evaluation">
<titleInfo>
<title>Évaluation de la description automatique de scènes audio par la tâche d’Audio Question Answering</title>
</titleInfo>
<name type="personal">
<namePart type="given">Marcel</namePart>
<namePart type="family">Gibier</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Raphaël</namePart>
<namePart type="family">Duroselle</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Pierre</namePart>
<namePart type="family">Serrano</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Olivier</namePart>
<namePart type="family">Boëffard</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Jean-François</namePart>
<namePart type="family">Bonastre</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<originInfo>
<dateIssued>2025-06</dateIssued>
</originInfo>
<typeOfResource>text</typeOfResource>
<language>
<languageTerm type="text">fra</languageTerm>
</language>
<relatedItem type="host">
<titleInfo>
<title>Actes de l’atelier Évaluation des modèles génératifs (LLM) et challenge 2025 (EvalLLM)</title>
</titleInfo>
<name type="personal">
<namePart type="given">Frédéric</namePart>
<namePart type="family">Bechet</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Adrian-Gabriel</namePart>
<namePart type="family">Chifu</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Karen</namePart>
<namePart type="family">Pinel-sauvagnat</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Benoit</namePart>
<namePart type="family">Favre</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Eliot</namePart>
<namePart type="family">Maes</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Diana</namePart>
<namePart type="family">Nurbakova</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<originInfo>
<publisher>ATALA & ARIA</publisher>
<place>
<placeTerm type="text">Marseille, France</placeTerm>
</place>
</originInfo>
<genre authority="marcgt">conference publication</genre>
</relatedItem>
<abstract>Nous explorons l’évaluation de la tâche de description automatique de scènes audio à travers une approche indirecte basée sur la réponse aux questions sur des documents audio. En l’absence de métriques d’évaluation robustes et automatiques pour la tâche de description automatique de scènes audio, nous nous appuyons sur le benchmark MMAU, un jeu de questions à choix multiple sur des extraits audio variés. Nous introduisons une architecture en cascade qui dépasse les performances de certains modèles de référence de taille comparable. Toutefois, nos résultats mettent en évidence des limitations du benchmark MMAU, notamment un biais textuel et une capacité limitée à évaluer l’intégration conjointe des informations relatives à la parole et aux événements sonores. Nous suggérons des pistes d’amélioration pour rendre les évaluations futures plus fidèles aux enjeux de la tâche de description automatique de scènes audio.</abstract>
<identifier type="citekey">gibier-etal-2025-evaluation</identifier>
<location>
<url>https://aclanthology.org/2025.jeptalnrecital-evalllm.14/</url>
</location>
<part>
<date>2025-6</date>
<extent unit="page">
<start>164</start>
<end>177</end>
</extent>
</part>
</mods>
</modsCollection>
%0 Conference Proceedings
%T Évaluation de la description automatique de scènes audio par la tâche d’Audio Question Answering
%A Gibier, Marcel
%A Duroselle, Raphaël
%A Serrano, Pierre
%A Boëffard, Olivier
%A Bonastre, Jean-François
%Y Bechet, Frédéric
%Y Chifu, Adrian-Gabriel
%Y Pinel-sauvagnat, Karen
%Y Favre, Benoit
%Y Maes, Eliot
%Y Nurbakova, Diana
%S Actes de l’atelier Évaluation des modèles génératifs (LLM) et challenge 2025 (EvalLLM)
%D 2025
%8 June
%I ATALA & ARIA
%C Marseille, France
%G fra
%F gibier-etal-2025-evaluation
%X Nous explorons l’évaluation de la tâche de description automatique de scènes audio à travers une approche indirecte basée sur la réponse aux questions sur des documents audio. En l’absence de métriques d’évaluation robustes et automatiques pour la tâche de description automatique de scènes audio, nous nous appuyons sur le benchmark MMAU, un jeu de questions à choix multiple sur des extraits audio variés. Nous introduisons une architecture en cascade qui dépasse les performances de certains modèles de référence de taille comparable. Toutefois, nos résultats mettent en évidence des limitations du benchmark MMAU, notamment un biais textuel et une capacité limitée à évaluer l’intégration conjointe des informations relatives à la parole et aux événements sonores. Nous suggérons des pistes d’amélioration pour rendre les évaluations futures plus fidèles aux enjeux de la tâche de description automatique de scènes audio.
%U https://aclanthology.org/2025.jeptalnrecital-evalllm.14/
%P 164-177
Markdown (Informal)
[Évaluation de la description automatique de scènes audio par la tâche d’Audio Question Answering](https://aclanthology.org/2025.jeptalnrecital-evalllm.14/) (Gibier et al., JEP/TALN/RECITAL 2025)
ACL