@inproceedings{hoang-ha-2025-pensez,
title = "Pensez: Moins de donn{\'e}es, meilleur raisonnement {--} Repenser les {LLM} fran{\c{c}}ais",
author = "Hoang Ha, Huy",
editor = "Bechet, Fr{\'e}d{\'e}ric and
Chifu, Adrian-Gabriel and
Pinel-sauvagnat, Karen and
Favre, Benoit and
Maes, Eliot and
Nurbakova, Diana",
booktitle = "Actes des 32{\`e}me Conf{\'e}rence sur le Traitement Automatique des Langues Naturelles (TALN), volume 1 : articles scientifiques originaux",
month = "6",
year = "2025",
address = "Marseille, France",
publisher = "ATALA {\&} ARIA",
url = "https://aclanthology.org/2025.jeptalnrecital-taln.35/",
pages = "573--598",
language = "fra",
abstract = "Les grands mod{\`e}les linguistiques (LLM) ont d{\'e}montr{\'e} des capacit{\'e}s remarquables dans diverses t{\^a}ches de traitement automatique du langage naturel. Cependant, l{'}obtention de performances {\'e}lev{\'e}es dans des domaines sp{\'e}cialis{\'e}s tels que le raisonnement math{\'e}matique et les langues autres que l{'}anglais n{\'e}cessite souvent un entra{\^i}nement intensif. Cet article {\'e}tudie l{'}affinage strat{\'e}gique sur un petit ensemble de donn{\'e}es bilingue de haute qualit{\'e}, afin d{'}am{\'e}liorer {\`a} la fois les capacit{\'e}s de raisonnement et la ma{\^i}trise de la langue fran{\c{c}}aise d{'}un LLM. Nous d{\'e}montrons des am{\'e}liorations du raisonnement math{\'e}matique en utilisant seulement 2000 {\'e}chantillons soigneusement s{\'e}lectionn{\'e}s. Ces r{\'e}sultats remettent en question l{'}hypoth{\`e}se dominante selon laquelle des ensembles de donn{\'e}es massifs sont une condition pr{\'e}alable {\`a} de solides performances de raisonnement pour les LLM."
}<?xml version="1.0" encoding="UTF-8"?>
<modsCollection xmlns="http://www.loc.gov/mods/v3">
<mods ID="hoang-ha-2025-pensez">
<titleInfo>
<title>Pensez: Moins de données, meilleur raisonnement – Repenser les LLM français</title>
</titleInfo>
<name type="personal">
<namePart type="given">Huy</namePart>
<namePart type="family">Hoang Ha</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<originInfo>
<dateIssued>2025-06</dateIssued>
</originInfo>
<typeOfResource>text</typeOfResource>
<language>
<languageTerm type="text">fra</languageTerm>
</language>
<relatedItem type="host">
<titleInfo>
<title>Actes des 32ème Conférence sur le Traitement Automatique des Langues Naturelles (TALN), volume 1 : articles scientifiques originaux</title>
</titleInfo>
<name type="personal">
<namePart type="given">Frédéric</namePart>
<namePart type="family">Bechet</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Adrian-Gabriel</namePart>
<namePart type="family">Chifu</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Karen</namePart>
<namePart type="family">Pinel-sauvagnat</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Benoit</namePart>
<namePart type="family">Favre</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Eliot</namePart>
<namePart type="family">Maes</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Diana</namePart>
<namePart type="family">Nurbakova</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<originInfo>
<publisher>ATALA & ARIA</publisher>
<place>
<placeTerm type="text">Marseille, France</placeTerm>
</place>
</originInfo>
<genre authority="marcgt">conference publication</genre>
</relatedItem>
<abstract>Les grands modèles linguistiques (LLM) ont démontré des capacités remarquables dans diverses tâches de traitement automatique du langage naturel. Cependant, l’obtention de performances élevées dans des domaines spécialisés tels que le raisonnement mathématique et les langues autres que l’anglais nécessite souvent un entraînement intensif. Cet article étudie l’affinage stratégique sur un petit ensemble de données bilingue de haute qualité, afin d’améliorer à la fois les capacités de raisonnement et la maîtrise de la langue française d’un LLM. Nous démontrons des améliorations du raisonnement mathématique en utilisant seulement 2000 échantillons soigneusement sélectionnés. Ces résultats remettent en question l’hypothèse dominante selon laquelle des ensembles de données massifs sont une condition préalable à de solides performances de raisonnement pour les LLM.</abstract>
<identifier type="citekey">hoang-ha-2025-pensez</identifier>
<location>
<url>https://aclanthology.org/2025.jeptalnrecital-taln.35/</url>
</location>
<part>
<date>2025-6</date>
<extent unit="page">
<start>573</start>
<end>598</end>
</extent>
</part>
</mods>
</modsCollection>
%0 Conference Proceedings
%T Pensez: Moins de données, meilleur raisonnement – Repenser les LLM français
%A Hoang Ha, Huy
%Y Bechet, Frédéric
%Y Chifu, Adrian-Gabriel
%Y Pinel-sauvagnat, Karen
%Y Favre, Benoit
%Y Maes, Eliot
%Y Nurbakova, Diana
%S Actes des 32ème Conférence sur le Traitement Automatique des Langues Naturelles (TALN), volume 1 : articles scientifiques originaux
%D 2025
%8 June
%I ATALA & ARIA
%C Marseille, France
%G fra
%F hoang-ha-2025-pensez
%X Les grands modèles linguistiques (LLM) ont démontré des capacités remarquables dans diverses tâches de traitement automatique du langage naturel. Cependant, l’obtention de performances élevées dans des domaines spécialisés tels que le raisonnement mathématique et les langues autres que l’anglais nécessite souvent un entraînement intensif. Cet article étudie l’affinage stratégique sur un petit ensemble de données bilingue de haute qualité, afin d’améliorer à la fois les capacités de raisonnement et la maîtrise de la langue française d’un LLM. Nous démontrons des améliorations du raisonnement mathématique en utilisant seulement 2000 échantillons soigneusement sélectionnés. Ces résultats remettent en question l’hypothèse dominante selon laquelle des ensembles de données massifs sont une condition préalable à de solides performances de raisonnement pour les LLM.
%U https://aclanthology.org/2025.jeptalnrecital-taln.35/
%P 573-598
Markdown (Informal)
[Pensez: Moins de données, meilleur raisonnement – Repenser les LLM français](https://aclanthology.org/2025.jeptalnrecital-taln.35/) (Hoang Ha, JEP/TALN/RECITAL 2025)
ACL