Efficient Pretraining Data Selection for Language Models via Multi-Actor Collaboration

Tianyi Bai; Ling Yang; Zhen Hao Wong; Fupeng Sun; Xinlin Zhuang; Jiahui Peng; Chi Zhang; Lijun Wu; Qiu Jiantao; Wentao Zhang; Binhang Yuan; Conghui He

doi:10.18653/v1/2025.acl-long.466

Efficient Pretraining Data Selection for Language Models via Multi-Actor Collaboration

Tianyi Bai, Ling Yang, Zhen Hao Wong, Fupeng Sun, Xinlin Zhuang, Jiahui Peng, Chi Zhang, Lijun Wu, Qiu Jiantao, Wentao Zhang, Binhang Yuan, Conghui He

Abstract

Efficient data selection is crucial to accelerate the pretraining of language model (LMs). While various methods have been proposed to enhance data efficiency, limited research has addressed the inherent conflicts between these approaches to achieve optimal data selection for LM pretraining. To tackle this problem, we propose a multi-actor collaborative data selection mechanism. Each data selection method independently prioritizes data based on its specific criterion and updates its prioritization rules using the current state of the model, functioning as an independent actor for data selection. Additionally, a console is designed to adjust the impacts of different actors at various stages and dynamically integrate information from all actors throughout the LM pretraining process. We conduct extensive empirical studies to evaluate our multi-actor framework. The experimental results demonstrate that our approach significantly improves data efficiency, accelerates convergence in LM pretraining, and achieves an average relative performance gain up to 10.5% across multiple language model benchmarks compared to the state-of-the-art methods.

Anthology ID:: 2025.acl-long.466
Volume:: Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)
Month:: July
Year:: 2025
Address:: Vienna, Austria
Editors:: Wanxiang Che, Joyce Nabende, Ekaterina Shutova, Mohammad Taher Pilehvar
Venue:: ACL
SIG:
Publisher:: Association for Computational Linguistics
Note:
Pages:: 9465–9491
Language:
URL:: https://aclanthology.org/2025.acl-long.466/
DOI:: 10.18653/v1/2025.acl-long.466
Bibkey:
Cite (ACL):: Tianyi Bai, Ling Yang, Zhen Hao Wong, Fupeng Sun, Xinlin Zhuang, Jiahui Peng, Chi Zhang, Lijun Wu, Qiu Jiantao, Wentao Zhang, Binhang Yuan, and Conghui He. 2025. Efficient Pretraining Data Selection for Language Models via Multi-Actor Collaboration. In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 9465–9491, Vienna, Austria. Association for Computational Linguistics.
Cite (Informal):: Efficient Pretraining Data Selection for Language Models via Multi-Actor Collaboration (Bai et al., ACL 2025)
Copy Citation:
PDF:: https://aclanthology.org/2025.acl-long.466.pdf

PDF Cite Search Fix data