Apprentissage par renforcement multi-agent coopétitif
J-1
Doctorat Doctorat complet
Auvergne-Rhône-Alpes
- Disciplines
- Laboratoire
- INRIA Centre de recherche Inria de l'Université Grenoble Alpes
- Institution d'accueil
- UNIVERSITE GRENOBLE ALPES
Description
Ce projet de thèse développe les fondements théoriques et algorithmiques de l'apprentissage par renforcement multi-agents coopétitif (MARL) des contextes où des agents apprenants partagent un environnement ou une infrastructure tout en poursuivant des objectifs partiellement désalignés, comme dans les places de marché en ligne, les enchères en temps réel, les écosystèmes de recommandation et les systèmes d'IA agentique émergents. L'objectif central est de comprendre comment les agents apprenants se comportent dans des environnements stratégiques où interagissent les incitations individuelles, les effets collectifs et les boucles de rétroaction, en abordant les questions fondamentales de convergence, de sélection d'équilibre, de stabilité, d'attribution du crédit, de robustesse à la non-stationnarité, et de conception de règles d'apprentissage qui restent efficaces lorsque l'environnement est lui-même façonné par d'autres agents apprenants. Ce travail s'inscrit stratégiquement dans trois directions pour Criteo : les problèmes classiques tels que les enchères en temps réel et l'optimisation des places de marché ; l'intérêt croissant de l'équipe pour le post-entraînement des LLM et les systèmes agentiques, dont les pipelines reposent sur des mises à jour de type apprentissage par renforcement, des retours de récompense ou de préférence, et l'amélioration itérative des politiques ; et le paradigme anticipé du commerce agentique, où la découverte de produits est de plus en plus médiée par des agents d'IA agissant pour le compte des utilisateurs. Plutôt qu'un projet de production direct, ce projet vise à développer une expertise transférable sur l'optimisation de politiques guidée par la rétroaction dans des environnements stratégiques et multi-agents.Compétences requises
Compétences en probabilités/statistiques, apprentissage par renforcement, optimisation et théorie des jeux.Bibliographie
Zhang, K., Yang, Z., & Başar, T. (2021). Multi-agent reinforcement learning: A selective overview of theories and algorithms. Handbook of Reinforcement Learning and Control, 321384.Lanctot, M., Zambaldi, V., Gruslys, A., et al. (2017). A unified game-theoretic approach to multiagent reinforcement learning. Advances in Neural Information Processing Systems, 30, 41904203.
Lowe, R., Wu, Y., Tamar, A., et al. (2017). Multi-agent actor-critic for mixed cooperative-competitive environments. Advances in Neural Information Processing Systems, 30.
Liu, L. T., Mania, H., & Jordan, M. I. (2020). Competing bandits in matching markets. Proceedings of the 23rd International Conference on Artificial Intelligence and Statistics (AISTATS), PMLR 108, 16181628.
Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems, 35, 2773027744.
Mots clés
Apprentissage par renforcement, Theorie des jeuxOffre boursier / non financée
Ouvert à tous les pays
Dates
Date limite de candidature 25/07/26
Durée36 mois
Date de démarrage01/10/26
Date de création26/06/26
Langues
Niveau de français requisAucun
Niveau d'anglais requisAucun
Divers
Frais de scolarité annuels400 € / an
Contacts
Vous devez vous connecter pour voir ces informations.
Cliquez ici pour vous connecter ou vous inscrire (c'est gratuit !)
