CF202649397
Apprentissage par renforcement multi-agent coopétitif
J-1
Doctorat Doctorat complet
Auvergne-Rhône-Alpes
Disciplines
Laboratoire
INRIA Centre de recherche Inria de l'Université Grenoble Alpes
Institution d'accueil
UNIVERSITE GRENOBLE ALPES
Ecole doctorale
Mathématiques, sciences et technologies de l'information, informatique - ED 217

Description

Ce projet de thèse développe les fondements théoriques et algorithmiques de l'apprentissage par renforcement multi-agents coopétitif (MARL) — des contextes où des agents apprenants partagent un environnement ou une infrastructure tout en poursuivant des objectifs partiellement désalignés, comme dans les places de marché en ligne, les enchères en temps réel, les écosystèmes de recommandation et les systèmes d'IA agentique émergents. L'objectif central est de comprendre comment les agents apprenants se comportent dans des environnements stratégiques où interagissent les incitations individuelles, les effets collectifs et les boucles de rétroaction, en abordant les questions fondamentales de convergence, de sélection d'équilibre, de stabilité, d'attribution du crédit, de robustesse à la non-stationnarité, et de conception de règles d'apprentissage qui restent efficaces lorsque l'environnement est lui-même façonné par d'autres agents apprenants. Ce travail s'inscrit stratégiquement dans trois directions pour Criteo : les problèmes classiques tels que les enchères en temps réel et l'optimisation des places de marché ; l'intérêt croissant de l'équipe pour le post-entraînement des LLM et les systèmes agentiques, dont les pipelines reposent sur des mises à jour de type apprentissage par renforcement, des retours de récompense ou de préférence, et l'amélioration itérative des politiques ; et le paradigme anticipé du commerce agentique, où la découverte de produits est de plus en plus médiée par des agents d'IA agissant pour le compte des utilisateurs. Plutôt qu'un projet de production direct, ce projet vise à développer une expertise transférable sur l'optimisation de politiques guidée par la rétroaction dans des environnements stratégiques et multi-agents.

Compétences requises

Compétences en probabilités/statistiques, apprentissage par renforcement, optimisation et théorie des jeux.

Bibliographie

Zhang, K., Yang, Z., & Başar, T. (2021). Multi-agent reinforcement learning: A selective overview of theories and algorithms. Handbook of Reinforcement Learning and Control, 321–384.

Lanctot, M., Zambaldi, V., Gruslys, A., et al. (2017). A unified game-theoretic approach to multiagent reinforcement learning. Advances in Neural Information Processing Systems, 30, 4190–4203.

Lowe, R., Wu, Y., Tamar, A., et al. (2017). Multi-agent actor-critic for mixed cooperative-competitive environments. Advances in Neural Information Processing Systems, 30.

Liu, L. T., Mania, H., & Jordan, M. I. (2020). Competing bandits in matching markets. Proceedings of the 23rd International Conference on Artificial Intelligence and Statistics (AISTATS), PMLR 108, 1618–1628.

Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems, 35, 27730–27744.

Mots clés

Apprentissage par renforcement, Theorie des jeux

Offre boursier / non financée

Ouvert à tous les pays

Dates

Date limite de candidature 25/07/26

Durée36 mois

Date de démarrage01/10/26

Date de création26/06/26

Langues

Niveau de français requisAucun

Niveau d'anglais requisAucun

Divers

Frais de scolarité annuels400 € / an

Contacts

Vous devez vous connecter pour voir ces informations.

Cliquez ici pour vous connecter ou vous inscrire (c'est gratuit !)