AI DZ Academy
FORMATION REINFORCEMENT LEARNING 2026

Reinforcement Learning

Formation intensive pour apprendre à créer des agents autonomes avec Q-Learning, DQN, Policy Gradient et Deep Reinforcement Learning.

14Séances live
28hde formation
AvancéNiveau requis
12 000DA / mois
14
Séances live
28h
de formation
Deep Learning
Prérequis recommandé
12 000 DA
par mois
Date limite
11 Juillet 2026
1ère séance
Lundi 13 Juillet 2026
Horaires
Lun. & Jeu. 18h30–19h30
Durée totale
14 séances
Technologies abordées
Python PyTorch Gymnasium Reinforcement Learning DQN & PPO Deep RL Q-Learning Policy Gradient
Programme

Les 14 Séances en détail

Prérequis : Deep Learning (réseaux de neurones, rétropropagation, PyTorch/TensorFlow). Ces bases sont nécessaires pour suivre sereinement les algorithmes et les implémentations du cursus.
Pas encore à l'aise avec le Machine Learning ? Consultez le programme Machine Learning avant de rejoindre le parcours Reinforcement Learning.
1
Introduction au Reinforcement Learning
Théorie
  • Qu’est-ce que le Reinforcement Learning ?
  • Différences avec apprentissage supervisé et non supervisé
  • Agent, environnement, état, action, récompense
  • Formalisation MDP et exemples concrets
2
Fondements Mathématiques des MDP
Théorie
  • Fonction de valeur d’état V(s) et fonction de valeur-action Q(s,a)
  • Équations de Bellman
  • Politique optimale et principe d’optimalité
  • Analyse des structures de récompense et de transition
3
Programmation Dynamique
Théorie
  • Policy Evaluation et Policy Improvement
  • Policy Iteration
  • Value Iteration
  • Limites : nécessité d’un modèle complet de l’environnement
4
Implémentation MDP & Programmation Dynamique
Pratique / TP
  • Modélisation d’un environnement Gridworld en Python
  • Implémentation de Value Iteration
  • Implémentation de Policy Iteration
  • Visualisation de la politique optimale et de la fonction de valeur
5
Monte Carlo et Temporal Difference Learning
Théorie
  • Méthodes de Monte Carlo : prédiction et contrôle
  • TD(0) et apprentissage en ligne
  • SARSA on-policy
  • Q-Learning off-policy
6
Exploration vs Exploitation
Théorie
  • Dilemme exploration-exploitation
  • Stratégies ε-greedy et softmax
  • Bandits multi-armed
  • Upper Confidence Bound (UCB)
7
Q-Learning et SARSA sur Gymnasium
Pratique / TP
  • Prise en main de Gymnasium (ancien OpenAI Gym)
  • Implémentation de Q-Learning sur FrozenLake et Taxi-v3
  • Implémentation de SARSA
  • Comparaison SARSA vs Q-Learning
8
Deep Q-Learning (DQN)
Théorie
  • Approximation de fonction par réseaux de neurones
  • Architecture Deep Q-Network
  • Experience Replay et Target Network
  • Implémentation pratique avec PyTorch
9
Implémentation d’un agent DQN
Pratique / TP
  • Construction d’un DQN sur CartPole
  • Mise en place de l’Experience Replay
  • Réseau cible et entraînement stable
  • Suivi des courbes de récompense et perte
10
Améliorations du DQN
Théorie
  • Double DQN
  • Dueling DQN
  • Prioritized Experience Replay
  • Stratégies pour améliorer la stabilité
11
Méthodes de Policy Gradient
Théorie
  • Optimisation directe de la politique
  • Algorithme REINFORCE
  • Architecture Actor-Critic
  • Fonction d’avantage et réduction de variance
12
Implémentation REINFORCE & Actor-Critic
Pratique / TP
  • Implémentation de REINFORCE sur CartPole
  • Transition vers une architecture Actor-Critic
  • Analyse de stabilité et variance
  • Comparaison performance vs DQN
13
Méthodes Avancées : A2C, PPO, actions continues
Théorie
  • Advantage Actor-Critic (A2C / A3C)
  • Proximal Policy Optimization (PPO)
  • Actions continues : DDPG et SAC
  • Cadrage du projet final et choix d’environnement
14
RL Multi-Agents, RLHF et Soutenance Projet
Projet final
  • Introduction au Reinforcement Learning Multi-Agents
  • RLHF et liens avec les LLM
  • Finalisation du projet et préparation de la soutenance
  • Présentation des résultats et feedback formateur
Inclus

Ce que vous repartez

14 séances intensives en direct.
Notebooks Colab prêts à l'emploi.
Compétences pratiques en Deep RL et agents autonomes.
Accompagnement technique et support du formateur.
Certificat AI DZ Academy.
Maîtrise des algorithmes DQN, PPO, A2C et RL multi-agents.
Projet final pour votre portfolio.
Feedback personnalisé et corrections de projet.
12 000 DA/mois

Formation avancée : 14 séances, Deep RL et projets réels.

Prérequis Deep Learning recommandés

Retour aux formations Je m'inscris Inscriptions fermées
Inscriptions ouvertes