Prérequis : Deep Learning (réseaux de neurones, rétropropagation, PyTorch/TensorFlow). Ces bases sont nécessaires pour suivre sereinement les algorithmes et les implémentations du cursus.
Pas encore à l'aise avec le Machine Learning ?
Consultez le programme Machine Learning avant de rejoindre le parcours Reinforcement Learning.
1
Introduction au Reinforcement Learning
Théorie
Qu’est-ce que le Reinforcement Learning ?
Différences avec apprentissage supervisé et non supervisé
Agent, environnement, état, action, récompense
Formalisation MDP et exemples concrets
2
Fondements Mathématiques des MDP
Théorie
Fonction de valeur d’état V(s) et fonction de valeur-action Q(s,a)
Équations de Bellman
Politique optimale et principe d’optimalité
Analyse des structures de récompense et de transition
3
Programmation Dynamique
Théorie
Policy Evaluation et Policy Improvement
Policy Iteration
Value Iteration
Limites : nécessité d’un modèle complet de l’environnement
4
Implémentation MDP & Programmation Dynamique
Pratique / TP
Modélisation d’un environnement Gridworld en Python
Implémentation de Value Iteration
Implémentation de Policy Iteration
Visualisation de la politique optimale et de la fonction de valeur
5
Monte Carlo et Temporal Difference Learning
Théorie
Méthodes de Monte Carlo : prédiction et contrôle
TD(0) et apprentissage en ligne
SARSA on-policy
Q-Learning off-policy
6
Exploration vs Exploitation
Théorie
Dilemme exploration-exploitation
Stratégies ε-greedy et softmax
Bandits multi-armed
Upper Confidence Bound (UCB)
7
Q-Learning et SARSA sur Gymnasium
Pratique / TP
Prise en main de Gymnasium (ancien OpenAI Gym)
Implémentation de Q-Learning sur FrozenLake et Taxi-v3
Implémentation de SARSA
Comparaison SARSA vs Q-Learning
8
Deep Q-Learning (DQN)
Théorie
Approximation de fonction par réseaux de neurones
Architecture Deep Q-Network
Experience Replay et Target Network
Implémentation pratique avec PyTorch
9
Implémentation d’un agent DQN
Pratique / TP
Construction d’un DQN sur CartPole
Mise en place de l’Experience Replay
Réseau cible et entraînement stable
Suivi des courbes de récompense et perte
10
Améliorations du DQN
Théorie
Double DQN
Dueling DQN
Prioritized Experience Replay
Stratégies pour améliorer la stabilité
11
Méthodes de Policy Gradient
Théorie
Optimisation directe de la politique
Algorithme REINFORCE
Architecture Actor-Critic
Fonction d’avantage et réduction de variance
12
Implémentation REINFORCE & Actor-Critic
Pratique / TP
Implémentation de REINFORCE sur CartPole
Transition vers une architecture Actor-Critic
Analyse de stabilité et variance
Comparaison performance vs DQN
13
Méthodes Avancées : A2C, PPO, actions continues
Théorie
Advantage Actor-Critic (A2C / A3C)
Proximal Policy Optimization (PPO)
Actions continues : DDPG et SAC
Cadrage du projet final et choix d’environnement
14
RL Multi-Agents, RLHF et Soutenance Projet
Projet final
Introduction au Reinforcement Learning Multi-Agents
RLHF et liens avec les LLM
Finalisation du projet et préparation de la soutenance
Présentation des résultats et feedback formateur
Inclus
Ce que vous repartez
14 séances intensives en direct.
Notebooks Colab prêts à l'emploi.
Compétences pratiques en Deep RL et agents autonomes.
Accompagnement technique et support du formateur.
Certificat AI DZ Academy.
Maîtrise des algorithmes DQN, PPO, A2C et RL multi-agents.
Projet final pour votre portfolio.
Feedback personnalisé et corrections de projet.
12 000 DA/mois
Formation avancée : 14 séances, Deep RL et projets réels.
Formation : Reinforcement Learning — Deep RL et agents autonomes Première séance :Lundi 13 Juillet 2026 Date limite :11 Juillet 2026 Horaires :Lundi & Jeudi 18h30 – 19h30 Prix : 12 000 DA / mois