Reinforcement-Learning
PyTorch implementations of algorithms from "Reinforcement Learning: An Introduction by Sutton and Barto", along with various RL research papers.
File Explorer
Download Latest Version (.zip)- model_final21551787.pth
- PPO_Continuous_Actions_Ant-v5_final_GAE.ptc
- PPO_Continuous_Actions_HalfCheetah-v5_final_GAE.ptc
- PPO_continuous_BipedalWalker-v3_final.ptc
- PPO_continuous_Pendulum-v1_final.ptc
- SAC_HalfCheetah-v5_final.pt
- actor_critic.png
- actor_critic_cartpole.gif
- actor_critic_cartpole_rewards.png
- blackjack_actions.png
- blackjack_qvals.png
- carpole_info.png
- cliff_walking_double_qlearning.gif
- cliff_walking_expected_sarsa.gif
- cliff_walking_gamma0.75_alpha0.1_epsilon0.1.png
- cliff_walking_gamma0.75_alpha0.1_epsilon0.png
- cliff_walking_gamma0.8_alpha0.1_epsilon0.1.png
- cliff_walking_gamma0.95_alpha0.1_epsilon0.1.png
- cliff_walking_gamma0.99_alpha0.01_epsilon0.png
- cliff_walking_gamma0.99_alpha0.1_epsilon0.1.png
- cliff_walking_gamma0.99_alpha0.1_epsilon0.png
- cliff_walking_gamma0.9_alpha0.1_epsilon0.1.png
- cliff_walking_qlearning.gif
- cliff_walking_sarsa.gif
- connect2_full_game_tree.png
- ddpg_on_Pendulum-v1.png
- ddpg_pendulum.gif
- dqn_pong.gif
- dyna_q_num_planning_steps.png
- dyna_q_num_planning_steps_zoomed.png
- dyna_q_vs_dyna_qplus.png
- expected_sarsa.png
- expert_policy_imitation_learning_animation.gif
- frozen_lake_policy_iteration.gif
- frozen_lake_policy_iteration.mp4
- frozen_slippery_lake_policy_iteration.gif
- frozen_slippery_lake_policy_iteration.mp4
- grpo_algo.png
- imitation_learning_loss.png
- learner_policy_imitation_learning_animation.gif
- Loss.svg
- loss_dqn.png
- lunar_lander.gif
- LunarLander-v3.gif
- LunarLander-v3_combined_plots.png
- mc_blackjack_value_iteration1.gif
- mcts_algorithm_flowchart.png
- mcts_figure.png
- mcts_steps.png
- monte_carlo_policy_gradient.png
- monte_carlo_policy_gradient_cartpole_train_graph.png
- pong_action.png
- pong_game_img.png
- PPO_Cont_Actions_Ant-v5_GAE_training_curves.png
- PPO_Cont_Actions_BipedalWalker-v3_training_curves.png
- PPO_Cont_Actions_HalfCheetah-v5_GAE_training_curves.png
- PPO_Continuous_Actions_Ant-v5_GAE.gif
- PPO_Continuous_Actions_BipedalWalker-v3.gif
- PPO_Continuous_Actions_BipedalWalker-v3_deterministic.gif
- PPO_Continuous_Actions_BipedalWalker-v3_less_training.gif
- PPO_Continuous_Actions_BipedalWalker-v3_less_training.png
- PPO_Continuous_Actions_HalfCheetah-v5_GAE.gif
- PPO_HalfCheetah-v5_loss_charts_tensorboard.png
- PPO_pendulumv1.gif
- PPO_pendulumv1_sum_rewards.png
- PPO_tensorboard_log_HalfCheetah-v5_sum_rewards.png
- prioritized_sweeping_maze_env_num_training_curves.png
- prioritized_sweeping_maze_env_sum_rewards.png
- rollout_sumrewads_imitation_learning.png
- sac_adaptive_alpha_inverteddoublependulum-v5_.gif
- SAC_HalfCheetah-v5_.gif
- sac_inverteddoublependulum-v5_.gif
- sac_rewards_adaptive_alpha_HalfCheetah-v5.png
- sac_rewards_adaptive_alpha_InvertedDoublePendulum-v5.png
- sac_rewards_InvertedDoublePendulum-v5.png
- sac_timesteps_adaptive_alpha_InvertedDoublePendulum-v5.png
- semi_grad_sarsa.png
- shortcut_maze_after_Dyna-Q+_with_25_planning_steps.gif
- shortcut_maze_after_Dyna-Q_with_25_planning_steps.gif
- shortcut_maze_before_Dyna-Q_with_25_planning_steps.gif
- shortcut_maze_prioritized_sweeping_maze_env.gif
- steps_per_ep_dqn.png
- Steps_per_Episode.svg
- Sum_of_Reward.svg
- sum_reward_tensorboard.png
- sum_rewards.png
- Taxi-v3_value_iteration.gif
- Taxi-v3_value_iteration1.gif
- Taxi-v3_value_iteration2.gif
- lr_schedulers.py
- .gitignore
- actor_critic_cartpole.py
- Conservative_Q_Learning_OfflineRL.md
- Curiosity-drivenExploration.md
- custom_envs.py
- deep_deterministic_policy_gradients_ddpg.py
- dqn.py
- dqn_play.py
- dqnlogs.txt
- dynamic_programming_policy_iteration_frozen_lake.py
- dynamic_programming_value_iteration_taxi_v3_.py
- dynaQ_dynaQplus_shortcut_maze_env.py
- GeneralizedAdvantageEstimation_EligibiltyTrace.md
- imitation_learning.md
- imitation_learning.py
- LICENSE
- mcts_alphaGo.md
- monte_carlo_blackjack.py
- monte_carlo_policy_gradient.py
- naive_mcts_monte_carlo_tree_search_connect2.py
- notes.md
- notes2.md
- ppo_continuous_action_space_BipedalWalker-v3.py
- ppo_continuous_action_space_GAE_Ant-v5.py
- ppo_continuous_action_space_GAE_HalfCheetah-v5.py
- ppo_lunar_lander.py
- prioritized_sweep_Dyna-Q_maze_env.py
- qlearning_sarsa_expectedsarsa_on_cliff_walking.py
- README.md
- requirements.txt
- RLHF.md
- shortcutmaze.py
- soft_actor_critic_inverted_double_pendulum.py
- soft_actor_critic_inverted_HalfCheetah-v5.py
// repository documentation
Was this content helpful?
(0 ratings)
