Multi-Agent Constrained Policy Optimisation (MACPO; MAPPO-L).
-
Updated
Apr 17, 2024 - Python
Multi-Agent Constrained Policy Optimisation (MACPO; MAPPO-L).
Implementation of a Deep Reinforcement Learning algorithm, Proximal Policy Optimization (SOTA), on a continuous action space openai gym (Box2D/Car Racing v0)
Band-constrained Policy Optimization with probability-aware clipping for LLM reinforcement learning
Policy Optimization with Penalized Point Probability Distance: an Alternative to Proximal Policy Optimization
[AAAI 2026] D²PPO: Diffusion Policy Policy Optimization with Dispersive Loss.
Mirror Descent Policy Optimization
Codebase to fully reproduce the results of "No Representation, No Trust: Connecting Representation, Collapse, and Trust Issues in PPO" (Moalla et al. 2024). Uses TorchRL and provides extensive tools for studying representation dynamics in policy optimization.
Model-based Policy Gradients
Code for Paper (Policy Optimization in RLHF: The Impact of Out-of-preference Data)
A modular, production-grade framework for Reinforcement Learning from Human Feedback (RLHF) with Proximal Policy Optimization (PPO) and Direct Preference Optimization (DPO).
Bittensor Subnet 11: verified agent work on open-weight models. Season 2: fusion policies over the Engy catalog; next: an open protocol for verifiable environments.
This repository contains the code for the paper "Local policy search with Bayesian optimization".
CPPO: Contrastive Perception Policy Optimization for VLM Agents
Implementation and explorations into MPO / DMPO
Reinforcement Learning (RL)! This repository is your hands-on guide to implementing RL algorithms, from Markov Decision Processes (MDPs) to advanced methods like PPO and DDPG. Build smart agents, learn the math behind policies, and experiment with real-world applications!
Paragraph-level Policy Optimization for Vision-Language Deepfake Detection - ICML 2026
Autonomous reinforcement learning loop with adaptive hyperparameter tuning, multi-policy ensemble management, and framework-agnostic agent support. Self-converging via exponential backoff. Works with TensorFlow, PyTorch, JAX - bring any algorithm.
Code for Policy Optimization as Online Learning with Mediator Feedback
Code accompanying the NeurIPS 2025 paper "Sequential Monte Carlo for Policy Optimization in Continuous POMDPs".
To associate your repository with the policy-optimization topic, visit your repo's landing page and select "manage topics."