genpark-dqn-replay-buffer-target-network-skill
mcp
Warn
Health Warn
- No license — Repository has no license file
- Description — Repository has a description
- Active repo — Last push 0 days ago
- Low visibility — Only 7 GitHub stars
Code Pass
- Code scan — Scanned 6 files during light audit, no dangerous patterns found
Permissions Pass
- Permissions — No dangerous permissions requested
No AI report is available for this listing yet.
Deep Q-Network experience replay buffer and Polyak target network averaging engine
README.md
genpark-dqn-replay-buffer-target-network-skill
Agent Skill implementing the DQN Experience Replay Buffer and Polyak Soft Target Network Averaging, stabilizing off-policy temporal difference reinforcement learning.
Architectural Overview
flowchart TD
Env["Environment Steps (s, a, r, s', done)"] --> Buffer["Circular Experience Replay Buffer"]
Buffer --> Sample["Uniform Random Mini-batch Sampling"]
Sample --> TargetCalc["Bellman Target via Target Network: y = r + gamma * max Q_target(s', a')"]
TargetCalc --> Loss["TD Error Loss: (y - Q(s, a))^2"]
Loss --> Online["Update Online Q-Network"]
Online --> Polyak["Polyak Soft Update: Q_target = tau * Q + (1 - tau) * Q_target"]
Reviews (0)
Sign in to leave a review.
Leave a reviewNo results found