genpark-dqn-replay-buffer-target-network-skill

mcp
Security Audit
Warn
Health Warn
  • No license — Repository has no license file
  • Description — Repository has a description
  • Active repo — Last push 0 days ago
  • Low visibility — Only 7 GitHub stars
Code Pass
  • Code scan — Scanned 6 files during light audit, no dangerous patterns found
Permissions Pass
  • Permissions — No dangerous permissions requested

No AI report is available for this listing yet.

SUMMARY

Deep Q-Network experience replay buffer and Polyak target network averaging engine

README.md

genpark-dqn-replay-buffer-target-network-skill

Agent Skill implementing the DQN Experience Replay Buffer and Polyak Soft Target Network Averaging, stabilizing off-policy temporal difference reinforcement learning.

Architectural Overview

flowchart TD
    Env["Environment Steps (s, a, r, s', done)"] --> Buffer["Circular Experience Replay Buffer"]
    Buffer --> Sample["Uniform Random Mini-batch Sampling"]
    Sample --> TargetCalc["Bellman Target via Target Network: y = r + gamma * max Q_target(s', a')"]
    TargetCalc --> Loss["TD Error Loss: (y - Q(s, a))^2"]
    Loss --> Online["Update Online Q-Network"]
    Online --> Polyak["Polyak Soft Update: Q_target = tau * Q + (1 - tau) * Q_target"]

Reviews (0)

No results found