genpark-dqn-replay-buffer-target-network-skill
mcp
Uyari
Health Uyari
- No license — Repository has no license file
- Description — Repository has a description
- Active repo — Last push 0 days ago
- Low visibility — Only 7 GitHub stars
Code Gecti
- Code scan — Scanned 6 files during light audit, no dangerous patterns found
Permissions Gecti
- Permissions — No dangerous permissions requested
Bu listing icin henuz AI raporu yok.
Deep Q-Network experience replay buffer and Polyak target network averaging engine
README.md
genpark-dqn-replay-buffer-target-network-skill
Agent Skill implementing the DQN Experience Replay Buffer and Polyak Soft Target Network Averaging, stabilizing off-policy temporal difference reinforcement learning.
Architectural Overview
flowchart TD
Env["Environment Steps (s, a, r, s', done)"] --> Buffer["Circular Experience Replay Buffer"]
Buffer --> Sample["Uniform Random Mini-batch Sampling"]
Sample --> TargetCalc["Bellman Target via Target Network: y = r + gamma * max Q_target(s', a')"]
TargetCalc --> Loss["TD Error Loss: (y - Q(s, a))^2"]
Loss --> Online["Update Online Q-Network"]
Online --> Polyak["Polyak Soft Update: Q_target = tau * Q + (1 - tau) * Q_target"]
Yorumlar (0)
Yorum birakmak icin giris yap.
Yorum birakSonuc bulunamadi