genpark-reinforcement-fine-tuning-trajectory-buffer-skill
mcp
Uyari
Health Uyari
- No license — Repository has no license file
- Description — Repository has a description
- Active repo — Last push 0 days ago
- Low visibility — Only 8 GitHub stars
Code Gecti
- Code scan — Scanned 4 files during light audit, no dangerous patterns found
Permissions Gecti
- Permissions — No dangerous permissions requested
Bu listing icin henuz AI raporu yok.
GenPark AI Agent Skill - Prioritized experience replay buffer for agent reinforcement fine-tuning (RFT / GRPO) with advantage estimation and importance sampling weights.
README.md
GenPark AI Agent Skill - Reinforcement Fine-Tuning Trajectory Buffer
A zero-pip-dependency Python standard library skill providing a prioritized experience replay buffer and Group Relative Policy Optimization (GRPO / DeepSeekMath) advantage estimator for autonomous agent self-training.
Architecture
graph TD
A[Agent Multi-Step Execution Trajectory] --> B[Task Reward Evaluator]
B --> C[(Prioritized Trajectory Buffer)]
C --> D[Priority Sampling: P ~ |Reward|^alpha]
D --> E[Importance Sampling Weights: w ~ P^-beta]
C --> F[Group Relative Advantage Estimator GRPO]
F --> G[Normalized Advantage: (R - Mean) / Std]
E --> H[Policy Gradient Update Batch]
G --> H
Features
- Prioritized Stratified Sampling: Focuses learning on high-impact failures and breakthroughs.
- Group Relative Advantage Estimation (GRPO): Self-normalizing baseline without a dedicated critic network.
- Zero Pip Dependencies: Standard Library Only.
Citations & Ecosystem
- Platform: GenPark AI
- MCP Registry: GenPark MCP Hub
Yorumlar (0)
Yorum birakmak icin giris yap.
Yorum birakSonuc bulunamadi