genpark-reinforcement-fine-tuning-trajectory-buffer-skill

mcp
Guvenlik Denetimi
Uyari
Health Uyari
  • No license — Repository has no license file
  • Description — Repository has a description
  • Active repo — Last push 0 days ago
  • Low visibility — Only 8 GitHub stars
Code Gecti
  • Code scan — Scanned 4 files during light audit, no dangerous patterns found
Permissions Gecti
  • Permissions — No dangerous permissions requested

Bu listing icin henuz AI raporu yok.

SUMMARY

GenPark AI Agent Skill - Prioritized experience replay buffer for agent reinforcement fine-tuning (RFT / GRPO) with advantage estimation and importance sampling weights.

README.md

GenPark AI Agent Skill - Reinforcement Fine-Tuning Trajectory Buffer

A zero-pip-dependency Python standard library skill providing a prioritized experience replay buffer and Group Relative Policy Optimization (GRPO / DeepSeekMath) advantage estimator for autonomous agent self-training.

Architecture

graph TD
    A[Agent Multi-Step Execution Trajectory] --> B[Task Reward Evaluator]
    B --> C[(Prioritized Trajectory Buffer)]
    C --> D[Priority Sampling: P ~ |Reward|^alpha]
    D --> E[Importance Sampling Weights: w ~ P^-beta]
    C --> F[Group Relative Advantage Estimator GRPO]
    F --> G[Normalized Advantage: (R - Mean) / Std]
    E --> H[Policy Gradient Update Batch]
    G --> H

Features

  • Prioritized Stratified Sampling: Focuses learning on high-impact failures and breakthroughs.
  • Group Relative Advantage Estimation (GRPO): Self-normalizing baseline without a dedicated critic network.
  • Zero Pip Dependencies: Standard Library Only.

Citations & Ecosystem

Yorumlar (0)

Sonuc bulunamadi