On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 13 days ago • 202
sanjaydoss/Multi-Agent_Reinforcement_Learning_Trading_System_Data Viewer • Updated Sep 3 • 5.28k • 221 • 20
crumb/bloom-560m-RLHF-SD2-prompter-aesthetic Text Generation • 0.6B • Updated Mar 19, 2023 • 342 • 29
Selection-Based Structured Reasoning: Toward Efficient Multimodal Search Agents Paper • 2610.01892 • Published 10 days ago • 32
HuatuoGPT-3: RL-Only Domain Adaptation from Base Models Paper • 2610.05966 • Published 6 days ago • 43
MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning Paper • 2610.02824 • Published 9 days ago • 33
BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence Paper • 2609.20886 • Published 25 days ago • 30
SteerDuplex: Steerable Duplex Speech Dialogue Models Paper • 2609.12623 • Published about 1 month ago • 6
jaehyeokdoo2/openpi-droid-pnpcarrot-singetask-qflow-offlinerl-criticwarmup2000-alpha100-bs8-test Updated Mar 4 • 5