Cliff: Learning Process Rewards from the First Mistake Paper • 2609.02817 • Published 3 days ago • 15
V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning Paper • 2608.25580 • Published 10 days ago • 16
Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence Paper • 2608.11341 • Published 25 days ago • 66
FRPO/qwen3-4b-a9_dapo-dapo-noKL-clip0.2_0.28-mb4-eta100-bs256x5-n4 Text Generation • 4B • Updated 20 days ago • 412
FRPO/qwen3-4b-a9_dapo-dapo-noKL-clip0.2_0.28-mb4-eta100-bs256x5-n4 Text Generation • 4B • Updated 20 days ago • 412
FRPO/qwen3-4b-a1_base-k1-cNone-clip0.2-mb4-eta100-bs256x5-n4 Text Generation • 4B • Updated 20 days ago • 393
FRPO/qwen3-4b-a1_base-k1-cNone-clip0.2-mb4-eta100-bs256x5-n4 Text Generation • 4B • Updated 20 days ago • 393
FRPO/qwen3-4b-a0_klloss-lossKL-coef0.001-mb4-eta100-bs256x5-n4 Text Generation • 4B • Updated 20 days ago • 393
FRPO/qwen3-4b-a0_klloss-lossKL-coef0.001-mb4-eta100-bs256x5-n4 Text Generation • 4B • Updated 20 days ago • 393
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2_0.35-mb4-eta100-bs256x5-n2-r3 Text Generation • 2B • Updated 20 days ago • 385
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2_0.35-mb4-eta100-bs256x5-n2-r3 Text Generation • 2B • Updated 20 days ago • 385
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2_0.28-mb4-eta100-bs256x5-n2-r3 Text Generation • 2B • Updated 20 days ago • 362
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2_0.28-mb4-eta100-bs256x5-n2-r3 Text Generation • 2B • Updated 20 days ago • 362
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2_0.28-mb4-eta100-bs256x5-n2-r2 Text Generation • 2B • Updated 20 days ago • 368
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2_0.28-mb4-eta100-bs256x5-n2-r2 Text Generation • 2B • Updated 20 days ago • 368
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2-mb4-eta100-bs256x5-n2-r3 Text Generation • 2B • Updated 20 days ago • 664
FRPO/qwen3-1.7b-a9_dapo-dapo-noKL-clip0.2-mb4-eta100-bs256x5-n2-r3 Text Generation • 2B • Updated 20 days ago • 664