Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization Paper • 2608.23311 • Published 15 days ago • 17
A^3-Bench: Benchmarking Memory-Driven Scientific Reasoning via Anchor and Attractor Activation Paper • 2601.09274 • Published Jan 14 • 84