Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers

Published:

DOI: 10.48550/arXiv.2605.18374

Preprint: arXiv:2605.18374

Artifacts: Code · Models and datasets · Training runs