RL for LLM Reasoning Is Sparse Policy Selection, Not Capability Learning

(arxiv.org)

2 points | by BlackGlory 7 hours ago ago

No comments yet.