Sharpening Tax in Post-Training
Paper • 2610.01509 • Published • 104
None defined yet.
When Does Trajectory-Level Supervision Permit Efficient Offline Reinforcement Learning?
Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models