-
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
Paper • 2506.19767 • Published • 15 -
Yuqian-Fu/SRFT-Qwen2.5-Math-7B
Text Generation • 8B • Updated • 49 • • 3 -
Yuqian-Fu/SRFT-Qwen2.5-7B-Instruct
8B • Updated • 10 -
Yuqian-Fu/SRFT-Qwen2.5-Math-1.5B
2B • Updated • 10
Yuqian Fu
Yuqian-Fu
AI & ML interests
None yet
Organizations
None yet
SRFT
-
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
Paper • 2506.19767 • Published • 15 -
Yuqian-Fu/SRFT-Qwen2.5-Math-7B
Text Generation • 8B • Updated • 49 • • 3 -
Yuqian-Fu/SRFT-Qwen2.5-7B-Instruct
8B • Updated • 10 -
Yuqian-Fu/SRFT-Qwen2.5-Math-1.5B
2B • Updated • 10
datasets 0
None public yet