arxiv:2608.03092
Xingye Wang
Xingye-Wang
AI & ML interests
None yet
Recent Activity
authored a paper 6 days ago
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation authored a paper 6 days ago
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy OptimizationOrganizations
None yet