ColorFM: An Optimization-to-Learning Framework for Color Transfer via Flow Matching Paper • 2607.07119 • Published Jul 8
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation Paper • 2608.03092 • Published Aug 4 • 9
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization Paper • 2607.25659 • Published Jul 28 • 84