Hao-Xuan Ma
gh0stHunter
ยท
AI & ML interests
None yet
Recent Activity
authored a paper 1 day ago
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation authored a paper 1 day ago
MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing authored a paper 1 day ago
Reinforcement Learning from Multi-role Debates as Feedback for Bias
Mitigation in LLMsOrganizations
None yet