arxiv:2606.04923
Xuekang Wang
wxk123
·
AI & ML interests
LLM Safety
Recent Activity
authored a paper about 2 months ago
Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning upvoted a paper about 2 months ago
Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning updated a model 7 months ago
wxk123/llama-3.2-1b-instruct-augmented