Running Agents 435 Reward Bench Leaderboard 📐 435 Explore and compare model scores on RewardBench benchmarks
Running Featured 127 Open-LLM performances are plateauing, let’s make the leaderboard steep again 🏔 127 Explore and compare advanced language models on a new leaderboard