react / .eval_results /open_agent_leaderboard_openai_azure_gpt-5.2-2025-12-11.yaml
Elron's picture
Add Open Agent Leaderboard evaluation results
c76b9f1 verified
Raw
History Blame Contribute Delete
1.35 kB
- dataset:
id: open-agent-leaderboard/results
task_id: overall
value: 0.4075
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'
- dataset:
id: open-agent-leaderboard/results
task_id: appworld
value: 0.0
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'
- dataset:
id: open-agent-leaderboard/results
task_id: browsecomp_plus
value: 0.46
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'
- dataset:
id: open-agent-leaderboard/results
task_id: swebench
value: 0.57
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'
- dataset:
id: open-agent-leaderboard/results
task_id: taubench_airline
value: 0.54
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'
- dataset:
id: open-agent-leaderboard/results
task_id: taubench_retail
value: 0.73
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'
- dataset:
id: open-agent-leaderboard/results
task_id: taubench_telecom
value: 0.53
source:
url: https://www.exgentic.ai
name: Open Agent Leaderboard
notes: 'model: GPT-5.2'