Category
Benchmark
Muse Glimmer-30BHigh Reasoning
Gemma4-31B Thinking Mode
Qwen3.6-27B Thinking Mode
General Agentic
MCP Atlas (Public)
75.5
54.2
62.5
DeepSearch QA
74.6
61.7
71.1
𝛕3-Banking
23.5
15.1
16.7
WildClawBench
47.6
37.6
43.2
GDPVal-AA v2
953
811
1141
Gaia2
43.3
36.4
40.0
SkillsBench (with skills)
44.3
32.4
46.6
OSWorld-Verified
65.9
58.5
75.6
Agentic Coding
SWE-Bench Pro
51.2
36.9
50.2…
원문 보기 →