Tool use & function calling
τ³-Banking
97 fintech customer-support tasks (disputes, account freezes, provisional credits, product changes) where an agent must navigate roughly 700 interconnected policy documents (~195k tokens) and execute multi-step tool calls. Graded pass@1 against backend database state rather than conversational quality. This is an agent-system result and is distinct from τ²-bench Telecom and from earlier τ-bench releases.
How models are tested
Scores are published numbers from the sources below. They are only comparable when the evaluation version, tools, agent harness, and sampling setup match. Missing scores are omitted rather than treated as zero.
- Category
- Tool use & function calling
- Metric
- Percent
- Direction
- Higher is better
- Coverage
- 101 / 318Models in this catalog with a published score
- Updated
- Catalog snapshot date
Scores
- 1Grok 4.650.7%
xAIclosed
- 2Muse Spark 1.350.5%
Metaclosed
- 3GLM-5.350.3%
Zhipu AIopen
- 4Qwen3.8 27B48.0%
Alibabaopen
- 5Qwen3.8 Max47.8%
Alibabaopen
- 6Claude Fable 5.147.2%
Anthropicclosed
- 7GLM-5.3 Flash47.2%
Zhipu AIopen
- 8Kimi K346.0%
Moonshotopen
- 9Qwen3.8 Flash Next45.4%
Alibabaopen
- 10Gemini 3.8 Flash44.9%
Googleclosed
- 11GPT-5.6 Sol44.3%
OpenAIclosed
- 12Claude Opus 542.1%
Anthropicclosed
- 13Grok 4.542.1%
xAIclosed
- 14GPT-6 Astra41.4%
OpenAIclosed
- 15Atria Dawn Preview41.2%
Shanghai AI Labopen
- 16GPT-5.6 Terra40.2%
OpenAIclosed
- 17GPT-5.439.6%
OpenAIclosed
- 18DeepSeek V4 Pro 081339.6%
DeepSeekclosed
- 19DeepSeek V4 Flash 073139.4%
DeepSeekopen
- 20GPT-5.539.0%
OpenAIclosed
- 21Claude Fable 538.1%
Anthropicclosed
- 22Claude Sonnet 537.3%
Anthropicclosed
- 23Muse Spark 1.234.8%
Metaclosed
- 24GLM-5.234.6%
Zhipu AIopen
- 25Claude Opus 4.734.6%
Anthropicclosed
- 26Claude Sonnet 4.634.4%
Anthropicclosed
- 27Claude Opus 4.834.2%
Anthropicclosed
- 28K2 Horizon 375B A23B34.2%
MBZUAI Institute of Foundation Modelsopen
- 29Gemini 3.7 Flash32.8%
Googleclosed
- 30Gemini 3.5 Flash32.2%
Googleclosed
- 31Muse Spark 1.131.8%
Metaclosed
- 32GPT-5.6 Luna31.1%
OpenAIclosed
- 33DeepSeek V4 Flash30.9%
DeepSeekopen
- 34DeepSeek V4 Pro30.1%
DeepSeekopen
- 35Gemini 3.6 Flash29.9%
Googleclosed
- 36Inkling29.1%
Thinking Machinesopen
- 37GPT-5.4 Nano27.4%
OpenAIclosed
- 38Ling-3.0 Flash27.2%
InclusionAIopen
- 39GPT-5.4 Mini25.6%
OpenAIclosed
- 40Muse Glimmer23.5%
Metaopen
- 41Solar Pro 423.3%
Upstageclosed
- 42Kimi K2.623.3%
Moonshotclosed
- 43Hy322.9%
Tencentopen
- 44GPT-522.1%
OpenAIclosed
- 45Gemini 3 Flash20.8%
Googleclosed
- 46Qwen3.6 Plus20.8%
Alibabaclosed
- 47Ling-3.0 Tiny20.8%
InclusionAIopen
- 48Kimi K2.7 Code20.2%
Moonshotopen
- 49Inkling-Small18.8%
Thinking Machinesopen
- 50Ring-2.6-1T17.9%
InclusionAIopen
- 51Gemini 3.5 Flash-Lite17.5%
Googleclosed
- 52Qwen3.7 Plus17.5%
Alibabaclosed
- 53Qwen3.6 27B16.7%
Alibabaopen
- 54GPT-5 Mini15.5%
OpenAIclosed
- 55MiniMax M315.3%
MiniMaxopen
- 56Mistral Medium 3.515.1%
Mistralopen
- 57Gemma 4 31B14.8%
Googleopen
- 58Granite 4.2 30B14.4%
IBMopen
- 59Kimi K2.514.2%
Moonshotopen
- 60Nemotron 3 Ultra14.2%
NVIDIAopen
- 61GLM-5.113.6%
Zhipu AIopen
- 62Qwen3.5 397B-A17B13.4%
Alibabaopen
- 63LongCat-2.013.2%
Meituanopen
- 64gpt-oss-120B12.8%
OpenAIopen
- 65Grok 4.312.4%
xAIclosed
- 66GLM-4.712.2%
Zhipu AIopen
- 67Qwen3.7 Max11.8%
Alibabaclosed
- 68Devstral 210.5%
Mistralopen
- 69MiMo-V2.5-Pro9.9%
Xiaomiopen
- 70MiniMax M2.79.9%
MiniMaxclosed
- 71Gemini 2.5 Pro9.7%
Googleclosed
- 72Gemini 3.1 Flash-Lite9.7%
Googleclosed
- 73Mercury 29.5%
Inception Labsclosed
- 74Qwen3.6 35B A3B9.3%
Alibabaopen
- 75Nemotron 3.5 Lightning8.9%
NVIDIAopen
- 76MiMo-V2.58.7%
Xiaomiopen
- 77Solar Pro 38.7%
Upstageopen
- 78Mistral Medium 3.18.2%
Mistralclosed
- 79Granite 4.2 8B7.6%
IBMopen
- 80gpt-oss-20B7.0%
OpenAIopen
- 81Ministral 3 14B6.6%
Mistralopen
- 82DeepSeek R16.4%
DeepSeekopen
- 83Mistral Small 3.26.2%
Mistralopen
- 84Qwen3-Next 80B-A3B6.2%
Alibabaopen
- 85Mistral Large 35.8%
Mistralopen
- 86Trinity Large Thinking5.8%
Arcee AIopen
- 87Granite 4.2 3B5.6%
IBMopen
- 88GPT-4.1 Mini5.4%
OpenAIclosed
- 89Qwen3 32B5.4%
Alibabaopen
- 90Mistral Small 44.9%
Mistralopen
- 91Ministral 3 3B4.7%
Mistralopen
- 92DeepSeek V34.7%
DeepSeekopen
- 93Llama 4 Maverick3.7%
Metaopen
- 94Ministral 3 8B3.7%
Mistralopen
- 95GPT-4.1 Nano3.5%
OpenAIclosed
- 96Llama 4 Scout3.3%
Metaopen
- 97GPT-4o Mini2.9%
OpenAIclosed
- 98Ling-2.6 Flash2.9%
InclusionAIclosed
- 99Gemma 3 12B0.8%
Googleopen
- 100Gemma 3 27B0.8%
Googleopen
- 101Gemma 3 4B0.4%
Googleopen