Leaderboard | Text

Models

Choose model family

Claude by Anthropic

Mistral by Mistral AI

Choose topic

All topics Facts and Information Creative Writing and Ideation Logic and Problem-Solving Task Completion Coding

Language

Choose language

All languages English Chinese Arabic Spanish Indonesian Japanese

More filters

Show inactive models

Hide models that are no longer actively available on Yupp.

Turns

Filter model performance by the number of turns in a conversation.

All Single turn Multiple turns

Open license models

Filter the leaderboard to only show models that have an open license.

All selected Open license Proprietary license

1126

Qwen3 235B A22B Instruct 2507

1124

Gemini 2.5 Flash Preview 0925

1119

Claude Opus 4.1 (Thinking)

1116

Claude Sonnet 4 (Thinking)

1115

GPT-5 (High)

1115

GPT-5

1113

GPT-4o

1110

Nova Experimental Chat 12-10

1106

GPT-4.5 Preview

1104

Gemini 2.5 Flash

1103

Qwen3 Max Instruct Preview

1102

Grok 4

1101

Mistral Medium 3.1

1101

Claude Opus 4

1093

Kimi K2.5 Instant

Last updated about 1 month ago

Rank	Overall	Name	VIBE Score	Confidence Interval	Votes	Downvote %	Abort %	Speed	Latency	Context	Cost (Input)	Cost (Output)
41	40	Qwen3 235B A22B Instruct 2507	1126	±8	2.1K	2.5%	6.8%	13 tps	1.9s	262K	$0.13	$0.52
42	60	Gemini 2.5 Flash Preview 0925	1124	±9	3.4K	3.4%	1.2%	5 tps	0.9s	1M	$0.13	$0.97
43	56	Claude Opus 4.1 (Thinking)	1119	±10	2.1K	5.0%	<0.1%	20 tps	3.9s	200K	$15.00	$75.00
44	48	Claude Sonnet 4 (Thinking)	1116	±7	5.3K	4.2%	1.5%	52 tps	1.5s	200K	$3.00	$13.67
45	26	GPT-5 (High)	1115	±7	3.7K	3.6%	4.5%	81 tps	35.9s	400K	$1.25	$10.00
46	52	GPT-5	1115	±8	5.4K	3.7%	3.1%	78 tps	23.1s	400K	$1.25	$9.67
47	81	GPT-4o	1113	±8	2.2K	3.6%	1.0%	49 tps	2.4s	128K	$3.71	$12.57
48	29	Nova Experimental Chat 12-10	1110	±25	710	1.4%	2.4%	84 tps	12.9s	98K	$0	$0
49	77	GPT-4.5 Preview	1106	±16	520	2.8%	<0.1%	36 tps	3.0s	200K	$75.00	$150.00
50	95	Gemini 2.5 Flash	1104	±7	9.8K	2.7%	1.3%	2 tps	3.7s	1M	$0.30	$2.50
51	42	Qwen3 Max Instruct Preview	1103	±13	2.2K	2.0%	1.1%	31 tps	1.7s	256K	$1.43	$6.61
52	68	Grok 4	1102	±7	7.8K	3.3%	3.9%	29 tps	11.1s	256K	$3.00	$15.00
53	19	Mistral Medium 3.1	1101	±10	1.9K	3.5%	<0.1%	77 tps	0.7s	128K	$0.40	$2.00
54	21	Claude Opus 4	1101	±8	2.3K	3.2%	<0.1%	25 tps	1.5s	200K	$15.00	$75.00
55	37	Kimi K2.5 Instant	1093	±12	1.4K	2.7%	2.9%	32 tps	3.0s	262K	$0.50	$3.00
56	33	Kimi K2.5	1090	±13	4.3K	2.1%	6.5%	33 tps	1.7s	262K	$0.34	$2.57
57	16	Nova Experimental Chat 11-10	1089	±23	750	2.6%	0.4%	84 tps	8.9s	98K	$0	$0
58	95	Gemini 2.5 Flash Lite Thinking Preview 0925	1086	±8	3.4K	2.7%	1.5%	152 tps	3.0s	1M	$0.10	$0.40
59	48	OpenAI o1-mini	1086	±8	2.2K	2.2%	<0.1%	118 tps	N/A	128K	$1.13	$4.51
60	71	DeepSeek V3.1	1085	±14	690	3.5%	0.8%	197 tps	0.4s	164K	$0.55	$1.60
61	77	Claude Opus 4.1	1084	±6	2.4K	4.3%	3.0%	17 tps	3.7s	200K	$15.00	$75.00
62	33	Qwen3 30B A3B Instruct 2507	1084	±8	2.3K	3.2%	1.2%	55 tps	1.3s	131K	$0.13	$0.72
63	33	Qwen3 Next 80B A3B Instruct	1083	±16	1.5K	2.6%	0.6%	84 tps	1.1s	256K	$0.20	$1.42
64	84	Claude Sonnet 3.7 (Thinking)	1078	±8	3.8K	4.7%	<0.1%	41 tps	2.6s	200K	$3.00	$15.00
65	48	gpt-oss-120b	1074	±6	3K	2.6%	0.7%	213 tps	0.5s	131K	$0.11	$0.50
66	44	Kimi K2 Thinking Turbo	1072	±17	1.3K	2.2%	2.0%	75 tps	1.4s	262K	$1.15	$8.00
67	65	DeepSeek V3.2 Exp Chat	1072	±12	755	2.6%	2.6%	29 tps	1.5s	131K	$0.27	$0.39
68	68	GLM 4.7	1071	±12	1.9K	2.1%	5.8%	40 tps	1.5s	200K	$0.77	$1.73
69	113	Gemini 2.5 Flash Lite Thinking	1071	±10	2.3K	3.2%	1.0%	118 tps	4.4s	1M	$0.03	$0.13
70	56	DeepSeek V3.1 Turbo	1070	±12	1.3K	2.6%	0.9%	173 tps	1.3s	164K	$2.00	$3.75
71	48	Step 3.5 Flash	1067	±20	630	2.3%	2.2%	109 tps	0.6s	256K	$0.05	$0.15
72	71	Qwen3.5 397B A17B	1067	±15	1.3K	2.2%	4.3%	57 tps	1.4s	256K	$0.52	$3.00
73	52	Qwen3.5 122B A17B	1063	±14	980	1.5%	1.5%	82 tps	1.4s	256K	$0.40	$3.20
74	71	Gemini 3.1 Flash Lite Preview	1060	±22	1.2K	3.3%	1.0%	8 tps	1.2s	1M	$0.25	$1.50
75	26	Grok 4.1 Fast Non-Reasoning	1058	±19	2K	4.1%	0.9%	101 tps	0.5s	2M	$0.20	$0.50
76	44	DeepSeek V3.1 Terminus Chat	1056	±13	955	2.1%	3.4%	27 tps	1.5s	131K	$0.86	$1.80
77	81	Qwen3.5 27B	1056	±17	665	2.9%	3.7%	55 tps	2.6s	256K	$0.30	$2.40
78	40	DeepSeek V3.2	1056	±15	1.4K	1.4%	1.4%	83 tps	5.1s	131K	$0.43	$1.09
79	106	Claude Sonnet 3.5 v2	1055	±22	770	3.8%	<0.1%	46 tps	1.4s	200K	$3.00	$15.00
80	100	Gemini 2.5 Flash Preview	1050	±18	565	2.6%	<0.1%	138 tps	6.9s	1M	$0.15	$0.60

2of5

View All (188 models)