La misma puntuación global que la clasificación general, pero solo entre modelos de pesos abiertos: los que se pueden descargar y ejecutar en hardware propio. La selección muestra cuánto se rezagan los modelos abiertos respecto a los cerrados, y en qué tareas no se rezagan en absoluto.
| # | Modelo | Desarrollador | Puntuación global | Acceso$ / 1M | Salida$ / 1M | Contextotokens | código25 % | conocimientos20 % | razonamiento20 % | idioma20 % | matemáticas15 % |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Kimi K3 | Moonshot AI (Kimi) | 99,5 95–100 | $2 | $8 | 1.049K | 100 | 98,5 | 99,9 | — | — |
| 2 | MiMo V2.5 Pro ≈ | Xiaomi | 99,36 97–100 | $0,44 | $0,87 | 1.050K | 99,7 | 100 | 100 | 97,3 | 99,8 |
| 3 | GLM 5.1 ≈ | Zhipu AI / Z.ai | 97,55 95–99 | $0,06 | $0,22 | 205K | 98,6 | 96,2 | 97,9 | 95,5 | 100 |
| 4 | Kimi K2.6 ≈ | Moonshot AI (Kimi) | 97,37 95–99 | $0,22 | $1,14 | 262K | 97,2 | 97,4 | 96,6 | 97,2 | 99 |
| 5 | GLM 5.2 ≈ | Zhipu AI / Z.ai | 96,66 93–98 | $0,42 | $1,32 | 1.049K | 95,1 | 93,5 | 97,2 | 100 | 98,2 |
| 6 | Inkling ≈ | Thinking Machines Lab | 95,03 90–97 | $1,87 | $4,68 | 1.049K | 93 | 93,3 | 92,7 | 98,1 | 99,9 |
| 7 | MiMo V2 Pro ≈ | Xiaomi | 94,48 92–97 | $0,44 | $0,87 | 1.049K | 94,9 | 95,2 | 94,1 | 95 | 92,6 |
| 8 | DeepSeek V4 Pro ≈ | DeepSeek | 93,38 91–96 | $0,44 | $0,87 | 1.049K | 93,7 | 92,6 | 94,7 | 94,1 | 91,3 |
| 9 | Qwen3.5 397B-A17B ≈ | Alibaba (Qwen) | 92,9 91–95 | $0,6 | $3,6 | 262K | 92,6 | 93 | 92,2 | 93,9 | 92,8 |
| 10 | Gemma 4 31B ≈ | Google DeepMind | 92,56 87–96 | $0,14 | $0,4 | 262K | 90,3 | 90,1 | 91,4 | 95,8 | 96,9 |
| 11 | Hy3 ≈ | Tencent (Hunyuan) | 92,39 88–97 | $0,13 | $0,53 | 262K | 93 | 91,9 | 92,1 | — | — |
| 12 | GLM 5V Turbo ≈ | Zhipu AI / Z.ai | 92,33 88–96 | $0,7 | $3,1 | 203K | 93 | 89,7 | 91 | 94 | 94,2 |
| 13 | MiniMax M3 ≈ | MiniMax | 92,08 89–95 | $0,3 | $1,2 | 1.049K | 94,1 | 93,4 | 92,1 | 88,9 | 91,2 |
| 14 | GLM 5 ≈ | Zhipu AI / Z.ai | 91,78 89–94 | $0,48 | $1,9 | 205K | 91,5 | 91,1 | 92,7 | 93,2 | 90,2 |
| 15 | Qwen3.6 Plus ≈ | Alibaba (Qwen) | 91,76 90–94 | $0,5 | $3 | 1.000K | 92,6 | 91,2 | 92 | 89,9 | 93,3 |
| 16 | MiMo V2.5 ≈ | Xiaomi | 90,86 89–93 | $0,14 | $0,28 | 1.050K | 93,4 | 92 | 92,3 | 85,2 | 90,6 |
| 17 | Gemma 4 26B-A4B ≈ | Google DeepMind | 90,55 86–94 | $0,05 | $0,29 | 262K | 87,9 | 89,4 | 90,1 | — | 97 |
| 18 | MiMo V2 Omni ≈ | Xiaomi | 90,46 87–94 | $0,14 | $0,28 | 262K | 92,5 | 88,8 | 90,9 | 90,4 | 88,7 |
| 19 | DeepSeek V4 Flash ≈ | DeepSeek | 89,95 88–92 | $0,14 | $0,28 | 1.049K | 90,5 | 88,6 | 91 | 91,2 | 87,7 |
| 20 | GLM 4.6 ≈ | Zhipu AI / Z.ai | 89,12 87–92 | $0,29 | $1,14 | 205K | 89,1 | 86,7 | 90,2 | 90,7 | 88,9 |
| 21 | Qwen3 235B A22B Instruct 2507 ≈ | Alibaba (Qwen) | 88,37 87–90 | $0,1 | $0,1 | 262K | 88,1 | 88,7 | 88,8 | 87,9 | 88,6 |
| 22 | DeepSeek V3.2 ≈ | DeepSeek | 88,28 86–90 | $0,28 | $0,4 | 164K | 88,9 | 86,9 | 88,7 | 87,3 | 89,7 |
| 23 | Qwen3 Next 80B A3B Instruct ≈ | Alibaba (Qwen) | 88,2 85–91 | $0,15 | $1,2 | 262K | 87,3 | 82,1 | 87,6 | 93,8 | 91,2 |
| 24 | GLM 4.5 ≈ | Zhipu AI / Z.ai | 88 85–91 | $0,2 | $0,8 | 131K | 85,6 | 85,5 | 87,7 | 94,1 | 87,5 |
| 25 | Mistral Medium 3.5 ≈ | Mistral AI | 87,95 84–92 | $1,5 | $7,5 | 262K | 91,4 | 86,8 | 89,4 | 82,4 | 89,1 |
| 26 | GLM 4.7 ≈ | Zhipu AI / Z.ai | 87,81 84–92 | $0,15 | $0,8 | 205K | 90,5 | 84 | 91 | 86 | 86,6 |
| 27 | Kimi K2 Thinking Turbo ≈ | Moonshot AI (Kimi) | 87,43 86–89 | $1,15 | $8 | 262K | 89,9 | 87,5 | 87,4 | 83,9 | 88 |
| 28 | Qwen3 VL 235B A22B Instruct ≈ | Alibaba (Qwen) | 87,12 83–91 | $0,4 | $1,6 | 262K | 87,1 | 89,1 | 88 | 84,2 | 87,2 |
| 29 | MiniMax M2.7 ≈ | MiniMax | 86,84 85–89 | $0,3 | $1,2 | 205K | 89,5 | 87,4 | 86,3 | 84,3 | 85,9 |
| 30 | Qwen3.5 122B-A10B ≈ | Alibaba (Qwen) | 86,59 84–89 | $0,4 | $3,2 | 262K | 86,2 | 86,7 | 86,1 | 86,5 | 87,9 |
| 31 | DeepSeek V3.2 Exp ≈ | DeepSeek | 86,47 82–91 | $0,22 | $0,33 | 164K | 85,6 | 80,3 | 88 | 92 | 86,8 |
| 32 | MiMo V2 Flash ≈ | Xiaomi | 85,27 83–87 | $0,14 | $0,28 | 262K | 87,3 | 85,3 | 85,8 | 86,2 | 80 |
| 33 | Qwen3.5 27B ≈ | Alibaba (Qwen) | 85,17 83–88 | $0,3 | $2,4 | 262K | 83,7 | 85 | 84,4 | 85 | 89 |
| 34 | Step 3.5 Flash ≈ | StepFun | 85,04 83–87 | $0,1 | $0,3 | 262K | 86,3 | 84,6 | 83,9 | 86,8 | 82,7 |
| 35 | Qwen3 235B A22B Thinking-2507 ≈ | Alibaba (Qwen) | 84,6 79–90 | $0,1 | $0,1 | 262K | 83,5 | 91 | 84,8 | 79,8 | 84,2 |
| 36 | DeepSeek V3.1 ≈ | DeepSeek | 83,38 79–87 | $0,2 | $0,7 | 164K | 81,5 | 80,7 | 84,7 | 84,9 | 86,2 |
| 37 | DeepSeek R1 0528 ≈ | DeepSeek | 82,93 79–87 | $0,25 | $0,25 | 164K | 84,2 | 79,6 | 84,9 | 83,5 | 81,9 |
| 38 | Qwen3 VL 235B A22B Thinking ≈ | Alibaba (Qwen) | 82,89 78–88 | $0,4 | $4 | 262K | 84,4 | 84 | 83,1 | 78,4 | 84,6 |
| 39 | Qwen3.5 35B A3B ≈ | Alibaba (Qwen) | 81,03 78–84 | $0,25 | $2 | 262K | 80,3 | 81,5 | 81,5 | 80 | 82,3 |
| 40 | DeepSeek V3.1 Terminus ≈ | DeepSeek | 80,98 76–86 | $0,21 | $0,79 | 164K | 79,8 | — | 82,7 | — | 80,7 |
| 41 | Qwen3 30B A3B Instruct 2507 ≈ | Alibaba (Qwen) | 80,41 77–84 | $0,05 | $0,19 | 262K | 82,1 | 78,4 | 80,9 | 80,3 | 79,8 |
| 42 | Nemotron 3 Super ≈ | NVIDIA | 80,36 76–85 | $0,2 | $0,8 | 1.000K | 79,6 | 79,6 | 78,8 | 86,2 | 76,9 |
| 43 | NVIDIA Nemotron 3 Super 120B A12B ≈ | NVIDIA | 78,9 75–83 | $0,15 | $0,65 | 262K | 79,6 | 79,6 | 78,8 | — | 76,9 |
| 44 | Kimi K2 0905 Preview ≈ | Moonshot AI (Kimi) | 77,36 73–82 | $0,6 | $2,5 | 262K | 78,3 | 73,7 | 77,6 | 77,4 | 80,4 |
| 45 | GLM 4.5 Air ≈ | Zhipu AI / Z.ai | 76,7 74–80 | $0,11 | $0,29 | 131K | 77,5 | 74,2 | 76,6 | 75,4 | 80,5 |
| 46 | GPT OSS 120B ≈ | OpenAI | 75 72–78 | $0,03 | $0,14 | 131K | 74,1 | 72 | 73,5 | 78,3 | 78,2 |
| 47 | Qwen3 Next 80B A3B Thinking ≈ | Alibaba (Qwen) | 74,87 71–79 | $0,15 | $1,2 | 262K | 76,5 | 74,1 | 74,9 | 69,7 | 79,9 |
| 48 | Qwen 3 235b A22B ≈ | Alibaba (Qwen) | 74,08 71–77 | $0,7 | $2,8 | 131K | 75,2 | 70,1 | 73,1 | 73,2 | 79,9 |
| 49 | Qwen3 Coder 480B A35B ≈ | Alibaba (Qwen) | 73,92 71–77 | $1,5 | $7,5 | 262K | 81 | 68 | 75,3 | 70,4 | 72,8 |
| 50 | MiniMax M2.5 ≈ | MiniMax | 73,77 71–76 | $0,3 | $1,2 | 1.000K | 73,6 | 75,1 | 74,7 | 69,6 | 76,5 |
| 51 | Nemotron 3 Nano 30B A3B ≈ | NVIDIA | 73,49 70–77 | $0,05 | $0,2 | 262K | 74 | 73,9 | 70,5 | 74,7 | 74,5 |
| 52 | DeepSeek Reasoner ≈ | DeepSeek | 73,35 69–78 | $0,55 | $2,19 | 164K | 72,2 | 68 | 72,9 | 76,2 | 79,2 |
| 53 | GLM 4.7 Flash ≈ | Zhipu AI / Z.ai | 72,7 69–77 | $0,04 | $0,3 | 203K | 74,6 | 72,7 | 72,3 | 72,1 | 70,8 |
| 54 | DeepSeek Chat 0324 ≈ | DeepSeek | 71,81 69–74 | $0,2 | $0,6 | 164K | 71,5 | 70,8 | 73,9 | 68,9 | 74,7 |
| 55 | Qwen3 32B ≈ | Alibaba (Qwen) | 71,71 66–77 | $0,7 | $2,8 | 131K | 69,2 | 72,8 | 67,1 | — | 80,6 |
| 56 | Kimi K2 0711 ≈ | Moonshot AI (Kimi) | 70,85 68–74 | $0,6 | $2,5 | 131K | 73,5 | 69,7 | 73,7 | 64,2 | 73,1 |
| 57 | Trinity Large Preview ≈ | Arcee AI | 70,57 68–73 | — | — | 131K | 74,1 | 70,7 | 70,6 | 69,9 | 65,5 |
| 58 | INTELLECT 3 ≈ | Prime Intellect | 70,49 66–75 | $0,2 | $1,1 | 128K | 71,5 | 64,6 | 70,4 | — | 76,8 |
| 59 | Trinity Large Thinking ≈ | Arcee AI | 69,76 67–72 | $0,22 | $0,85 | 262K | 69,4 | 72,5 | 68,7 | 66,1 | 73 |
| 60 | Llama 3.3 Nemotron Super 49B v1.5 ≈ | Meta AI | 69,28 63–75 | $0,05 | $0,25 | 131K | 68,9 | 64,7 | 66,6 | — | 79,6 |
| 61 | MiniMax M2 ≈ | MiniMax | 68,57 63–75 | $0,3 | $1,2 | 205K | 72,6 | 65,1 | 72,4 | 62,7 | 69,2 |
| 62 | GLM 4.5V ≈ | Zhipu AI / Z.ai | 68,33 62–75 | $0,29 | $0,86 | 128K | 67,3 | 71,7 | 67,6 | 66,3 | 69,2 |
| 63 | MiniMax M1 ≈ | MiniMax | 68,1 65–71 | $0,13 | $1,25 | 1.000K | 69,4 | 63,8 | 68,2 | 67,9 | 71,8 |
| 64 | Mistral Small 3.2 ≈ | Mistral AI | 67 63–71 | $0,1 | $0,3 | 128K | 70,2 | 60 | 67,4 | 69,7 | 66,9 |
| 65 | Qwen: QwQ 32B ≈ | Alibaba (Qwen) | 66,6 63–70 | $0,18 | $0,2 | 131K | 64,1 | 65,6 | 65,3 | 68,5 | 71,2 |
| 66 | Qwen3 30B A3B ≈ | Alibaba (Qwen) | 64,52 61–68 | $0,09 | $0,2 | 131K | 64,9 | 63,6 | 62,8 | 62,5 | 70,1 |
| 67 | Gemma 3 27B ≈ | Google DeepMind | 63,88 61–66 | $0,03 | $0,11 | 131K | 61,5 | 61,4 | 68,2 | 68,2 | 59,6 |
| 68 | Llama 3.1 Nemotron Ultra 253B ≈ | Meta AI | 63,51 57–70 | $0,6 | $1,8 | 128K | 59,3 | — | 63 | — | 71,3 |
| 69 | DeepSeek V3 ≈ | DeepSeek | 63,27 59–68 | $0,27 | $1,1 | 164K | 62,1 | 61,9 | 62,2 | 70 | 59,5 |
| 70 | Command A ≈ | Cohere | 62,59 60–65 | $2,5 | $10 | 256K | 63,3 | 59,4 | 65,3 | 66,6 | 56,7 |
| 71 | Granite 4.1 8B ≈ | IBM | 60,2 55–66 | $0,05 | $0,1 | 131K | 59 | 63,1 | 58,4 | — | 60,8 |
| 72 | Olmo 3 32B Think ≈ | Allen Institute for AI | 60,01 55–65 | $0,15 | $0,5 | 66K | 60,9 | 58,3 | 60 | — | 60,7 |
| 73 | Gemma 3 12B IT ≈ | Google DeepMind | 55,53 50–61 | $0,05 | $0,1 | 131K | 52,6 | 50,8 | 61,6 | — | 58,6 |
| 74 | Llama 4 Maverick 17b 128e Instruct ≈ | Meta AI | 55,43 53–58 | $0,05 | $0,1 | 1.049K | 57,2 | 53,2 | 55,5 | 54,3 | 56,9 |
| 75 | GPT OSS 20B ≈ | OpenAI | 55,31 50–60 | $0,01 | $0,07 | 131K | 58,4 | 53,3 | 53,9 | 50,4 | 61,2 |
| 76 | Gemma 3n E4b It ≈ | Google DeepMind | 51,96 48–56 | $0,02 | $0,04 | 33K | 49,9 | 50,4 | 56,1 | 57,2 | 45 |
| 77 | Qwen2.5 72B Instruct ≈ | Alibaba (Qwen) | 51,76 49–55 | $1,4 | $5,6 | 131K | 55 | 50,3 | 53,1 | 47,1 | 52,7 |
| 78 | Llama 4 Scout 17B 16E Instruct ≈ | Meta AI | 51,73 49–55 | $0,05 | $0,1 | 10.000K | 53,6 | 49 | 52,4 | 50 | 53,6 |
| 79 | Llama 3.1 Nemotron 70B Instruct ≈ | Meta AI | 50,63 47–54 | $0,6 | $0,6 | 128K | 50,5 | 49,7 | 52,2 | — | 49,9 |
| 80 | Llama 3.1 405B Instruct ≈ | Meta AI | 50,08 47–53 | $0,12 | $0,3 | 128K | 53,1 | 47,1 | 51,6 | 46,6 | 51,7 |
| 81 | Llama 3.3 70B Instruct ≈ | Meta AI | 49,15 47–52 | $0,05 | $0,23 | 131K | 49,8 | 46,4 | 50,3 | 50 | 49,1 |
| 82 | Mistral Large ≈ | Mistral AI | 48,55 45–52 | $2 | $6 | 131K | 51,3 | 43,1 | 50,1 | 49,8 | 47,5 |
| 83 | Mistral Large 2407 ≈ | Mistral AI | 48,12 45–51 | $3 | $9 | 131K | 51,6 | 47,8 | 50 | 42,6 | 47,6 |
| 84 | Qwen2.5 Coder 32b Instruct ≈ | Alibaba (Qwen) | 48,1 44–53 | $0,06 | $0,2 | 128K | 51,4 | 45,5 | 48,9 | — | 45 |
| 85 | Llama 3.1 70B ≈ | Meta AI | 46,07 44–49 | $0,12 | $0,3 | 131K | 47,9 | 43,2 | 46,7 | 46,6 | 45,3 |
| 86 | Gemma 3 4B IT ≈ | Google DeepMind | 44,68 39–50 | $0,04 | $0,08 | 131K | 41,5 | 46 | 49,1 | — | 42,2 |
| 87 | Mistral: Mistral Small 3 ≈ | Mistral AI | 43,69 41–47 | $0,05 | $0,08 | 33K | 44,9 | 41,9 | 44,9 | — | 42,5 |
| 88 | Phi 4 ≈ | Microsoft | 42,13 38–47 | $0,06 | $0,14 | 128K | 41,7 | 42,1 | 41,9 | 41,6 | 43,8 |
| 89 | Google: Gemma 2 27B ≈ | Google DeepMind | 37,48 35–40 | $0,65 | $0,65 | 8K | 37,3 | 36,1 | 37,3 | 40,6 | 35,7 |
| 90 | Llama 3 70B Instruct ≈ | Meta AI | 37,04 35–39 | $0,12 | $0,3 | 8K | 36,3 | 31,8 | 36,5 | 43,8 | 37,1 |
| 91 | Aya Expanse 32B ≈ | Cohere | 34,74 31–38 | — | — | 128K | 34,2 | 38,1 | 36,2 | 32,1 | 32,8 |
| 92 | Ministral 8B (latest) ≈ | Mistral AI | 34,53 30–39 | $0,1 | $0,1 | 128K | 35,3 | 35,8 | 35,7 | — | 30 |
| 93 | Command R+ ≈ | Cohere | 33,38 30–37 | $2,5 | $10 | 128K | 32,1 | 36,5 | 34,5 | — | 29,9 |
| 94 | Llama 3.1 8B ≈ | Meta AI | 30,51 28–33 | $0,02 | $0,03 | 131K | 33,8 | 30,8 | 32,1 | 26,5 | 27,8 |
| 95 | Aya Expanse 8B ≈ | Cohere | 28,06 25–31 | — | — | 8K | 26,3 | 32,4 | 28 | — | 25,1 |
| 96 | Command R ≈ | Cohere | 27,79 25–31 | $0,15 | $0,6 | 128K | 28,3 | 29,6 | 29,8 | — | 21,9 |
| 97 | Meta: Llama 3 8B Instruct ≈ | Meta AI | 24,32 22–27 | $0,03 | $0,04 | 8K | 24,4 | 24,9 | 23 | 27,4 | 21,1 |
| 98 | Phi-3-medium instruct (4k) ≈ | Microsoft | 19,74 16–23 | $0,17 | $0,68 | 4K | 19,7 | 23,9 | 21,6 | 8,8 | 26,4 |
| 99 | Gemma 2 2b It ≈ | Google DeepMind | 18,43 16–21 | — | — | 128K | 15,8 | 21,6 | 18,5 | 19,5 | 17 |
| 100 | Mixtral 8x7B ≈ | Mistral AI | 18,04 15–21 | $0,15 | $0,15 | 33K | 18,9 | 20 | 19 | 12,6 | 20,1 |
La tabla se desplaza en horizontal: no caben todas las columnas.
Las columnas de la derecha son los sumandos de la puntuación, llevados a una escala común de 0 a 100 según la dispersión real entre los modelos medidos. Sumados con los pesos indicados, dan la cifra de la columna principal: en ellos se ve en qué exactamente un modelo superó a otro. Un guion significa «no medido», no cero.
El precio es el más bajo entre los proveedores del modelo, tarifa base, sin tarifas por lotes ni reducidas. La entrada y la salida se muestran por separado a propósito: en la mayoría de los modelos la salida cuesta varias veces más que la entrada, y la factura final depende de qué predomine en la tarea.
El signo ≈ marca los modelos cuyo intervalo de confianza se solapa con el de la fila de arriba. Aquí hay 99 modelos — su orden entre sí no está determinado por los datos disponibles.
El intervalo de confianza de la mitad de los modelos supera 6,3 puntos — es decir, unas 8 filas adyacentes de la tabla. Dentro de ese grupo el orden no lo marcan los datos, sino quién votó esta vez; los datos sostienen la diferencia entre el principio y el final de la lista, pero no la vecindad de los puestos.