La misma comparación a ciegas que con las imágenes, pero para vídeo. Aquí hay diez veces menos modelos que en las selecciones de texto, y los primeros puestos se separan del resto con más claridad, simplemente porque los participantes son pocos.
| # | Modelo | Desarrollador | Arena Score, vídeo | Acceso$ / 1M | Salida$ / 1M | Contextotokens |
|---|---|---|---|---|---|---|
| 1 | Sora 2 Pro | OpenAI | 1.365,62 1.358–1.374 | — | — | — |
| 2 | Sora 2 | OpenAI | 1.337,11 1.330–1.344 | — | — | — |
| 3 | Seedance v1.5 Pro | ByteDance (Doubao) | 1.256,99 1.250–1.264 | — | — | — |
| 4 | Veo 3 ≈ | Google DeepMind | 1.252,4 1.241–1.263 | — | — | 0K |
| 5 | Veo 3 Fast ≈ | Google DeepMind | 1.247,67 1.236–1.259 | — | — | 0K |
| 6 | Veo 2 | Google DeepMind | 1.162,57 1.146–1.179 | — | — | 0K |
| 7 | Ray2 | Luma AI | 1.063,9 1.047–1.081 | — | — | 5K |
La tabla se desplaza en horizontal: no caben todas las columnas.
El precio es el más bajo entre los proveedores del modelo, tarifa base, sin tarifas por lotes ni reducidas. La entrada y la salida se muestran por separado a propósito: en la mayoría de los modelos la salida cuesta varias veces más que la entrada, y la factura final depende de qué predomine en la tarea.
El signo ≈ marca los modelos cuyo intervalo de confianza se solapa con el de la fila de arriba. Aquí hay 2 modelos — su orden entre sí no está determinado por los datos disponibles.
El intervalo de confianza de la mitad de los modelos es de 22,1 puntos, y eso es más estrecho que la distancia a la fila vecina: el orden aquí lo marcan los datos, no quién votó esta vez. Votos por modelo aquí — mediana 15.230: cuantos menos hay, más ancho es el intervalo.
Arena (LMArena)
— licencia CC-BY-4.0 · fuente original
По данным Arena (LMArena)