
El benchmark que más confunde no es el que tiene pocos datos: es el que junta fases distintas en una cifra bonita y deja al lector creyendo que entendió el rendimiento real.
Por qué el número único falla
Decir “este modelo hace tantos tokens por segundo” puede servir para una conversación rápida, pero no alcanza para decidir una lane de trabajo. Un modelo puede cargar lento, leer contexto rápido, razonar mucho, escribir con buen ritmo y aun así fallar en una tarea verificable. Cuando todo eso se resume en un único número, la comparación se vuelve cómoda pero frágil.
En IA local ese error pesa más, porque el hardware, el runtime, el tamaño de contexto, la cuantización y las flags cambian la experiencia completa. Si el benchmark no dice qué fase mide, en realidad está comparando sensaciones.
Las cuatro fases que sí importan
Load es la entrada en operación. Prefill mide qué tan rápido el modelo procesa entrada y contexto. Thinking o razonamiento muestra cuánto trabajo interno necesita antes de responder. Decode es el ritmo de salida final. Cada fase responde una pregunta distinta.
| Fase | Pregunta correcta | Error común |
|---|---|---|
| Load | ¿Cuánto tarda en estar listo? | Tratarlo como velocidad de escritura. |
| Prefill | ¿Qué tan bien ingiere contexto? | Mezclarlo con salida final. |
| Thinking | ¿Cuánto razona antes de responder? | Contarlo como lentitud sin mirar calidad. |
| Decode | ¿A qué ritmo escribe la respuesta útil? | Usarlo como ranking universal. |
Cómo lo leemos en MiniV
En MiniV la lectura pública separa las fases para que el dato tenga uso. No nos interesa publicar un ranking que suene impresionante si después nadie puede explicar por qué un modelo conviene para tool calls, debugging, contexto pesado o generación editorial.
La metodología funciona como una brújula: primero decide la tarea, luego mira la métrica que corresponde, y solo al final compara velocidad. Así se evita escoger un modelo rápido que falla justo en el paso que el usuario necesita.
Tres pasos para leer un benchmark con criterio
- Define la tarea. No todas las tareas castigan igual load, contexto, razonamiento y salida.
- Separa las fases. Registra prefill y decode por separado antes de comparar.
- Elige con evidencia. Usa la métrica que explica el trabajo que realmente vas a hacer.
La utilidad de esta secuencia está en la decisión: primero identifica la tarea, luego separa sus fases y solo entonces compara modelos. Así una cifra deja de ser un eslogan y se convierte en una herramienta para elegir.
Checklist para no caer en el error
- Pregunta qué fase se midió antes de comparar.
- Busca score o salida verificable, no solo velocidad.
- Evita mezclar runs de entornos distintos.
- Lee contexto máximo, cuantización y flags junto al resultado.
- Si el artículo tiene tabla, debe ser responsive y legible en móvil.
Conclusión
Un benchmark honesto no mata la emoción por la IA local; la vuelve útil. Separar load, prefill, thinking y decode permite hablar de modelos sin humo, con menos ranking vacío y más decisiones operables.
Preguntas frecuentes
¿Decode es la métrica más importante?
Solo cuando la tarea depende del ritmo de salida final. Para contexto largo, prefill y estabilidad pueden importar más.
¿Puedo comparar resultados de máquinas distintas?
Sí, pero solo si lo marcas como comparación contextual. Para decidir una lane, lo justo es comparar dentro del mismo entorno.
¿Por qué no usar un promedio global?
Porque un promedio puede ocultar el cuello de botella real. Separar fases permite saber dónde mejorar.
Un ejemplo real: el mismo equipo, cuatro lecturas
En nuestro gallery público no hay un campeón absoluto: hay tareas distintas. En pruebas reproducibles, architect-35b-q6 alcanzó 76.3 tok/s de decode en contexto corto/medio; en deep context la lectura relevante fue 360.2 tok/s de prefill, 49.4 tok/s de decode y 91.9% de aceptación MTP. Esa diferencia es justamente la razón para no resumir todo en un solo número.
| Escenario | Métrica útil | Resultado observado |
|---|---|---|
| Conversación corta | Decode | 76.3 tok/s |
| Contexto profundo | Prefill | 360.2 tok/s |
| Contexto profundo | Decode | 49.4 tok/s |
| Predicción múltiple | Aceptación MTP | 91.9% |
Puedes contrastar los artefactos y resultados en el benchmark gallery público. Para el contexto de uso real, enlaza este artículo con nuestro workflow local completo y con los mitos que conviene descartar antes de comparar modelos.
El conocimiento verdadero trasciende a lo público 🌀
¿Quieres seguir la línea de investigación? Continúa con artículos relacionados y guarda esta lectura para volver después.
Ver relacionados


