En este artículo

Tres imágenes de 1024×1024, generadas en 6 segundos cada una después del arranque en frío. Decode verificado, anti-blank en verde, alta varianza de píxel. Todas las métricas decían “éxito”. Las tres imágenes eran ruido estático.
Los dos planos del “funcionó”
En generación local de imagen y video, “el pipeline funcionó” puede significar dos cosas distintas, y confundirlas es cómo terminas publicando ruido:
- Plano técnico: el pipeline ejecutó completo. El archivo se generó, decodifica sin errores, no está en blanco, los hashes corresponden. Esto lo verifica una máquina.
- Plano visual: el resultado sirve. Es estéticamente coherente y —si había algo que preservar (una identidad, una cara, una prenda)— lo preservó. Esto lo verifica un ojo.
Un technical PASS sin visual PASS no es un éxito a medias. Es un fallo que aún no se ha enterado de que es fallo.
El caso del modelo que técnicamente pasaba
Probamos un modelo nuevo de 4B parámetros, recién llegado y con buena pinta en las discusiones de la comunidad. El canary fue impecable en lo técnico: arranque en frío de 144 segundos, posteriores de 6 segundos, tres PNGs generados, decode completo PASS, chequeo anti-blank PASS. La varianza de píxel era alta — señal clásica de que hay “contenido” y no una imagen plana.
La inspección visual: tres imágenes de ruido estático. Alta varianza de píxel, sí — porque el ruido tiene mucha varianza. El veredicto que acuñamos ese día: TECHNICAL_PASS_VISUAL_FAIL_NO_PROMOTION. El modelo quedó como experimental opt-in; nunca fue promovido a uso regular.
Cuando lo que falla es la preservación
El mismo día, otro caso con firma distinta: un editor de identidad —la clase de herramienta que recibe una foto y cambia un detalle preservando todo lo demás. Runtime impecable. Pero la preservación de identidad falló dos veces seguidas, incluyendo un intento de reparación con parámetros acotados que no arregló nada. Resultado: TECHNICAL_PASS_VISUAL_FAIL_NO_MORE_RETRIES, y la herramienta se ocultó de la interfaz.
Y el contraejemplo que demuestra que el gate es separable, no pesimista: un edit localizado en la misma batería —recolor de una prenda específica— preservó identidad, pose, manos, estructura de la prenda, objetos, fondo, encuadre e iluminación. Technical PASS y visual PASS, primera pasada. La diferencia entre los tres casos no estaba en el pipeline: estaba en el modelo. Por eso el gate se aplica a todos por igual.
Por qué la métrica automática no ve lo que tú ves
Esto no es una rarencia de nuestro setup — es un problema abierto de toda la generación visual. La investigación académica lo cuantifica (y está publicada, no es intuición):
VideoScore, uno de los mejores evaluadores automáticos de video generado, alcanza una correlación con jueces humanos de 77.1 (Spearman) — superando a las métricas previas por ~50 puntos. Aun así, falla en roughly 1 de cada 4 juicios. (arXiv:2406.15252)
Los frameworks centrados en humanos, como HuM-Eval, llegan a 58.2% de correlación humana en video con personas. Las métricas globales de escena ignoran el detalle humano. (arXiv:2604.25361)
Dicho de otro modo: el mejor métrico automático disponible equivale a un revisor que se equivoca una de cada cuatro veces. ¿Le darías a ese revisor la firma final de lo que publica tu marca?
El doble gate en tu homelab
La implementación es deliberadamente simple — eso la hace sostenible:
| Gate | Qué verifica | Quién | Fallo típico que atrapa |
|---|---|---|---|
| Técnico | Decode, blanks, hashes, dimensiones, varianza | Scripts automáticos | Archivos corruptos, imágenes vacías |
| Visual | Estética, coherencia, preservación | Ojo humano (playback real) | Ruido con alta varianza, identidad rota |
Tres reglas de oro que salieron de esta campaña:
- Ninguna promo técnica sustituye playback humano antes de publicar. Ni “se ve bien en el thumbnail”.
- Los tests negativos también se automatizan: verificamos que 8 casos que DEBÍAN fallar, fallaran (fail-closed). Un pipeline que no puede fallar correctamente no puede ser confiable.
- El veredicto es doble y explícito: 35 de 35 lanes de nuestro sistema terminaron clasificadas con ambos veredictos. La taxonomía (PASS / PASS_WITH_NOTES / VISUAL_FAIL / NO_PROMOTION) es el lenguaje común.
Cómo se automatiza el gate técnico
El gate técnico no necesita un modelo de visión: necesita verificaciones que una máquina hace mejor que un humano. Las cinco que usamos en cada generación:
| Check | Qué detecta | Umbral típico |
|---|---|---|
| Decode completo | Archivo truncado o corrupto | Frames decodificados = frames esperados |
| Anti-blank | Imagen vacía o de un solo color | Desviación estándar de píxel > umbral mínimo |
| Dimensiones y aspecto | Stretch o crop indebido | Ratio exacto tras normalizar |
| Hash del asset | Regeneraciones no controladas | SHA-256 registrado por corrida |
| Custodia de VRAM | Lanes dejando memoria ocupada | Piso de VRAM libre tras teardown |
La comprobación que casi nadie implementa es la última: que los casos que DEBEN fallar fallan. Si tu pipeline no puede rechazar correctamente una imagen en blanco, el “todo verde” de tus métricas no significa nada. En nuestra campaña, 8 casos negativos pasaron en fail-closed: rechazaron lo que debían rechazar.
Cuándo un modelo de visión local sí ayuda
Tener un modelo de visión local en el mismo homelab es útil — pero como pre-filtro, no como juez. Las tareas donde funciona bien:
- Detección de duplicados: comparar una tanda de candidatos contra lo ya publicado.
- Clasificación temática: “¿esta imagen corresponde a este post?” en lotes grandes.
- Detección de texto corrupto: buscar pseudo-letras, que son el fallo más vergonzoso.
Lo que no puede hacer: firmar el veredicto final. Los números de la investigación (correlación humana de 58-77% en los mejores evaluadores automáticos) son la razón técnica. La razón editorial es más simple: si algo sale mal, la firma es tuya, no del modelo. Puedes ver el flujo completo aplicado a generación de imagen y video en nuestro workflow de imagen a video.
Para seguir el hilo
Preguntas frecuentes
¿No basta con mirar la imagen yo mismo? Mirar es el gate visual. El punto es hacerlo sistemáticamente — cada lane, cada modelo nuevo, cada promoción — y registrar el veredicto para que “lo pasé por alto” no sea una opción.
¿Un modelo de visión local no puede automatizar el gate visual? Puede pre-filtrar (y lo hacemos), pero los números de arriba son la razón por la que no firma: 58-77% de correlación no es una firma.
¿Esto aplica a texto/código? El principio sí (los tests no prueban legibilidad), pero los fallos visuales tienen la particularidad de que las métricas técnicas no los ven en absoluto.
El corolario práctico: ninguna automatización te exime de mirar. Te ahorra el trabajo repetitivo —decodificar, comparar, hashear— para que tu atención esté disponible donde el juicio humano sigue siendo insustituible: decidir si lo que quedó en pantalla merece llevar tu nombre.
Si te llevas una sola idea de esta pieza, que sea esta: los planes de calidad más útiles son los que se pueden ejecutar sin convicción. Un checklist que exige mirar cada salida no depende de que tengas un buen día — y los proyectos serios no se construyen sobre buenos días.
El conocimiento verdadero trasciende a lo público 🌀
Continúa explorando Inteligencia Artificial con piezas relacionadas y evidencia adicional.
Ver relacionados



