Pasar no es verse bien: QA visual en generación local de IA

Tres imágenes con todos los checks en verde y puro ruido dentro. Por qué "funcionó" tiene dos planos en generación local de imagen y video, y cómo mon

Publicado 6 Oct 2026·Actualizado 23 Sep 2026·7 min de lectura·Inteligencia Artificial
En este artículo

    Tres imágenes de 1024×1024, generadas en 6 segundos cada una después del arranque en frío. Decode verificado, anti-blank en verde, alta varianza de píxel. Todas las métricas decían “éxito”. Las tres imágenes eran ruido estático.

    Los dos planos del “funcionó”

    En generación local de imagen y video, “el pipeline funcionó” puede significar dos cosas distintas, y confundirlas es cómo terminas publicando ruido:

    • Plano técnico: el pipeline ejecutó completo. El archivo se generó, decodifica sin errores, no está en blanco, los hashes corresponden. Esto lo verifica una máquina.
    • Plano visual: el resultado sirve. Es estéticamente coherente y —si había algo que preservar (una identidad, una cara, una prenda)— lo preservó. Esto lo verifica un ojo.

    Un technical PASS sin visual PASS no es un éxito a medias. Es un fallo que aún no se ha enterado de que es fallo.

    El caso del modelo que técnicamente pasaba

    Probamos un modelo nuevo de 4B parámetros, recién llegado y con buena pinta en las discusiones de la comunidad. El canary fue impecable en lo técnico: arranque en frío de 144 segundos, posteriores de 6 segundos, tres PNGs generados, decode completo PASS, chequeo anti-blank PASS. La varianza de píxel era alta — señal clásica de que hay “contenido” y no una imagen plana.

    La inspección visual: tres imágenes de ruido estático. Alta varianza de píxel, sí — porque el ruido tiene mucha varianza. El veredicto que acuñamos ese día: TECHNICAL_PASS_VISUAL_FAIL_NO_PROMOTION. El modelo quedó como experimental opt-in; nunca fue promovido a uso regular.

    Concepto: ruido estático cristalizándose en mariposa de cristal

    Cuando lo que falla es la preservación

    El mismo día, otro caso con firma distinta: un editor de identidad —la clase de herramienta que recibe una foto y cambia un detalle preservando todo lo demás. Runtime impecable. Pero la preservación de identidad falló dos veces seguidas, incluyendo un intento de reparación con parámetros acotados que no arregló nada. Resultado: TECHNICAL_PASS_VISUAL_FAIL_NO_MORE_RETRIES, y la herramienta se ocultó de la interfaz.

    Y el contraejemplo que demuestra que el gate es separable, no pesimista: un edit localizado en la misma batería —recolor de una prenda específica— preservó identidad, pose, manos, estructura de la prenda, objetos, fondo, encuadre e iluminación. Technical PASS y visual PASS, primera pasada. La diferencia entre los tres casos no estaba en el pipeline: estaba en el modelo. Por eso el gate se aplica a todos por igual.

    Por qué la métrica automática no ve lo que tú ves

    Esto no es una rarencia de nuestro setup — es un problema abierto de toda la generación visual. La investigación académica lo cuantifica (y está publicada, no es intuición):

    VideoScore, uno de los mejores evaluadores automáticos de video generado, alcanza una correlación con jueces humanos de 77.1 (Spearman) — superando a las métricas previas por ~50 puntos. Aun así, falla en roughly 1 de cada 4 juicios. (arXiv:2406.15252)

    Los frameworks centrados en humanos, como HuM-Eval, llegan a 58.2% de correlación humana en video con personas. Las métricas globales de escena ignoran el detalle humano. (arXiv:2604.25361)

    Dicho de otro modo: el mejor métrico automático disponible equivale a un revisor que se equivoca una de cada cuatro veces. ¿Le darías a ese revisor la firma final de lo que publica tu marca?

    El doble gate en tu homelab

    La implementación es deliberadamente simple — eso la hace sostenible:

    GateQué verificaQuiénFallo típico que atrapa
    TécnicoDecode, blanks, hashes, dimensiones, varianzaScripts automáticosArchivos corruptos, imágenes vacías
    VisualEstética, coherencia, preservaciónOjo humano (playback real)Ruido con alta varianza, identidad rota

    Tres reglas de oro que salieron de esta campaña:

    1. Ninguna promo técnica sustituye playback humano antes de publicar. Ni “se ve bien en el thumbnail”.
    2. Los tests negativos también se automatizan: verificamos que 8 casos que DEBÍAN fallar, fallaran (fail-closed). Un pipeline que no puede fallar correctamente no puede ser confiable.
    3. El veredicto es doble y explícito: 35 de 35 lanes de nuestro sistema terminaron clasificadas con ambos veredictos. La taxonomía (PASS / PASS_WITH_NOTES / VISUAL_FAIL / NO_PROMOTION) es el lenguaje común.
    Resultado real de una campaña de 35 lanes bajo el doble gate técnico/visual.
    Resultado real de una campaña de 35 lanes bajo el doble gate técnico/visual.
    Concepto: dos gates monumentales, técnico y visual, en secuencia

    Cómo se automatiza el gate técnico

    El gate técnico filtra decodificación y dimensiones; la revisión visual decide si el resultado sirve.
    El gate técnico filtra decodificación y dimensiones; la revisión visual decide si el resultado sirve.

    El gate técnico no necesita un modelo de visión: necesita verificaciones que una máquina hace mejor que un humano. Las cinco que usamos en cada generación:

    CheckQué detectaUmbral típico
    Decode completoArchivo truncado o corruptoFrames decodificados = frames esperados
    Anti-blankImagen vacía o de un solo colorDesviación estándar de píxel > umbral mínimo
    Dimensiones y aspectoStretch o crop indebidoRatio exacto tras normalizar
    Hash del assetRegeneraciones no controladasSHA-256 registrado por corrida
    Custodia de VRAMLanes dejando memoria ocupadaPiso de VRAM libre tras teardown

    La comprobación que casi nadie implementa es la última: que los casos que DEBEN fallar fallan. Si tu pipeline no puede rechazar correctamente una imagen en blanco, el “todo verde” de tus métricas no significa nada. En nuestra campaña, 8 casos negativos pasaron en fail-closed: rechazaron lo que debían rechazar.

    Cuándo un modelo de visión local sí ayuda

    Tener un modelo de visión local en el mismo homelab es útil — pero como pre-filtro, no como juez. Las tareas donde funciona bien:

    • Detección de duplicados: comparar una tanda de candidatos contra lo ya publicado.
    • Clasificación temática: “¿esta imagen corresponde a este post?” en lotes grandes.
    • Detección de texto corrupto: buscar pseudo-letras, que son el fallo más vergonzoso.

    Lo que no puede hacer: firmar el veredicto final. Los números de la investigación (correlación humana de 58-77% en los mejores evaluadores automáticos) son la razón técnica. La razón editorial es más simple: si algo sale mal, la firma es tuya, no del modelo. Puedes ver el flujo completo aplicado a generación de imagen y video en nuestro workflow de imagen a video.

    Para seguir el hilo

    Preguntas frecuentes

    ¿No basta con mirar la imagen yo mismo? Mirar es el gate visual. El punto es hacerlo sistemáticamente — cada lane, cada modelo nuevo, cada promoción — y registrar el veredicto para que “lo pasé por alto” no sea una opción.

    ¿Un modelo de visión local no puede automatizar el gate visual? Puede pre-filtrar (y lo hacemos), pero los números de arriba son la razón por la que no firma: 58-77% de correlación no es una firma.

    ¿Esto aplica a texto/código? El principio sí (los tests no prueban legibilidad), pero los fallos visuales tienen la particularidad de que las métricas técnicas no los ven en absoluto.

    El corolario práctico: ninguna automatización te exime de mirar. Te ahorra el trabajo repetitivo —decodificar, comparar, hashear— para que tu atención esté disponible donde el juicio humano sigue siendo insustituible: decidir si lo que quedó en pantalla merece llevar tu nombre.

    Si te llevas una sola idea de esta pieza, que sea esta: los planes de calidad más útiles son los que se pueden ejecutar sin convicción. Un checklist que exige mirar cada salida no depende de que tengas un buen día — y los proyectos serios no se construyen sobre buenos días.

    El conocimiento verdadero trasciende a lo público 🌀

    Continúa explorando Inteligencia Artificial con piezas relacionadas y evidencia adicional.

    Ver relacionados
    Escrito por

    Escritor en Freaking JSON. Apasionado por la tecnología, gaming y cultura geek.

    Deja un comentario