La ola open weights de septiembre 2026: MIT, un millón de tokens y trampas

Una semana, tres gigantes abiertos. Pero open weights no significa que corra en tu GPU ni que puedas usarlo en tu proyecto. La matriz de decisión real

Publicado 7 Oct 2026·Actualizado 23 Sep 2026·6 min de lectura·Inteligencia Artificial
En este artículo

    Septiembre de 2026 será recordado como el mes en que la pregunta “¿son abiertos los modelos?” quedó obsoleta. La pregunta nueva es más incómoda: ¿abierto para qué, para quién, y en qué GPU exactamente?

    La ola: quién soltó qué

    La cobertura especializada resumió bien el espíritu del mes, y su propia advertencia es la mejor introducción a nuestra tabla:

    “Estos son hechos del release según Xiaomi y Hugging Face — no una prueba de rendimiento independiente.” (CCLeaks, 21-sep-2026, traducción nuestra)

    ModeloQuiénArquitecturaContextoLicencia
    MiMo-V2.6 Pro-RLXiaomiMoE 1.02T total / 42B activo1M tokensMIT (ungated)
    MiMo-V2.6 Flash-RLXiaomiMoE 309B total / 15B activo1M tokensMIT (ungated)
    AliceAI Foundation 80B-A3BYandexMoE híbrido 80B / 3B activo262KApache-2.0 (ungated)
    DeepSeek-V4-Flash-Vision-ExpDeepSeek305B multimodal—MIT

    Verificado directamente contra la API de Hugging Face al cierre: los repos existen, están sin gate de acceso y con GGUFs comunitarios apareciendo en horas. Pero cada fila de esa tabla tiene letra pequeña — y la letra pequeña es la historia real.

    Licencia no es gratis para todo

    MIT y Apache-2.0 son, en efecto, las licencias más permisivas que existen: uso comercial, modificación, redistribución. Aquí la ola es genuinamente buena noticia. Pero cuidado con dos reflejos:

    • “Permisiva” no es “sin obligaciones”: Apache-2.0 requiere conservar notices de copyright; MIT también. Y los derivados de modelos con licencias restrictivas heredan las restricciones del base aunque el derivado diga Apache.
    • Un repo sin LICENSE es all-rights-reserved — la regla que repetimos en nuestra guía de licencias. En esta ola todos los grandes la tienen clara, pero los derivados comunitarios (quants, merges) no siempre.

    ¿Corre en tu GPU? La realidad de los tamaños

    Aquí viene el baño de agua fría que los hilos de celebración omiten:

    • MiMo Pro, 1.02T de parámetros totales: aunque solo 42B se activan por token, los pesos completos tienen que caber en memoria. No corre en ninguna GPU de consumidor — ni cerca.
    • MiMo Flash, 309B: idem. “Solo 15B activos” no ayuda si no puedes cargar los 309B.
    • AliceAI 80B: requiere trust_remote_code y arquitectura propietaria — funciona, pero con fricción fuera del stack oficial.

    La arquitectura MoE activa pocos parámetros por token, pero la memoria es un costo de posesión, no de cómputo. El marketing “15B activos” y la realidad “necesitas 600+ GB de VRAM” conviven felizmente en el mismo tweet.

    «Solo X activos por token» no ayuda si los pesos no caben: tamaños reales vs GPU de consumidor.
    «Solo X activos por token» no ayuda si los pesos no caben: tamaños reales vs GPU de consumidor.
    NVIDIA GeForce RTX 5060 Ti 16GB
    La GPU de consumidor que sí puede correr los destilados de la ola. Crédito: Wikimedia Commons, CC BY-SA 4.0.
    Concepto: el interior de una GPU como catedral gótica

    El puente GGUF para el homelab

    La parte genuinamente utilitaria de la ola: MiMo-V2.6-Distill-Qwen-9B, destilado sobre Qwen3.5-9B y orientado a tareas agénticas (coding, agentes generales, ciberseguridad), ya tiene GGUFs oficiales de ggml-org — corre en llama.cpp y Ollama con offload parcial CPU/GPU. Ese, sí, es un modelo de homelab: el repositorio oficial de DeepSeek Vision y el catálogo de MiMo en Hugging Face son las fuentes donde verificar cada cifra de esta tabla.

    Y el detalle más interesante para quien mira arquitectura: Xiaomi no soltó solo pesos — soltó más de 7.000 entornos de RL y un framework completo. El cuello de botella del entrenamiento agéntico suele ser el entorno, no el checkpoint. Eso es lo que distingue esta release de un dump de pesos con buen marketing.

    Concepto: destilación alquímica de datos en un vial de luz

    Cómo leer una model card sin humo

    Los pesos son solo una capa: contexto, runtime y margen también consumen memoria.
    Los pesos son solo una capa: contexto, runtime y margen también consumen memoria.
    1. Contexto declarado vs contexto efectivo: “1M tokens” en la card es el techo arquitectónico. La calidad en los últimos 900K es otra conversación — busca benchmarks por tramo si existen.
    2. “Trained from scratch” vs pretrain continuo: cambia el valor del release. AliceAI es from-scratch (aportación real); muchos otros son continues de bases públicas.
    3. API-first = estrategia, no generosidad: DeepSeek tuvo V4-Flash-Vision diez días solo en API antes de soltar pesos. Los pesos que llegan tarde son una decisión de negocio, y está bien — pero léela como tal.
    4. El benchmark no está en el tweet: las cifras de rendimiento de esta ola provienen de las propias model cards. Terceros independientes aún no las han corrido. “Release facts, not verdicts”, como declara honestamente la cobertura especializada.

    El checklist del homelab antes de descargar

    Las model cards celebran el contexto; tu máquina solo entiende de memoria. El cálculo que hacemos antes de bajar cualquier peso nuevo:

    PasoQué calcularPor qué
    1. Peso real en discoTamaño del GGUF/safetensors en tu cuantización objetivoLa card declara parámetros; el disco declara la verdad
    2. Presupuesto de contextoKB por token de KV cache × ventana que realmente usarásUn contexto de 1M no cabe en tu VRAM aunque el modelo sí
    3. Overhead de runtimeRuntime + buffers + margen de seguridadEl modelo cabe… y el sistema operativo no
    4. Velocidad esperadaAncho de banda de memoria ÷ bytes por tokenLa arquitectura MoE activa pocos parámetros, pero LEE todos
    5. Utilidad medidaUna tarea real tuya, no un benchmark ajenoUn modelo que no mejora tu trabajo es un archivo grande

    Este orden evita el patrón más común del homelab: descargar 40 GB, descubrir que no cabe, y dejarlo en disco “por si acaso”.

    El ecosistema que importa no son los pesos

    Lo más subestimado de la ola de septiembre no fue ningún checkpoint: fueron los 7.000+ entornos de RL y el framework que Xiaomi liberó junto a MiMo. En entrenamiento agéntico, el cuello de botella histórico no es el modelo base — es el entorno de evaluación: crear tareas verificables para que un agente practique. Liberar entornos es liberar la parte caras del proceso.

    Lo mismo aplica al tooling de consumo: la razón por la que un modelo pequeño es útil en local hoy no es solo la calidad del checkpoint, sino que existe infraestructura madura para correrlo — llama.cpp con GGUF, Ollama para arrancar en un comando, y cuantizadores comunitarios que publican el formato correcto en horas. Un peso abierto sin tooling es un archivo muerto; un peso abierto con ecosistema es una capacidad instalada. Puedes ver cómo se traduce eso en práctica en nuestra optimización de contexto largo.

    Para seguir el hilo

    Preguntas frecuentes

    ¿Debería descargar MiMo Flash para mi PC? No puedes. 309B de pesos no caben en hardware de consumidor. El Distill 9B sí es tu candidato.

    ¿MIT significa que puedo montar un negocio con esto? Sí, con las obligaciones mínimas de notice. Verifica derivados y outputs según cada caso — nuestra guía de licencias tiene el checklist.

    ¿Y el contexto de 1M es real? Es el techo declarado en la card. Real para pasar tests de longitud, verificado por terceros: aún no. Trátalo como especificación, no como experiencia.

    La conclusión operativa de la semana: bienvenidos los pesos abiertos, pero un modelo no entra a producción local por existir — entra cuando cabe, cuando corre, y cuando supera una prueba de trabajo real en tu máquina. Todo lo demás es inventario.

    El conocimiento verdadero trasciende a lo público 🌀

    Continúa explorando Inteligencia Artificial con piezas relacionadas y evidencia adicional.

    Ver relacionados
    Escrito por

    Escritor en Freaking JSON. Apasionado por la tecnología, gaming y cultura geek.

    Deja un comentario