En este artículo

Septiembre de 2026 será recordado como el mes en que la pregunta “¿son abiertos los modelos?” quedó obsoleta. La pregunta nueva es más incómoda: ¿abierto para qué, para quién, y en qué GPU exactamente?
La ola: quién soltó qué
La cobertura especializada resumió bien el espíritu del mes, y su propia advertencia es la mejor introducción a nuestra tabla:
“Estos son hechos del release según Xiaomi y Hugging Face — no una prueba de rendimiento independiente.” (CCLeaks, 21-sep-2026, traducción nuestra)
| Modelo | Quién | Arquitectura | Contexto | Licencia |
|---|---|---|---|---|
| MiMo-V2.6 Pro-RL | Xiaomi | MoE 1.02T total / 42B activo | 1M tokens | MIT (ungated) |
| MiMo-V2.6 Flash-RL | Xiaomi | MoE 309B total / 15B activo | 1M tokens | MIT (ungated) |
| AliceAI Foundation 80B-A3B | Yandex | MoE híbrido 80B / 3B activo | 262K | Apache-2.0 (ungated) |
| DeepSeek-V4-Flash-Vision-Exp | DeepSeek | 305B multimodal | — | MIT |
Verificado directamente contra la API de Hugging Face al cierre: los repos existen, están sin gate de acceso y con GGUFs comunitarios apareciendo en horas. Pero cada fila de esa tabla tiene letra pequeña — y la letra pequeña es la historia real.
Licencia no es gratis para todo
MIT y Apache-2.0 son, en efecto, las licencias más permisivas que existen: uso comercial, modificación, redistribución. Aquí la ola es genuinamente buena noticia. Pero cuidado con dos reflejos:
- “Permisiva” no es “sin obligaciones”: Apache-2.0 requiere conservar notices de copyright; MIT también. Y los derivados de modelos con licencias restrictivas heredan las restricciones del base aunque el derivado diga Apache.
- Un repo sin LICENSE es all-rights-reserved — la regla que repetimos en nuestra guía de licencias. En esta ola todos los grandes la tienen clara, pero los derivados comunitarios (quants, merges) no siempre.
¿Corre en tu GPU? La realidad de los tamaños
Aquí viene el baño de agua fría que los hilos de celebración omiten:
- MiMo Pro, 1.02T de parámetros totales: aunque solo 42B se activan por token, los pesos completos tienen que caber en memoria. No corre en ninguna GPU de consumidor — ni cerca.
- MiMo Flash, 309B: idem. “Solo 15B activos” no ayuda si no puedes cargar los 309B.
- AliceAI 80B: requiere
trust_remote_codey arquitectura propietaria — funciona, pero con fricción fuera del stack oficial.
La arquitectura MoE activa pocos parámetros por token, pero la memoria es un costo de posesión, no de cómputo. El marketing “15B activos” y la realidad “necesitas 600+ GB de VRAM” conviven felizmente en el mismo tweet.
El puente GGUF para el homelab
La parte genuinamente utilitaria de la ola: MiMo-V2.6-Distill-Qwen-9B, destilado sobre Qwen3.5-9B y orientado a tareas agénticas (coding, agentes generales, ciberseguridad), ya tiene GGUFs oficiales de ggml-org — corre en llama.cpp y Ollama con offload parcial CPU/GPU. Ese, sí, es un modelo de homelab: el repositorio oficial de DeepSeek Vision y el catálogo de MiMo en Hugging Face son las fuentes donde verificar cada cifra de esta tabla.
Y el detalle más interesante para quien mira arquitectura: Xiaomi no soltó solo pesos — soltó más de 7.000 entornos de RL y un framework completo. El cuello de botella del entrenamiento agéntico suele ser el entorno, no el checkpoint. Eso es lo que distingue esta release de un dump de pesos con buen marketing.
Cómo leer una model card sin humo
- Contexto declarado vs contexto efectivo: “1M tokens” en la card es el techo arquitectónico. La calidad en los últimos 900K es otra conversación — busca benchmarks por tramo si existen.
- “Trained from scratch” vs pretrain continuo: cambia el valor del release. AliceAI es from-scratch (aportación real); muchos otros son continues de bases públicas.
- API-first = estrategia, no generosidad: DeepSeek tuvo V4-Flash-Vision diez días solo en API antes de soltar pesos. Los pesos que llegan tarde son una decisión de negocio, y está bien — pero léela como tal.
- El benchmark no está en el tweet: las cifras de rendimiento de esta ola provienen de las propias model cards. Terceros independientes aún no las han corrido. “Release facts, not verdicts”, como declara honestamente la cobertura especializada.
El checklist del homelab antes de descargar
Las model cards celebran el contexto; tu máquina solo entiende de memoria. El cálculo que hacemos antes de bajar cualquier peso nuevo:
| Paso | Qué calcular | Por qué |
|---|---|---|
| 1. Peso real en disco | Tamaño del GGUF/safetensors en tu cuantización objetivo | La card declara parámetros; el disco declara la verdad |
| 2. Presupuesto de contexto | KB por token de KV cache × ventana que realmente usarás | Un contexto de 1M no cabe en tu VRAM aunque el modelo sí |
| 3. Overhead de runtime | Runtime + buffers + margen de seguridad | El modelo cabe… y el sistema operativo no |
| 4. Velocidad esperada | Ancho de banda de memoria ÷ bytes por token | La arquitectura MoE activa pocos parámetros, pero LEE todos |
| 5. Utilidad medida | Una tarea real tuya, no un benchmark ajeno | Un modelo que no mejora tu trabajo es un archivo grande |
Este orden evita el patrón más común del homelab: descargar 40 GB, descubrir que no cabe, y dejarlo en disco “por si acaso”.
El ecosistema que importa no son los pesos
Lo más subestimado de la ola de septiembre no fue ningún checkpoint: fueron los 7.000+ entornos de RL y el framework que Xiaomi liberó junto a MiMo. En entrenamiento agéntico, el cuello de botella histórico no es el modelo base — es el entorno de evaluación: crear tareas verificables para que un agente practique. Liberar entornos es liberar la parte caras del proceso.
Lo mismo aplica al tooling de consumo: la razón por la que un modelo pequeño es útil en local hoy no es solo la calidad del checkpoint, sino que existe infraestructura madura para correrlo — llama.cpp con GGUF, Ollama para arrancar en un comando, y cuantizadores comunitarios que publican el formato correcto en horas. Un peso abierto sin tooling es un archivo muerto; un peso abierto con ecosistema es una capacidad instalada. Puedes ver cómo se traduce eso en práctica en nuestra optimización de contexto largo.
Para seguir el hilo
Preguntas frecuentes
¿Debería descargar MiMo Flash para mi PC? No puedes. 309B de pesos no caben en hardware de consumidor. El Distill 9B sí es tu candidato.
¿MIT significa que puedo montar un negocio con esto? Sí, con las obligaciones mínimas de notice. Verifica derivados y outputs según cada caso — nuestra guía de licencias tiene el checklist.
¿Y el contexto de 1M es real? Es el techo declarado en la card. Real para pasar tests de longitud, verificado por terceros: aún no. Trátalo como especificación, no como experiencia.
La conclusión operativa de la semana: bienvenidos los pesos abiertos, pero un modelo no entra a producción local por existir — entra cuando cabe, cuando corre, y cuando supera una prueba de trabajo real en tu máquina. Todo lo demás es inventario.
El conocimiento verdadero trasciende a lo público 🌀
Continúa explorando Inteligencia Artificial con piezas relacionadas y evidencia adicional.
Ver relacionados



