Offloading de expertos en una gpu gamer corriendo un modelo MoE de 125B

Strata: cómo correr un modelo MoE de 125B en 12 GB de VRAM

Strata es un motor de inferencia open source que corre Qwen3.8-Flash-Next, un modelo MoE de 125.000 millones de parámetros, en una gpu gamer con apenas 12 GB de VRAM. La clave combina cuantización agresiva en formato GGUF con offloading de expertos entre la VRAM y la RAM del sistema. El resultado es un modelo de escala de servidor corriendo en una PC normal, con los límites que eso impone.