AirLLM, la librería open source que permite correr modelos gigantes en poca memoria, ya soporta Kimi K3: el modelo abierto de 2.8 billones de parámetros que ahora corre en una sola GPU de menos de 4 GB. La técnica de streaming por experto evita cargar el modelo completo en memoria.