Los laboratorios de IA están recortando deliberadamente el conocimiento factual de sus modelos para ganar razonamiento puro. GLM-5.2, Qwen3.5 y DeepSeek V4-Flash muestran el patrón con números concretos, y la tendencia apunta a correr un modelo de frontera en una sola GPU de consumo.