AMD y Meta portaron PyTorch Monarch, el runtime de control único para entrenamiento distribuido, a GPUs Instinct con ROCm. El sistema aísla fallos por actor y deja que el cluster siga entrenando aunque un nodo se caiga, sin reiniciar el trabajo completo.