Making Knowledge Distillation Cheap Enough to Run at Scale
Bild från huggingface.co
Knowledge distillation — träning av mindre AI-modeller för att matcha större modellers prestanda — är dyrbar att genomföra i praktiken.
Forskare från Hugging Face har utvecklat två tekniker för att minska kostnaden drastiskt: att cacha lärarmodellens viktigaste förutsägelser en gång istället för att räkna om dem varje gång, och en ny sparsammare beräkningsmetod för träningsförlusten som aldrig håller hela ordförråds-matrisen i minnet samtidigt. Tillsammans minskar dessa förändringar minnesförbrukningen från omkring 250GB till omkring 128GB per träningssteg, vilket gör det möjligt att träna på en enda GPU istället för hundratals.
Our latest paper, Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss, tackles this with two systems changes: caching the teacher's top-K logits once so the teacher never has to sit in memory alongside the student, and a new, memory-efficient KL-divergence loss that avoids ever m
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.