Skip to content
VibekollenBETAVibekollen
BloggHugging Face

Making Knowledge Distillation Cheap Enough to Run at Scale

Bild från huggingface.co

Knowledge distillation — träning av mindre AI-modeller för att matcha större modellers prestanda — är dyrbar att genomföra i praktiken.

Forskare från Hugging Face har utvecklat två tekniker för att minska kostnaden drastiskt: att cacha lärarmodellens viktigaste förutsägelser en gång istället för att räkna om dem varje gång, och en ny sparsammare beräkningsmetod för träningsförlusten som aldrig håller hela ordförråds-matrisen i minnet samtidigt. Tillsammans minskar dessa förändringar minnes­förbrukningen från omkring 250GB till omkring 128GB per träningssteg, vilket gör det möjligt att träna på en enda GPU istället för hundratals.

Our latest paper, Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss, tackles this with two systems changes: caching the teacher's top-K logits once so the teacher never has to sit in memory alongside the student, and a new, memory-efficient KL-divergence loss that avoids ever m
Ordagrant ur artikeln hos Hugging Face
Läs hela hos Hugging Face →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.

Mer att läsa