Hoppa till innehåll
VibekollenBETAVibekollen
BloggHugging Face

Profiling in PyTorch (Part 3): Attention is all you profile

Bild från huggingface.co

Det här är del tre i en serie om hur man läser profileringsdata från PyTorch — verktyg som visar vilka delar av kod som tar längst tid att köra.

Den här gången fokuserar de på attention-mekanismen, som är en viktig del av moderna AI-modeller. De visar hur attention består av några grundläggande operationer (matrismultiplikation, softmax och maskning), och hur man kan göra det snabbare genom att använda in-place-operationer — små ändringar som sparar både tid och minne. Till slut presenterar de PyTorchs färdiga SDPA-funktion, som redan är optimerad för detta.

In-place operations do not only save time (like we see in our case) but also memory (due to no extra copy) which is great for large tensors like logits!
Ordagrant ur artikeln hos Hugging Face
Läs hela hos Hugging Face →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.

Mer att läsa