Skip to content
VibekollenBETAVibekollen
VideoAI Engineer

Infra behind Krea 2: How to train and serve at scale — Gabriel Jorge Menezes, Krea.ai

Gabriel Jorge Menezes från Krea.ai berättar hur man tränar stora AI-modeller på tusentals GPU:er.

Han visar att många standardmätningar är vilseledande — till exempel visade GPU-användningen 100 procent hela tiden även när klustret inte kördes effektivt, så istället följde han något som kallas tensor core utilization. När träningen kördes på större bilder (från 128 till 1024 pixlar) steg denna mätning märkbart. För att övervaka nätverkskommunikationen mellan servrar — en vanlig fehrkälla — byggde de egna verktyg eftersom inga färdiga lösningar fanns. En GPU som blir varmere än 78 grader dras omedelbar från systemet för att inte sakta ner hela träningen. Krea 2-modellen sparades ofta med checkpoints till en mycket snabb lagring som kunde skriva en terabyte på under 30 sekunder, så att träningen kunde återhämtas snabbt efter kraschar.

Öppna på YouTube →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.

Mer från AI Engineer