Hoppa till innehåll
VibekollenBETAVibekollen
VideoAI Engineer

Compression at the Edge — Chris Alexiuk, NVIDIA

En paneldiskussion om hur man kan krympa stora AI-modeller utan att de blir dummare.

Huvudinsikten är att modellernas lager är väldigt olika viktiga — de första och sista är kritiska medan många mittlager nästan inte spelar någon roll. GLM 5.2 kunde minskas från 1,5 terabyte till 250 GB (86 procent mindre) utan motsvarande försämring. NVIDIA förespråkar NVFP4, ett kompakt format för tal som delar precisionsinfo mellan grupper om 16 värden. Panelen betonar att riktiga testningar i faktiska användarfall är viktigare än abstrakta mätningar.

Öppna på YouTube →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.

Mer från AI Engineer