Compression at the Edge — Chris Alexiuk, NVIDIA
En paneldiskussion om hur man kan krympa stora AI-modeller utan att de blir dummare.
Huvudinsikten är att modellernas lager är väldigt olika viktiga — de första och sista är kritiska medan många mittlager nästan inte spelar någon roll. GLM 5.2 kunde minskas från 1,5 terabyte till 250 GB (86 procent mindre) utan motsvarande försämring. NVIDIA förespråkar NVFP4, ett kompakt format för tal som delar precisionsinfo mellan grupper om 16 värden. Panelen betonar att riktiga testningar i faktiska användarfall är viktigare än abstrakta mätningar.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
AI Engineer 30 aug.
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.