Taking Reinforcement Learning Cross Datacenter — Nan Jiang, Modal
Nan Jiang från Modal presenterar en teknik för att köra reinforcement learning (AI-träning genom trial-and-error) på GPU-servrar spridda över flera världsdelar.
Problemet är att checkpoints — sparade versioner av en tränad AI-modell — väger omkring 500 GB och tar timmar att skicka mellan datacenter, vilket förstör möjligheten att uppdatera modellen snabbt. Hans lösning är att skicka endast omkring 500 MB istället: en liten patch som innehåller bara de viktigaste ändringarna. Det fungerar för att mindre än 1% av vikterna faktiskt förändras mellan versioner — inte för att gradienter är glesa, utan för att uppdateringarna är mycket små, ofta tusen gånger mindre än precisionen tillåter. Modal kallar implementationen Stitch.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
AI Engineer 30 aug.
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.