Scaling to Long Horizons — Ross Taylor & Chengxi Taylor, General Reasoning
Ross Taylor och Chengxi Taylor från General Reasoning diskuterar hur man tränar AI-agenter som kan hålla fokus och fungera väl över längre tidsperioder — timmar snarare än sekunder.
De förklarar tekniker som värdemodeller (som hjälper AI:n att förstå vilka val som leder långsiktigt) och bootstrapping (att dra ut användbar signal från få belöningar). De visar konkret hur frontier-modeller misslyckades när de gavs riktiga pengar för att handla fotbollsmatcher, vilket avslöjade att miljön som AI:n tränade i inte var realistisk nog. Poängen är att för att lyckas med långa horizonter behövs inte bara större context-fönster utan framför allt bättre och mer simulerade miljöer att träna i.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
AI Engineer 30 aug.
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.