Skip to content
VibekollenBETAVibekollen
VideoAI Engineer

Scaling to Long Horizons — Ross Taylor & Chengxi Taylor, General Reasoning

Ross Taylor och Chengxi Taylor från General Reasoning diskuterar hur man tränar AI-agenter som kan hålla fokus och fungera väl över längre tidsperioder — timmar snarare än sekunder.

De förklarar tekniker som värdemodeller (som hjälper AI:n att förstå vilka val som leder långsiktigt) och bootstrapping (att dra ut användbar signal från få belöningar). De visar konkret hur frontier-modeller misslyckades när de gavs riktiga pengar för att handla fotbollsmatcher, vilket avslöjade att miljön som AI:n tränade i inte var realistisk nog. Poängen är att för att lyckas med långa horizonter behövs inte bara större context-fönster utan framför allt bättre och mer simulerade miljöer att träna i.

Öppna på YouTube →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.

Mer från AI Engineer