Beyond Static Intelligence: Evaluating Continual Learning — Parth Asawa, UC Berkeley
Parth Asawa från UC Berkeley kritiserar hur AI-modeller utvärderas idag.
Alla rankinglistan bygger på att testa en modell på en uppgift, nollställa dess minne, och testa på nästa — vilket döljer hur väl systemet faktiskt lär sig över tid. Han presenterar ett nytt mätverktyg som jämför samma system när det kan lära sig (behålla minne mellan uppgifter) mot när det nollställs efter varje uppgift. Resultaten är överraskande: enkel in-context-inlärning (där modellen använder tidigare svar för att förbättra sig inom samma konversation) slår mer komplicerade minneshanteringssystem. Hans benchmark täcker sex områden, från databassökning till prognosmodeller, och avslöjar problem som att modeller kan glömma sina egna korrigeringar.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
AI Engineer 30 aug.
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.