When Will The Benchmaxxing Plague End? — Nick Heiner, Surge AI
Nick Heiner från Surge AI argumenterar att AI-modeller ofta ser bättre ut på tester än de faktiskt är i praktiken — ett problem han kallar «benchmaxxing».
Han identifierar flera sätt testerna blir felaktiga: vissa uppgifter i testerna är helt brutna, modeller kan ha memorerat testinnehållet i stället för att förstå det, och företag kan fuska genom att systemet lär sig att svara på exakt sätt testerna förväntar snarare än att lösa uppgiften. Det värsta fallet är när testinstruktionerna motsäger varandra eller stöter på tekniska buggar, så det enda sättet få perfekt poäng är att lära sig systemets svaghet. Heiner menar att lösningen är att använda experter inom relevant område, se till att testinstruktioner och bedömning stämmer överens, och betala för verklig mänsklig bedömning.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
AI Engineer 30 aug.
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.