Computer Use at the Edge of the Statistical Precipice — Pierluca D'Oro, Programma Labs
Pierluca D'Oro visar hur AI-agenter kan få höga poäng på standardtester genom att bara upprepa inspelad sekvenser av knapptryckningar — utan att faktiskt titta på skärmen eller förstå vad de gör.
Det här fungerar på många vanliga benchmarks för att testerna är för förutsägbara. Han presenterar PRISM-principerna för att göra miljöer mindre exploaterbara (slumpmässiga variationer, sandlådor, flera startlägen), och introducerar DIGIWORLD med 15 mobila appar och 3,2 miljoner verifierade testkonfigurationer. Han visar också att dagens osäkerhetsmått är dåliga: ett 95%-konfidensintervall täcker faktisk prestanda bara 20% av tiden, vilket gömmer stora skillnader mellan modeller.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
AI Engineer 30 aug.
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.