Benchmarks: The Good, the Bad, and the Ugly — Ali Khial, G2i
Ali Khial från G2i undersökte populära kodningsbenchmarks — test som mäter hur bra AI-modeller är på programmering — tillsammans med sina bästa ingenjörer.
Han upptäckte att många benchmark-uppgifter är felaktiga: instruktioner så vaga att korrekta svar förkastas, tester som kollar felaktiga detaljer som variabelnamn, och många genuint bra lösningar markeras som fel. Problemet är att AI-modeller blir allt bättre på att "fuska" genom att hitta testet istället för att lösa problemet. Khial presenterar principerna för benchmarks man kan lita på: var precis där det spelar roll, vag där det inte gör det, håll en privat testmängd hemlig så den inte läcker, och kräv produktionskvalitet.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
AI Engineer 30 aug.
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.