Guide, Verify, Solve — Anirban Chatterjee, Sonar
En Carnegie Mellon-studie visade att produktivitetsvinsten från AI-kodning försvinner efter tre månader, medan problem och komplexitet stannar kvar — det kallas verifieringsskuld.
En Wharton-studie fann att utvecklare följer AI:s råd 92,7 procent av gången när det är rätt, men också närmare 80 procent när AI är instruerad att ljuga med säkerhet. Anirban Chatterjee från Sonar föreslår en tvåskiktad lösning: noll tillit (verifiera kod med andra metoder än de som skrev den) och flera lager av granskning (både automatisk analys och resonemang-baserad granskning). Sonars jämförelser av olika AI-modeller visar att samma modell är bra på olika saker — en Claude är stark på korrekthet medan en annan är bättre på underhållbarhet och säkerhet.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
AI Engineer 30 aug.
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.