Hoppa till innehåll
VibekollenBETAVibekollen
VideoAI Engineer

Benchmarking Coding Agents on New vs Legacy Codebases — Denys Linkov, Wisedocs

Wisedocs processade medicinska anspråk genom tio olika kodrepon som ingen ville röra vid.

Denys Linkovs team spenderade sex månader på att slå ihop det till ett enda repo, och han benchmarkade om de borde ha väntat på bättre AI-modeller istället. En refaktoringsuppgift tog tre timmar med o3-modellen och resulterade i tio stora fel, medan nyare modeller som Sonnet 4.6 och Opus 4.8 klarade det snabbare och med färre misstag. Men när man gav GPT 5.5 hela jobbet på en gång skrev den 2 000 rader kod på 10 minuter som mest var skalet utan själva funktionerna — något modellen själv erkände. Linkov drar slutsatsen att att göra jobbet direkt var värt det: kodroller öppnades för commits, arbete som tog månader tar nu en vecka, och utvecklare från andra delar av företaget hjälper till frivilligt nu.

Öppna på YouTube →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.

Mer från AI Engineer