Benchmarking Coding Agents on New vs Legacy Codebases — Denys Linkov, Wisedocs
Wisedocs processade medicinska anspråk genom tio olika kodrepon som ingen ville röra vid.
Denys Linkovs team spenderade sex månader på att slå ihop det till ett enda repo, och han benchmarkade om de borde ha väntat på bättre AI-modeller istället. En refaktoringsuppgift tog tre timmar med o3-modellen och resulterade i tio stora fel, medan nyare modeller som Sonnet 4.6 och Opus 4.8 klarade det snabbare och med färre misstag. Men när man gav GPT 5.5 hela jobbet på en gång skrev den 2 000 rader kod på 10 minuter som mest var skalet utan själva funktionerna — något modellen själv erkände. Linkov drar slutsatsen att att göra jobbet direkt var värt det: kodroller öppnades för commits, arbete som tog månader tar nu en vecka, och utvecklare från andra delar av företaget hjälper till frivilligt nu.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
AI Engineer 30 aug.
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.