AI Evals for Cross-Functional Teams — Nachiket Paranjape & Swaroop Chitlur Haridas, DoorDash
DoorDash bygger sin AI-bedömning (evals) genom att låta icke-tekniska team själva skapa verktyg för att testa och förbättra AI:n.
Istället för att bygga ett perfekt gränssnitt från början, skapade plattformsteamet stabila API:er — standardiserade kopplingspunkter — som strategi-, operations- och produktteamen kunde koppla in sina egna verktyg i. Bedömningen blev en arbetsprocess över flera team: operations-folk annoterar och märker data, produktchefer sätter kvalitetskrav, och ingenörer tillhandahåller mätdata. Själva processen är enkel — de samlar in AI-svar, markerar de bästa exemplen, tränar en "domare" (en liten AI-modell som graderar automatiskt), och övervakar hur det går över tid. Eftersom olika team har olika behov accepterar de att det inte finns en enda rätt väg, och kostnaden per annoteringsjobb sjönk markant.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
AI Engineer 30 aug.
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.