Hoppa till innehåll
VibekollenBETAVibekollen
BloggGoogle DeepMind

Piloting the world's first double-blind AI evaluations

Bild från deepmind.google

Google DeepMind introducerar världens första "dubbelblind" utvärdering av AI-modeller — en metod där utvärderare och modellskapare använder kryptografisk teknik för att testa modeller utan att någon part kan se den andras känsliga data.

Problemet de löser är att AI-modeller kan ha tränat på samma testfrågor som används för att bedöma dem, vilket gör resultaten opålitliga. Genom att använda Googles Confidential Computing kan utvärderare testa Gemini Flash Lite-modellen utan att Google ser testfrågorna och utan att modellen kan optimera sig baserat på dem i förväg.

If a model has already seen the test questions - a problem known as benchmark contamination - the results can only be trusted to an extent.
Ordagrant ur artikeln hos Google DeepMind
Läs hela hos Google DeepMind →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Google DeepMind.

Mer att läsa