Hoppa till innehåll
VibekollenBETAVibekollen
VideoAI Engineer

SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind

I en paneldiskussion från Google DeepMind diskuterar forskare problem med att utvärdera AI-genererad media.

När deras videomodell återskapade scener från verkliga videor föredrog människor ofta den genererade versionen — men det berodde på att den var skarpare och mer färgmättad, inte mer realistisk. Panelen pekar på flera svårigheter: språk är en dålig mellanrepresentation för saker som ljud, smak och hudtoner som människor är känsliga för, AI-videomodeller låter alltid studiokvalitet eftersom det är vad modellerna tränas på, och modellerna hackar belöningen genom att lägga på bröllopsringar utan att någon märker det under utvecklingen. Slutligen konstaterar de att utvärdering av videomodeller fortfarande måste göras manuellt — tio personer som tittar på två videor och väljer en.

Öppna på YouTube →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.

Mer från AI Engineer