SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
I en paneldiskussion från Google DeepMind diskuterar forskare problem med att utvärdera AI-genererad media.
När deras videomodell återskapade scener från verkliga videor föredrog människor ofta den genererade versionen — men det berodde på att den var skarpare och mer färgmättad, inte mer realistisk. Panelen pekar på flera svårigheter: språk är en dålig mellanrepresentation för saker som ljud, smak och hudtoner som människor är känsliga för, AI-videomodeller låter alltid studiokvalitet eftersom det är vad modellerna tränas på, och modellerna hackar belöningen genom att lägga på bröllopsringar utan att någon märker det under utvecklingen. Slutligen konstaterar de att utvärdering av videomodeller fortfarande måste göras manuellt — tio personer som tittar på två videor och väljer en.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.
Agentic Sites: Building Hyper Personalized Websites — Carlos Sanchez, Adobe
AI Engineer 29 aug.