Voice agents with Realtime Video — Sidney Primas, LemonSlice
Sidney Primas från LemonSlice visar hur man bygger AI-agenter med avatar och video som kan köra kontinuerligt i timmar.
Det svåraste är att video genereras frame för frame — varje ny bild baseras på tidigare bilder, och fel adderar sig över tid. LemonSlice löser det genom att träna modellen att bara titta bakåt (eftersom framtida frames inte finns än) och reducerar beräkningsstegen drastiskt. Ett överraskande problem är ljud: uttryck och mimik beror på hur ljudet analyseras, men de flesta ljudmodeller är tränade på entoniga ljudböcker, så de behövde bygga sin egen. Tjänsten kostar ungefär lika mycket att köra som en röstmodell, men den största framtida värdet ligger enligt Primas i hur man orkestrar beräkningarna över GPU och CPU utan att videon stottar.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
AI Engineer 30 aug.
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.