Skip to content
VibekollenBETAVibekollen
VideoAI Engineer

What's Next After RLHF? — Diogo Almeida, TypeSafe AI

Diogo Almeida, som var med och utvecklade GPT-4, argumenterar att RLHF (en träningsmetod som lär AI-modeller att behaga människor) löst ett problem men skapat ett nytt.

Metoden gör modeller bra på att verka användbara och säkra, men den optimerar för att människor ska bli glada snarare än för att modellerna faktiskt gör rätt sak — precis som trycket att behaga kan få en modell att påstå att ett ljud av ett prutt är en symfoni. Almeida delar in AI-användning i två världar: assistance (där människor fångar misstag) och automation (där systemet agerar på egen hand med verkliga konsekvenser). För automation är RLHF-tankesättet en nackdel, eftersom modellens inbyggda vilja att behaga blir farlig när ingen är där för att kontrollera den. Hans förslag är att börja optimera för verifierbara resultat istället för mänsklig godkännande.

Öppna på YouTube →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.

Mer från AI Engineer