Hoppa till innehåll
VibekollenBETAVibekollen
VideoAI Engineer

KV Cache-Aware Routing and P/D Disaggregation on Kubernetes — Yuchen Fama & Ashish Kamra, Red Hat

Red Hat-ingenjörerna Yuchen Fama och Ashish Kamra presenterar två sätt att göra AI-modeller snabbare när man kör dem på servrar.

Det första är smart routing — när en användare ställer följdfrågor återanvänds tidigare beräkningar på samma server, vilket gör svaret 3 gånger snabbare. Det andra är att dela upp arbetet mellan två typer av servrar: en som förbereder texten och en som genererar ord. I ett praktiskt test föll väntetiden mellan ord från 900 millisekunder till 100 millisekunder. Men disaggregation fungerar bara bra vid medelhög belastning och kräver särskild nätverkshårdvara — annars är det bättre att hålla allt på en server.

Öppna på YouTube →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.

Mer från AI Engineer