KV Cache-Aware Routing and P/D Disaggregation on Kubernetes — Yuchen Fama & Ashish Kamra, Red Hat
Red Hat-ingenjörerna Yuchen Fama och Ashish Kamra presenterar två sätt att göra AI-modeller snabbare när man kör dem på servrar.
Det första är smart routing — när en användare ställer följdfrågor återanvänds tidigare beräkningar på samma server, vilket gör svaret 3 gånger snabbare. Det andra är att dela upp arbetet mellan två typer av servrar: en som förbereder texten och en som genererar ord. I ett praktiskt test föll väntetiden mellan ord från 900 millisekunder till 100 millisekunder. Men disaggregation fungerar bara bra vid medelhög belastning och kräver särskild nätverkshårdvara — annars är det bättre att hålla allt på en server.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
AI Engineer 30 aug.
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.