The State of Model Routing — NVIDIA, Cognition, OpenRouter
Videon diskuterar hur man väljer mellan stora och små AI-modeller för olika uppgifter.
Det visar sig att det inte alltid lönar sig att välja den billigaste modellen för varje enskild uppgift — en liten modell som hamnar utanför sitt kompetensområde kan bli väldigt dyr genom att kalla hjälpfunktioner om och om igen. Cognition löser det genom att låta en stor modell planera och delegera arbetet till mindre modeller, vilket sparade 40 procent på kostnader. En annan upptäckt är att det är värdefullt att hålla samma modell vid liv under en hel konversation — då sparas pengar eftersom redan processad information kan återanvändas istället för att bearbetas på nytt.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör AI Engineer.
Mer från AI Engineer
SOTA Generative Media Panel — Dumitru Erhan, Shane Gu & Nicole Brichtova, Google DeepMind
AI Engineer 30 aug.
Tell the Robot What You Want — Sandhya Subramani, AWS
AI Engineer 29 aug.
The Signal Layer: What to Build When Anything Can Be Built — Lena Hall, Akamai
AI Engineer 29 aug.
Tribal Dungeons of Global Shipping: AI Agents at Global Scale — Dmitry Buykin, Maersk
AI Engineer 29 aug.