Up to 3.2x Faster Inference with LFM2.5-DSpark
Bild från huggingface.co
Liquid AI har lanserat DSpark-versioner av sina LFM2.5-språkmodeller som gör inferensen upp till 3,2 gånger snabbare på GPU och 2,87 gånger snabbare på enheter som MacBook Pro.
DSpark använder en mindre "draft"-modell (omkring 300 miljoner parametrar) som föreslog tokens som en större modell sedan verifierar — på så sätt delas kostnaderna för att läsa vikter från minne över flera tokens samtidigt. Tekniken reducerar latensen för funktionsanrop med 57 procent i genomsnitt för den minsta modellen. Modellerna finns redan integrerade med llama.cpp och SGLang, två populära ramverk för att köra språkmodeller.
Faster inference: up to 3.18 throughput improvement on a GPU and up to 2.87x on-device.
Läs hela hos Hugging Face →
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.