Hoppa till innehåll
VibekollenBETAVibekollen
BloggHugging Face

Up to 3.2x Faster Inference with LFM2.5-DSpark

Bild från huggingface.co

Liquid AI har lanserat DSpark-versioner av sina LFM2.5-språkmodeller som gör inferensen upp till 3,2 gånger snabbare på GPU och 2,87 gånger snabbare på enheter som MacBook Pro.

DSpark använder en mindre "draft"-modell (omkring 300 miljoner parametrar) som föreslog tokens som en större modell sedan verifierar — på så sätt delas kostnaderna för att läsa vikter från minne över flera tokens samtidigt. Tekniken reducerar latensen för funktionsanrop med 57 procent i genomsnitt för den minsta modellen. Modellerna finns redan integrerade med llama.cpp och SGLang, två populära ramverk för att köra språkmodeller.

Faster inference: up to 3.18 throughput improvement on a GPU and up to 2.87x on-device.
Ordagrant ur artikeln hos Hugging Face
Läs hela hos Hugging Face →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.

Mer att läsa