Training and Finetuning Multi-Vector Embedding Models with Sentence Transformers
Bild från huggingface.co
Hugging Face presenterar hur man tränar multi-vector-modeller — en typ av sökmodell som behåller en liten vektor per ord istället för att pressa hela texten till en enda vektor.
Det ger finare matchning mellan sökfrågor och dokument men kräver större lagringsplats. Blogginlägget visar vilka komponenter som behövs för att finjustera befintliga modeller eller bygga nya från grunden, och presenterar exempel där en specialiserad medicinsk modell tränades på 14,5 timmar på ett enda grafikkort och överträffade generella sökmodeller.
Finetuning multi-vector models significantly improves their retrieval performance on your specific domain: the vocabulary, the query style, and the notion of relevance all differ between web search, legal discovery, code search, and scientific literature review.
Läs hela hos Hugging Face →
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.