LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge
Bild från huggingface.co
Liquid AI presenterar LFM2.5-VL-3B, en vision-language-modell — en AI som kan både se bilder och förstå text.
Modellen är liten nog att köra direkt på din telefon eller dator och klarar fyra nya saker bra: förstår skärmar och gränssnitt, kan peka ut objekt när du beskriver dem, kan analysera flera bilder tillsammans, och kan anropa verktyg och funktioner. Modellen är tränad på 34 biljoner tokens med fyra gånger mer bilddata än tidigare versioner och stödjer många språk inklusive icke-latinska skriftsystem. I tester slår den andra modeller i sin storlek när det gäller verkliga bilduppgifter som att läsa dokument, skärmar och grafer.
LFM2.5-VL-3B extends the vision-language capabilities of our previous releases with four major improvements: Screen/UI understanding: Strong understanding of digital screens across different devices. Grounding: Improved grounding and object detection with natural language queries. Multi-image input: Improved reasoning
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.