Newer Models, Same Advantage
Bild från huggingface.co
Hugging Face presenterar DharmaOCR, en modell för att läsa text från bilder (OCR) som är specialiserad på portugisiska från Brasilien.
Modellen tränade i två steg: först en allmän justering på portugisiska texter, sedan en mer avancerad optimering som lärde modellen att välja mellan olika möjliga tolkningar för att bli mer stabil. När de testade DharmaOCR mot två nyare OCR-modeller — Mistral OCR4 och Unlimited-OCR — presterade DharmaOCR betydligt bättre på portugisiska dokument, med ett resultat på 0,925 mot 0,798 och 0,7587 för de andra modellerna. Förklaringen är att en specialiserad modell kan fokusera alla sina resurser på ett språk och en typ av dokument, medan bredare modeller måste sprida sina förmågor över många språk.
DharmaOCR outperformed Mistral OCR4 and Unlimited-OCR on Brazilian Portuguese through domain specialization and targeted training.
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.