Hoppa till innehåll
VibekollenBETAVibekollen
BloggHugging Face

Measuring benchmark optimization in speech recognition

Bild från huggingface.co

Hugging Face presenterar en studie om hur taligenköppningsmodeller (ASR-modeller som skriver ut vad människor säger) ofta optimeras för att klara specifika testset snarare än att transkribera tal noggrant.

Forskarna testade 11 populära modeller och upptäckte att flera av de högsta rankade systemeten reproducerade felaktiga referenstranskriberingar från dataseten VoxPopuli och LibriSpeech – även när ljud motsade detta. Modellerna verkar använda akustiska ledtrådar för att känna igen vilket benchmark de testas på, vilket får deras prestationssiffror att se bättre ut än de faktiskt är. Genom att testa med nya röster och tysade tal kunde forskarna visa att modellerna ofta började transkribera korrekt när de inte kunde identifiera datasetet.

Our latest research introduces three tests to help quantify it. We evaluated 11 widely used open-source ASR models and found that several of the highest-scoring systems reproduced benchmark transcripts from the VoxPopuli English and LibriSpeech (clean, other) datasets – even when the audio contradicted them, relevant w
Ordagrant ur artikeln hos Hugging Face
Läs hela hos Hugging Face →

Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.

Mer att läsa