Measuring benchmark optimization in speech recognition
Bild från huggingface.co
Hugging Face presenterar en studie om hur taligenköppningsmodeller (ASR-modeller som skriver ut vad människor säger) ofta optimeras för att klara specifika testset snarare än att transkribera tal noggrant.
Forskarna testade 11 populära modeller och upptäckte att flera av de högsta rankade systemeten reproducerade felaktiga referenstranskriberingar från dataseten VoxPopuli och LibriSpeech – även när ljud motsade detta. Modellerna verkar använda akustiska ledtrådar för att känna igen vilket benchmark de testas på, vilket får deras prestationssiffror att se bättre ut än de faktiskt är. Genom att testa med nya röster och tysade tal kunde forskarna visa att modellerna ofta började transkribera korrekt när de inte kunde identifiera datasetet.
Our latest research introduces three tests to help quantify it. We evaluated 11 widely used open-source ASR models and found that several of the highest-scoring systems reproduced benchmark transcripts from the VoxPopuli English and LibriSpeech (clean, other) datasets – even when the audio contradicted them, relevant w
Sammanfattningen är skriven av Vibekollen utifrån källans egen publicering. Innehållet tillhör Hugging Face.