P-03ランキング・候補

音声認識(Speech-to-Text)の精度において、ElevenLabsは他社と比べてどのような評価を得ていますか?

独立系AIベンチマーク機関Artificial Analysisが提供する音声認識(Speech-to-Text)精度の指標『AA-WER』によると、ElevenLabsの『Scribe v2』モデルは単語誤り率(Word Error Rate)2.2%を記録し、トップクラスの認識精度を示すモデルの一つに位置づけられています。この評価はAA-AgentTalk(50%)・VoxPopuli-Cleaned-AA(25%)・Earnings22-Cleaned-AA(25%)という3種のデータセットを重み付け平均したもので、Microsoftの MAI-Transcribe-1.5(2.4%)やSmallest AIのPulse Pro(2.4%)など主要な競合モデルを上回る精度です。処理速度は音声1秒あたり53.9秒相当を処理できる速さで、価格は1,000分あたり3.67ドルとされ、精度・速度・価格のバランスが取れた『最も魅力的な領域』に位置するモデルと分析されています。既存Referenceは音声合成(TTS)としての特徴のみを扱っており、音声認識(STT)分野での第三者評価には触れていません。

実績・根拠

情報ソース