Cantonese Voice Benchmark 2026.1 · 8 隊參賽
本屆評測發現咗啲乜。
下面每一項結論都標明咗數據支持得有幾實。一個唔肯喺雜訊之上排名次嘅評測,就唔應該用同一種肯定語氣去寫文字,所以我哋冇咁做。
已確立整個參賽群體其實分成 3 個區間,而唔係 8 個名次。
各區間人數為 6、1、1。同一區間之內嘅隊伍,用呢批數據係排唔出高下嘅。字錯率由 13.3% 到 52.3%。
要點樣先會改變呢個結論 語料池再大啲,置信區間就會收窄,而家重疊嘅區間有機會分得開。
已確立各家投入服務嘅系統之間,粵語辨識質素有明顯差距。
喺 8 個系統之中,最強同最弱嘅字錯率相差 39.0 個百分點。
要點樣先會改變呢個結論 要有更多參賽者,尤其係受邀名單以外嘅。
初步粵語語音合成仍然係成條技術鏈最弱嘅一環。
報咗語音合成範疇嘅 13 隊之中,有 8 隊已經有公布分數。
要點樣先會改變呢個結論 要有足夠隊伍完成人手評分,先至可以比較合成質素,而唔係淨係講佢冇。
已確立至少有一個結果,係由連線穩定度而唔係模型質素決定。
有 7 次測試因為完成段數太少而冇分數。呢啲會標示為「資料不足」,而唔會當成一個差分數。
要點樣先會改變呢個結論 冇嘢要改。呢個係一項關於營運嘅量度,值得照咁報告出嚟。
整體表現同佢嘅不確定性
字錯率連 95% 自助抽樣置信區間,以語音為單位重抽。區間重疊嘅隊伍歸入同一區間並列公布——重疊就係理由,而呢度係睇得見,唔係口講。數值越低越好。 難度喺邊度真正咬落去
easynormalhard
同一批測試,按語音難度分開睇。一個總體數字會被容易嗰三分之一拉住;困難嗰一層先至有背景雜音、幾個人同時講嘢同情緒激動嘅來電者,即係客服中心真正會出現嘅嘢。兩個總體數字一樣嘅系統,喺呢度可以差好遠——所以我哋公布分層,而唔係淨係公布平均。各範疇參與情況
邊個報咗每個範疇,同埋邊個做完。兩欄之間嘅差距,通常先係比較有趣嗰個數字。
| 範疇 | 報名 | 有成績 |
|---|
| ASR | 15 | 8 |
| LLM | 14 | 9 |
| TTS | 13 | 8 |
| E2E | 8 | 0 |
辨識準確度
| 最佳字錯率 | 13.3% |
| 中位數 | 19.7% |
| 最弱 | 52.3% |
想帶走呢份報告。 直接列印呢版,然後揀「儲存為 PDF」。列印樣式會拿走所有介面元素、唔會將圖表同說明分開,亦會將每條連結嘅網址寫出嚟。我哋刻意唔自己生成 PDF:自己生成嘅話,如果唔一齊夾帶幾兆嘅中文字型,繁中版每個字都會變成一個方格。你部瀏覽器本身已經有嗰啲字型。
點樣睇呢份報告
呢啲結論係由分數表生成,唔係人手寫,所以會跟住本屆嘅進展而改變。標示為「未有定論」嘅,係指證據不足,而唔係證明咗冇——最常見嘅原因係完成該範疇嘅隊伍太少,比較唔出意義。
每個數字背後嘅方法,包括計分前套用嘅完整文字正規化,全部喺評測方法嗰版。逐隊嘅成績喺排行榜。