Cantonese Voice Benchmark粵語語音基準
EN繁中

Cantonese Voice Benchmark 2026.1 · 8 隊參賽

本屆評測發現咗啲乜。

下面每一項結論都標明咗數據支持得有幾實。一個唔肯喺雜訊之上排名次嘅評測,就唔應該用同一種肯定語氣去寫文字,所以我哋冇咁做。

已確立

數據直接支持,而且差距大過雜訊。

初步

方向清楚,但樣本仍然偏薄。

未有定論

我哋睇過,但暫時講唔到。

已確立

整個參賽群體其實分成 3 個區間,而唔係 8 個名次。

各區間人數為 6、1、1。同一區間之內嘅隊伍,用呢批數據係排唔出高下嘅。字錯率由 13.3% 到 52.3%。

要點樣先會改變呢個結論 語料池再大啲,置信區間就會收窄,而家重疊嘅區間有機會分得開。

已確立

各家投入服務嘅系統之間,粵語辨識質素有明顯差距。

喺 8 個系統之中,最強同最弱嘅字錯率相差 39.0 個百分點。

要點樣先會改變呢個結論 要有更多參賽者,尤其係受邀名單以外嘅。

初步

粵語語音合成仍然係成條技術鏈最弱嘅一環。

報咗語音合成範疇嘅 13 隊之中,有 8 隊已經有公布分數。

要點樣先會改變呢個結論 要有足夠隊伍完成人手評分,先至可以比較合成質素,而唔係淨係講佢冇。

已確立

至少有一個結果,係由連線穩定度而唔係模型質素決定。

有 7 次測試因為完成段數太少而冇分數。呢啲會標示為「資料不足」,而唔會當成一個差分數。

要點樣先會改變呢個結論 冇嘢要改。呢個係一項關於營運嘅量度,值得照咁報告出嚟。

整體表現同佢嘅不確定性

Character error rate with 95% confidence intervalsOsprey7: 13.3 percent, interval 10.2 to 17.2. Undertow9: 15.8 percent, interval 12.3 to 19.8. Osprey8: 19.4 percent, interval 16.4 to 22.8. Quadrant10: 19.5 percent, interval 16.4 to 23.3. Zephyr9: 19.7 percent, interval 16.3 to 25.2. Sampan10: 19.8 percent, interval 15.6 to 24.4. Vanguard8: 26.7 percent, interval 23.2 to 30.7. Petrel8: 52.3 percent, interval 48.4 to 56.5. Open-source pipeline: 11.1 percent. Proprietary voice LLM: 8.6 percent20.0%40.0%60.0%Osprey713.3Undertow915.8Osprey819.4Quadrant1019.5Zephyr919.7Sampan1019.8Vanguard826.7Petrel852.3Open-source pipeline11.1Proprietary voice LLM8.6tied
字錯率連 95% 自助抽樣置信區間,以語音為單位重抽。區間重疊嘅隊伍歸入同一區間並列公布——重疊就係理由,而呢度係睇得見,唔係口講。數值越低越好。

難度喺邊度真正咬落去

按錄音難度分嘅字錯率Osprey7: easy 27.5 percent, normal 10.4 percent, hard 13.5 percent. Undertow9: easy 27.7 percent, normal 13.6 percent, hard 15.4 percent. Zephyr9: easy 41.6 percent, normal 17.0 percent, hard 18.6 percent. Osprey8: easy 30.3 percent, normal 17.2 percent, hard 19.6 percent. Quadrant10: easy 32.2 percent, normal 16.3 percent, hard 19.9 percent. Sampan10: easy 31.3 percent, normal 15.5 percent, hard 21.2 percent. Vanguard8: easy 37.6 percent, normal 24.6 percent, hard 26.8 percent. Petrel8: easy 69.1 percent, normal 55.9 percent, hard 60.8 percent0%40%80%27.510.413.5Osprey727.713.615.4Undertow941.617.018.6Zephyr930.317.219.6Osprey832.216.319.9Quadrant1031.315.521.2Sampan1037.624.626.8Vanguard869.155.960.8Petrel8
同一批測試,按語音難度分開睇。一個總體數字會被容易嗰三分之一拉住;困難嗰一層先至有背景雜音、幾個人同時講嘢同情緒激動嘅來電者,即係客服中心真正會出現嘅嘢。兩個總體數字一樣嘅系統,喺呢度可以差好遠——所以我哋公布分層,而唔係淨係公布平均。

各範疇參與情況

邊個報咗每個範疇,同埋邊個做完。兩欄之間嘅差距,通常先係比較有趣嗰個數字。

範疇報名有成績
ASR158
LLM149
TTS138
E2E80

辨識準確度

最佳字錯率13.3%
中位數19.7%
最弱52.3%

想帶走呢份報告。 直接列印呢版,然後揀「儲存為 PDF」。列印樣式會拿走所有介面元素、唔會將圖表同說明分開,亦會將每條連結嘅網址寫出嚟。我哋刻意唔自己生成 PDF:自己生成嘅話,如果唔一齊夾帶幾兆嘅中文字型,繁中版每個字都會變成一個方格。你部瀏覽器本身已經有嗰啲字型。

點樣睇呢份報告

呢啲結論係由分數表生成,唔係人手寫,所以會跟住本屆嘅進展而改變。標示為「未有定論」嘅,係指證據不足,而唔係證明咗冇——最常見嘅原因係完成該範疇嘅隊伍太少,比較唔出意義。

每個數字背後嘅方法,包括計分前套用嘅完整文字正規化,全部喺評測方法嗰版。逐隊嘅成績喺排行榜