Cantonese Voice Benchmark粵語語音基準
EN繁中

評測方法

我哋點樣量度。

呢一頁決定咗啲數字有冇價值。每個指標、佢嘅公式,同埋計分之前所做嘅正規化,全部寫喺度——而且逐項附上佢喺2026-1實際計出嚟嘅結果。

計分比重

範疇比重是否必須
語音辨識 — 字元錯誤率20%所有隊伍必考
語言理解 — 評審準則,兩個模型25%所有隊伍必考
語音合成 — 交付 60% + 聲調存活 40%,未有 MOS 之前30%所有隊伍必考
端到端 — 延遲 50% + 讓路 30% + 完成率 20%,未有人手評分之前25%自由參加

核心分數係語音辨識、語言理解同語音合成——聽得到、理解到、講得出,即係呢個比賽要考嘅三樣——換算成 100 分制。三個範疇全部定案咗先會公布:少咗一個就當未完成,唔會入排名。對話範疇自由參加,唔計入核心分數。總分涵蓋所有已參加嘅範疇,同樣要等到每一個範疇都定案先會公布——攞一套完整評測完嘅系統同一套只評咗一半嘅嚟排名,係冇意義嘅。

字錯率

CER = (S + D + I) / |reference|

語料層級計算,按參考文本長度加權,而唔係將每段語音嘅錯誤率取平均。兩者出嚟嘅數字唔同:取平均會令一句短句同一通九十秒嘅通話佔一樣嘅份量。逐段數值我哋會保留作診斷用途,但永遠唔會攞嚟做公布數字。

粵語書寫上冇詞與詞之間嘅界線,所以詞錯率喺呢種語言度冇意義,字錯率先係標準。混合錯誤率會將漢字逐字切分、拉丁字母連續段落當一個詞,咁樣聽錯一個英文字只計一個單位,而唔係四個字元——冇呢個處理,中英夾雜嘅語句會被系統性地過度扣分。

親手跑一次計分

下面嘅參考文本係樣本集入面一段真實記錄,已經按計分程式嘅做法折返過。改下面第二格——有你自己系統嘅輸出就直接貼入去——對齊結果會由計分程式本身嘅函式即時重畫。啲字唔會傳去任何地方,全部喺你部機嘅瀏覽器度計。

字錯率
0.0%
混合錯誤率
0.0%
取代
0
漏字
0
多字
0
參考文本長度
40

呢段文字兩個錯誤率一樣——入面冇拉丁字母段落,自然冇分別。

  1. yy
  2. cc
  3. oo
  4. rr
  5. ee
  • 聽啱
  • 聽錯
  • 漏咗
  • 多咗

由量度到分數

score = max(0, min(100, (1 − CER) × 100))

每個範疇有自己嘅單位——錯誤率、1 至 5 分嘅評分——但排行榜只顯示一個數字,所以全部換算落 0 至 100。評分直接對應:1 變 0,5 變 100。錯誤率就要倒轉,因為越低越好:0% 變 100,100% 變 0,中間線性遞減。個下限訂喺一百巴仙,因為咁先係「一個字都保唔住」嘅意思,唔係人揀出嚟嘅門檻。原本係 60%,但用真正嘅辨識器量過呢批錄音之後,成績由 66% 到 100% 唔等——即係全部人都跌到落 0,個範疇分唔開任何人。

呢個下限改過兩次,改動前後嘅數字唔同尺:2026 年 8 月之前係 20%,之後係 60%,用真正嘅辨識器量過呢批錄音之後就定咗喺一百巴仙。每一行公布嘅成績都記低咗計分版本號,要分辨一個數字用邊把尺,就係睇佢。

邊啲由機器判斷,邊啲由人判斷

所有決定資格賽去留嘅數字都係由機器量度。語音辨識用字元錯誤率。語言理解用大型語言模型評審,跟一份公開嘅評分準則,跑幾次並記錄分歧。語音合成係交付佔 60%(有冇回傳音訊、長度啱唔啱、音量正唔正常、有冇爆音、有冇喺限時內)加聲調存活佔 40%:我哋將合成出嚟嘅語音再送入辨識器,睇下六個聲調仲分唔分得開。端到端係首字延遲,同埋被打斷嗰陣識唔識收口。

人手只評兩樣:對話嘅自然度,同語音合成嘅 MOS。呢兩樣係主觀意見,我哋亦都標明佢係意見。一個資格賽嘅參賽者數量可以多過評審聽得晒,所以決定邊個晉級嘅嘢,冇一樣要等人。當一個範疇係用機器量度嘅數字公布,排行榜會喺個數字旁邊寫「機器量度,非人手評分」,唔會俾讀者以為有人坐低聽過。

有一條自動規則值得特別講,因為佢係封頂而唔係計分。如果合成器回傳嘅音訊入面,六個聲調一個都認唔返出嚟,語音合成最多只有 5 分之 3,無論佢交付得幾好。交付只證明音訊個形狀啱,唔證明佢係語音:一段長度合理嘅 180 赫茲正弦波可以通過所有交付檢查,冇咗呢個上限就會喺一個佔核心分數 30% 嘅範疇攞滿分。呢個上限就係「我哋確認唔到呢個係粵語」同「六個聲調全對」之間嘅分別。

正規化規格 v1.3.0

冇公開嘅正規化,係語音辨識評測最大嘅爭議來源。下面呢啲規則就係我哋計分程式入面實際行緊嘅邏輯,並且公開俾參賽者喺本地跑,等雙方由同一批位元組計出同一個數字。

規則標準寫法
字體繁體,而且兩邊係刻意分開處理。你嘅文字稿唔會被折返:寫簡體即係唔同嘅輸出,一樣計錯,測試結果版會顯示嗰部分佔你幾多錯誤。參考稿就會用 OpenCC(cn→hk)折返香港繁體先計分,因為交付嘅參考稿有部分混咗簡體,語料庫本身嘅字體問題唔應該算你頭上。粵語專用字會排除喺呢個折返之外——OpenCC 會改寫吓、晒、搵、戶,反而會破壞佢本來要清理嘅標準答案。
語言每段錄音都係香港粵語。查出係普通話嘅通話會重新標示,並且從所有抽取、下載同公布數字中剔走——唔會用普通話錄音嚟評你。英文會以中英夾雜嘅形式出現,而呢個正正係混合錯誤率嘅用意:聽錯一個英文字只算一個單位,唔係四個字符。
字寬NFKC;全形歸一為半形
大小寫拉丁字母轉細楷
標點中英標點一律移除
空白全部移除
數字中文數字歸一為阿拉伯數字——三百 = 300
貨幣符號同「蚊」「元」一律略去
語氣詞保留。佢哋本身就係說話嘅一部分。
背景人聲唔會轉寫。參考稿只記錄來電者同客服講嘅嘢;電視、收音機或者房入面其他人嘅聲,都唔屬於通話,唔會出現喺標準答案入面。你嘅系統將佢過濾走係啱嘅。

置信區間同名次區間

每個數字都附有一萬次重抽嘅百分位自助抽樣區間,以語音段為單位重抽。95% 區間互相重疊嘅隊伍會歸入同一個名次區間,並列公布。喺雜訊範圍之內硬砌一個先後次序,係虛假嘅精確度,亦係每一個認真嘅評測最終都會被批評嘅地方。

通訊協定

參賽者架設一個 WebSocket 伺服器,由我哋嘅調度程式做客戶端主動連過去。協定版本 v1.2,音訊格式為 pcm_s16le_16k。每段語音嘅限時按長度調整——一段六十秒嘅語音,由講完到第一個回應位元組,容許 30000 毫秒,而且只以我哋自己嘅單調時鐘計算。

呢個限時先係真正嘅防作弊機制。我哋唔會聲稱音訊唔可以被下載——聲音係串流去你嘅程序度,呢種聲稱根本執行唔到。我哋聲稱嘅範圍比較窄,但係真嘅:回應時窗短到人手根本嚟唔切轉寫;每一份語料包都發俾一個具名收件人,並記入稽核紀錄;抽取嘅語音會逐個時段輪換;最終名次會用一批冇人見過嘅保留語料覆核。

我哋唔會喺音訊入面加浮水印,亦唔會咁講。喺波形入面嵌一個逐隊不同嘅訊號,要麼響到會改變被量度嘅嘢,要麼弱到乜都捱唔住;一個靠唔住嘅機制,唔應該當成機制嚟描述。歸屬責任改為靠發放紀錄——因為佢寫住一個人嘅名,所以先執行得到。

對話範疇

其他範疇量度嘅係一個答案。呢個範疇量度嘅係兩句之間嘅行為,所以佢行嘅係另一套協定:我哋會同參賽者嘅連線位址進行三段預設劇本嘅對話,並且計算中間嘅空隙。

延遲,係由我哋講完嗰一刻,去到系統宣布佢開始講嘢嘅第一個訊框為止——唔係去到成句答完,咁樣先至令「將成個答案緩衝完先出聲」冇辦法扮快。我哋計嘅係第 95 百分位數而唔係中位數:一個平時好快、但偶然要三秒嘅系統,用家嘅感受就係慢。低過 300 毫秒分數封頂,因為打電話嘅人分唔出 120 毫秒同 280 毫秒,獎勵呢個差距只會令人去優化一啲冇人感受得到嘅嘢。到 2000 毫秒為零分。

讓出發言權。每段劇本最後都有一個回合,係打電話嘅人喺系統答緊嗰陣插話。我哋量度系統之後仲講咗幾耐,500 毫秒之內停低先當作有讓路。一個又快又唔肯收口嘅系統,比一個慢嘅仲差;一個只量度延遲嘅評測,會將佢排第一。

評分員睇完對話紀錄之後,呢個範疇由 40% 延遲同 60% 人手評定嘅自然度組成。喺未有人手評分之前,會用機器量度嘅分數公布——延遲 50%、讓出發言權 30%、完成回合 20%——而排行榜會標明「機器量度,未經人手評分」,等一個快嘅系統唔會喺未有人核實之前,就被當成傾得好。

輪換同重複曝光

每次正式評測都會喺輪換語料池入面重新隨機抽一批,並且按難度分層抽取,令抽中一堆短語音嘅好運唔會幫到隻系統。抽取用嘅種子值按時段設定並且記錄低,所以任何一次評測都可以完整重現。

不過重複評測始終會累積曝光,而條數唔好睇:語料池得 56 段、每次抽 30 段,一隊用晒配額嘅隊伍,其實已經見過語料池大部分內容。所以語料池會逐屆增加,而最終名次亦會用 11 段從來冇發放俾任何參賽者嘅保留語料嚟覆核。

呢個評測嘅位置

粵語語音評測並唔係一片空白,任何話呢個係「首個粵語基準」嘅講法都唔真確。喺呢個之前,已經有幾套測試集:

WSYue-eval
隨 WenetSpeech-Yue(21,800 小時粵語語料)一齊發布,同時涵蓋語音辨識(長短句、語碼轉換、不同錄音環境)同語音合成。
MDCC
多領域粵語語料庫,收錄朗讀同自然對話,係一套成熟嘅測試集。
Common Voice zh-HK
眾包錄製,廣泛用作語音辨識嘅基準。
HKCanto-Eval
評測粵語語言理解同文化常識。
CantoNLU
粵語自然語言理解任務。

呢度真正新嘅嘢範圍窄啲,但我哋認為更有用:

真實企業通話錄音
經同意使用嘅香港保險客服中心錄音,帶住猶豫、插嘴同開放式辦公室嘅背景聲。朗讀語音係另一個問題,喺嗰邊做得好,唔代表喺呢邊做得好。
評測實際服務,而唔係模型權重
現有嘅測試集評測模型。呢個評測嘅係企業真正買得到嘅服務,經由我哋主動連去佢哋自己運行嘅伺服器。
端到端對話
延遲、輪流講嘢同讓出話語權,全部用我哋自己嘅計時器量度。現時冇任何一套粵語測試集涵蓋呢一項。

因為一個數字孤立咁睇冇意義,參賽隊伍會同時喺 WSYue-ASR-eval 上做交叉對照,兩個數字一齊公布。喺呢度 12% 字錯率、喺 WSYue 6%,讀者就即刻知道呢批語音有幾難;任何一個數字單獨睇,都話唔到你知。