評測方法
呢一頁決定咗啲數字有冇價值。每個指標、佢嘅公式,同埋計分之前所做嘅正規化,全部寫喺度——而且逐項附上佢喺2026-1實際計出嚟嘅結果。
| 範疇 | 比重 | 是否必須 |
|---|---|---|
| 語音辨識 — 字元錯誤率 | 20% | 所有隊伍必考 |
| 語言理解 — 評審準則,兩個模型 | 25% | 所有隊伍必考 |
| 語音合成 — 交付 60% + 聲調存活 40%,未有 MOS 之前 | 30% | 所有隊伍必考 |
| 端到端 — 延遲 50% + 讓路 30% + 完成率 20%,未有人手評分之前 | 25% | 自由參加 |
核心分數係語音辨識、語言理解同語音合成——聽得到、理解到、講得出,即係呢個比賽要考嘅三樣——換算成 100 分制。三個範疇全部定案咗先會公布:少咗一個就當未完成,唔會入排名。對話範疇自由參加,唔計入核心分數。總分涵蓋所有已參加嘅範疇,同樣要等到每一個範疇都定案先會公布——攞一套完整評測完嘅系統同一套只評咗一半嘅嚟排名,係冇意義嘅。
CER = (S + D + I) / |reference|
以語料層級計算,按參考文本長度加權,而唔係將每段語音嘅錯誤率取平均。兩者出嚟嘅數字唔同:取平均會令一句短句同一通九十秒嘅通話佔一樣嘅份量。逐段數值我哋會保留作診斷用途,但永遠唔會攞嚟做公布數字。
粵語書寫上冇詞與詞之間嘅界線,所以詞錯率喺呢種語言度冇意義,字錯率先係標準。混合錯誤率會將漢字逐字切分、拉丁字母連續段落當一個詞,咁樣聽錯一個英文字只計一個單位,而唔係四個字元——冇呢個處理,中英夾雜嘅語句會被系統性地過度扣分。
下面嘅參考文本係樣本集入面一段真實記錄,已經按計分程式嘅做法折返過。改下面第二格——有你自己系統嘅輸出就直接貼入去——對齊結果會由計分程式本身嘅函式即時重畫。啲字唔會傳去任何地方,全部喺你部機嘅瀏覽器度計。
呢段文字兩個錯誤率一樣——入面冇拉丁字母段落,自然冇分別。
score = max(0, min(100, (1 − CER) × 100))
每個範疇有自己嘅單位——錯誤率、1 至 5 分嘅評分——但排行榜只顯示一個數字,所以全部換算落 0 至 100。評分直接對應:1 變 0,5 變 100。錯誤率就要倒轉,因為越低越好:0% 變 100,100% 變 0,中間線性遞減。個下限訂喺一百巴仙,因為咁先係「一個字都保唔住」嘅意思,唔係人揀出嚟嘅門檻。原本係 60%,但用真正嘅辨識器量過呢批錄音之後,成績由 66% 到 100% 唔等——即係全部人都跌到落 0,個範疇分唔開任何人。
呢個下限改過兩次,改動前後嘅數字唔同尺:2026 年 8 月之前係 20%,之後係 60%,用真正嘅辨識器量過呢批錄音之後就定咗喺一百巴仙。每一行公布嘅成績都記低咗計分版本號,要分辨一個數字用邊把尺,就係睇佢。
所有決定資格賽去留嘅數字都係由機器量度。語音辨識用字元錯誤率。語言理解用大型語言模型評審,跟一份公開嘅評分準則,跑幾次並記錄分歧。語音合成係交付佔 60%(有冇回傳音訊、長度啱唔啱、音量正唔正常、有冇爆音、有冇喺限時內)加聲調存活佔 40%:我哋將合成出嚟嘅語音再送入辨識器,睇下六個聲調仲分唔分得開。端到端係首字延遲,同埋被打斷嗰陣識唔識收口。
人手只評兩樣:對話嘅自然度,同語音合成嘅 MOS。呢兩樣係主觀意見,我哋亦都標明佢係意見。一個資格賽嘅參賽者數量可以多過評審聽得晒,所以決定邊個晉級嘅嘢,冇一樣要等人。當一個範疇係用機器量度嘅數字公布,排行榜會喺個數字旁邊寫「機器量度,非人手評分」,唔會俾讀者以為有人坐低聽過。
有一條自動規則值得特別講,因為佢係封頂而唔係計分。如果合成器回傳嘅音訊入面,六個聲調一個都認唔返出嚟,語音合成最多只有 5 分之 3,無論佢交付得幾好。交付只證明音訊個形狀啱,唔證明佢係語音:一段長度合理嘅 180 赫茲正弦波可以通過所有交付檢查,冇咗呢個上限就會喺一個佔核心分數 30% 嘅範疇攞滿分。呢個上限就係「我哋確認唔到呢個係粵語」同「六個聲調全對」之間嘅分別。
冇公開嘅正規化,係語音辨識評測最大嘅爭議來源。下面呢啲規則就係我哋計分程式入面實際行緊嘅邏輯,並且公開俾參賽者喺本地跑,等雙方由同一批位元組計出同一個數字。
| 規則 | 標準寫法 |
|---|---|
| 字體 | 繁體,而且兩邊係刻意分開處理。你嘅文字稿唔會被折返:寫簡體即係唔同嘅輸出,一樣計錯,測試結果版會顯示嗰部分佔你幾多錯誤。參考稿就會用 OpenCC(cn→hk)折返香港繁體先計分,因為交付嘅參考稿有部分混咗簡體,語料庫本身嘅字體問題唔應該算你頭上。粵語專用字會排除喺呢個折返之外——OpenCC 會改寫吓、晒、搵、戶,反而會破壞佢本來要清理嘅標準答案。 |
| 語言 | 每段錄音都係香港粵語。查出係普通話嘅通話會重新標示,並且從所有抽取、下載同公布數字中剔走——唔會用普通話錄音嚟評你。英文會以中英夾雜嘅形式出現,而呢個正正係混合錯誤率嘅用意:聽錯一個英文字只算一個單位,唔係四個字符。 |
| 字寬 | NFKC;全形歸一為半形 |
| 大小寫 | 拉丁字母轉細楷 |
| 標點 | 中英標點一律移除 |
| 空白 | 全部移除 |
| 數字 | 中文數字歸一為阿拉伯數字——三百 = 300 |
| 貨幣 | 符號同「蚊」「元」一律略去 |
| 語氣詞 | 保留。佢哋本身就係說話嘅一部分。 |
| 背景人聲 | 唔會轉寫。參考稿只記錄來電者同客服講嘅嘢;電視、收音機或者房入面其他人嘅聲,都唔屬於通話,唔會出現喺標準答案入面。你嘅系統將佢過濾走係啱嘅。 |
每個數字都附有一萬次重抽嘅百分位自助抽樣區間,以語音段為單位重抽。95% 區間互相重疊嘅隊伍會歸入同一個名次區間,並列公布。喺雜訊範圍之內硬砌一個先後次序,係虛假嘅精確度,亦係每一個認真嘅評測最終都會被批評嘅地方。
參賽者架設一個 WebSocket 伺服器,由我哋嘅調度程式做客戶端主動連過去。協定版本 v1.2,音訊格式為 pcm_s16le_16k。每段語音嘅限時按長度調整——一段六十秒嘅語音,由講完到第一個回應位元組,容許 30000 毫秒,而且只以我哋自己嘅單調時鐘計算。
呢個限時先係真正嘅防作弊機制。我哋唔會聲稱音訊唔可以被下載——聲音係串流去你嘅程序度,呢種聲稱根本執行唔到。我哋聲稱嘅範圍比較窄,但係真嘅:回應時窗短到人手根本嚟唔切轉寫;每一份語料包都發俾一個具名收件人,並記入稽核紀錄;抽取嘅語音會逐個時段輪換;最終名次會用一批冇人見過嘅保留語料覆核。
我哋唔會喺音訊入面加浮水印,亦唔會咁講。喺波形入面嵌一個逐隊不同嘅訊號,要麼響到會改變被量度嘅嘢,要麼弱到乜都捱唔住;一個靠唔住嘅機制,唔應該當成機制嚟描述。歸屬責任改為靠發放紀錄——因為佢寫住一個人嘅名,所以先執行得到。
其他範疇量度嘅係一個答案。呢個範疇量度嘅係兩句之間嘅行為,所以佢行嘅係另一套協定:我哋會同參賽者嘅連線位址進行三段預設劇本嘅對話,並且計算中間嘅空隙。
延遲,係由我哋講完嗰一刻,去到系統宣布佢開始講嘢嘅第一個訊框為止——唔係去到成句答完,咁樣先至令「將成個答案緩衝完先出聲」冇辦法扮快。我哋計嘅係第 95 百分位數而唔係中位數:一個平時好快、但偶然要三秒嘅系統,用家嘅感受就係慢。低過 300 毫秒分數封頂,因為打電話嘅人分唔出 120 毫秒同 280 毫秒,獎勵呢個差距只會令人去優化一啲冇人感受得到嘅嘢。到 2000 毫秒為零分。
讓出發言權。每段劇本最後都有一個回合,係打電話嘅人喺系統答緊嗰陣插話。我哋量度系統之後仲講咗幾耐,500 毫秒之內停低先當作有讓路。一個又快又唔肯收口嘅系統,比一個慢嘅仲差;一個只量度延遲嘅評測,會將佢排第一。
評分員睇完對話紀錄之後,呢個範疇由 40% 延遲同 60% 人手評定嘅自然度組成。喺未有人手評分之前,會用機器量度嘅分數公布——延遲 50%、讓出發言權 30%、完成回合 20%——而排行榜會標明「機器量度,未經人手評分」,等一個快嘅系統唔會喺未有人核實之前,就被當成傾得好。
每次正式評測都會喺輪換語料池入面重新隨機抽一批,並且按難度分層抽取,令抽中一堆短語音嘅好運唔會幫到隻系統。抽取用嘅種子值按時段設定並且記錄低,所以任何一次評測都可以完整重現。
不過重複評測始終會累積曝光,而條數唔好睇:語料池得 56 段、每次抽 30 段,一隊用晒配額嘅隊伍,其實已經見過語料池大部分內容。所以語料池會逐屆增加,而最終名次亦會用 11 段從來冇發放俾任何參賽者嘅保留語料嚟覆核。
粵語語音評測並唔係一片空白,任何話呢個係「首個粵語基準」嘅講法都唔真確。喺呢個之前,已經有幾套測試集:
呢度真正新嘅嘢範圍窄啲,但我哋認為更有用:
因為一個數字孤立咁睇冇意義,參賽隊伍會同時喺 WSYue-ASR-eval 上做交叉對照,兩個數字一齊公布。喺呢度 12% 字錯率、喺 WSYue 6%,讀者就即刻知道呢批語音有幾難;任何一個數字單獨睇,都話唔到你知。