評測方法
呢一頁決定咗啲數字有冇價值。每個指標、佢嘅公式,同埋計分之前所做嘅正規化,全部寫喺度——而且逐項附上佢喺2026-1實際計出嚟嘅結果。
| 範疇 | 比重 | 是否必須 |
|---|---|---|
| ASR — CER 70% + MER 30% | 20% | 基本 |
| LLM — judge 50% + extraction 50% | 25% | 基本 |
| TTS — MOS, CoMOS, SIM, loop-back, stability | 30% | 自選 |
| E2E — TTFB 40% + naturalness 60% | 25% | 自選 |
核心分數係語音辨識加語言理解,換算成 100 分制,所以每隊都有一個。總分涵蓋所有已參加嘅範疇,而且要等到每一個範疇都定案先會公布——攞一套完整評測完嘅系統同一套只評咗一半嘅嚟排名,係冇意義嘅。
CER = (S + D + I) / |reference|
以語料層級計算,按參考文本長度加權,而唔係將每段語音嘅錯誤率取平均。兩者出嚟嘅數字唔同:取平均會令一句短句同一通九十秒嘅通話佔一樣嘅份量。逐段數值我哋會保留作診斷用途,但永遠唔會攞嚟做公布數字。
粵語書寫上冇詞與詞之間嘅界線,所以詞錯率喺呢種語言度冇意義,字錯率先係標準。混合錯誤率會將漢字逐字切分、拉丁字母連續段落當一個詞,咁樣聽錯一個英文字只計一個單位,而唔係四個字元——冇呢個處理,中英夾雜嘅語句會被系統性地過度扣分。
冇公開嘅正規化,係語音辨識評測最大嘅爭議來源。下面呢啲規則就係我哋計分程式入面實際行緊嘅邏輯,並且公開俾參賽者喺本地跑,等雙方由同一批位元組計出同一個數字。
| 規則 | 標準寫法 |
|---|---|
| 字體 | 正體字。簡體字唔會歸一——佢係另一個輸出。 |
| 字寬 | NFKC;全形歸一為半形 |
| 大小寫 | 拉丁字母轉細楷 |
| 標點 | 中英標點一律移除 |
| 空白 | 全部移除 |
| 數字 | 中文數字歸一為阿拉伯數字——三百 = 300 |
| 貨幣 | 符號同「蚊」「元」一律略去 |
| 語氣詞 | 保留。佢哋本身就係說話嘅一部分。 |
每個數字都附有一萬次重抽嘅百分位自助抽樣區間,以語音段為單位重抽。95% 區間互相重疊嘅隊伍會歸入同一個名次區間,並列公布。喺雜訊範圍之內硬砌一個先後次序,係虛假嘅精確度,亦係每一個認真嘅評測最終都會被批評嘅地方。
參賽者架設一個 WebSocket 伺服器,由我哋嘅調度程式做客戶端主動連過去。協定版本 v1.1,音訊格式為 pcm_s16le_16k。每段語音嘅限時按長度調整——一段六十秒嘅語音,由講完到第一個回應位元組,容許 30000 毫秒,而且只以我哋自己嘅單調時鐘計算。
呢個限時先係真正嘅防作弊機制。我哋唔會聲稱音訊唔可以被下載——聲音係串流去你嘅程序度,呢種聲稱根本執行唔到。我哋聲稱嘅範圍比較窄,但係真嘅:回應時窗短到人手根本嚟唔切轉寫;每一份語料包都發俾一個具名收件人,並記入稽核紀錄;抽取嘅語音會逐個時段輪換;最終名次會用一批冇人見過嘅保留語料覆核。
我哋唔會喺音訊入面加浮水印,亦唔會咁講。喺波形入面嵌一個逐隊不同嘅訊號,要麼響到會改變被量度嘅嘢,要麼弱到乜都捱唔住;一個靠唔住嘅機制,唔應該當成機制嚟描述。歸屬責任改為靠發放紀錄——因為佢寫住一個人嘅名,所以先執行得到。
其他範疇量度嘅係一個答案。呢個範疇量度嘅係兩句之間嘅行為,所以佢行嘅係另一套協定:我哋會同參賽者嘅連線位址進行三段預設劇本嘅對話,並且計算中間嘅空隙。
延遲,係由我哋講完嗰一刻,去到系統宣布佢開始講嘢嘅第一個訊框為止——唔係去到成句答完,咁樣先至令「將成個答案緩衝完先出聲」冇辦法扮快。我哋計嘅係第 95 百分位數而唔係中位數:一個平時好快、但偶然要三秒嘅系統,用家嘅感受就係慢。低過 300 毫秒分數封頂,因為打電話嘅人分唔出 120 毫秒同 280 毫秒,獎勵呢個差距只會令人去優化一啲冇人感受得到嘅嘢。到 2000 毫秒為零分。
讓出發言權。每段劇本最後都有一個回合,係打電話嘅人喺系統答緊嗰陣插話。我哋量度系統之後仲講咗幾耐,500 毫秒之內停低先當作有讓路。一個又快又唔肯收口嘅系統,比一個慢嘅仲差;一個只量度延遲嘅評測,會將佢排第一。
呢個範疇由 40% 延遲同 60% 人手評定嘅自然度組成。延遲一量度到就會公布;範疇總分要等評分員睇完對話紀錄先出,等一個快嘅系統唔會喺未有人核實之前,就被當成傾得好。
每次正式評測都會喺輪換語料池入面重新隨機抽一批,並且按難度分層抽取,令抽中一堆短語音嘅好運唔會幫到隻系統。抽取用嘅種子值按時段設定並且記錄低,所以任何一次評測都可以完整重現。
不過重複評測始終會累積曝光,而條數唔好睇:語料池得 55 段、每次抽 30 段,一隊用晒配額嘅隊伍,其實已經見過語料池大部分內容。所以語料池會逐屆增加,而最終名次亦會用 12 段從來冇發放俾任何參賽者嘅保留語料嚟覆核。