粵語語音基準 2026.1
由公開排行榜到成績公佈,一隊參賽者會經歷嘅每一步,按你實際會遇到嘅次序排。呢版嘅數字係打開嗰刻即時由平台讀出嚟,所以日期、權重同次數,就係現行嗰啲。
一個檔案:評測乜、兩個回合嘅日期、分數點計,以及成套通訊協定同一個跑得起嘅伺服器。邊度都開得,一鍵印成 PDF。
十五幅平台實際畫面,喺2026年9月2日影低,適合演示多過閱讀。之後改過嘅畫面,以上面嘅文字為準,唔係以檔案為準。
未登入都睇得到嘅嘢——除咗錄音本身,成個評測都喺度。
評測嘅係實際投入服務嘅粵語語音系統,用真實香港保險通話,唔係朗讀語音。四個範疇、一個總分,每個公佈嘅數字都附上不確定範圍。冇公開報名——帳戶由主辦方開,因為喺陌生人同真實客戶錄音之間,就只有一個帳戶。
睇呢度四張範疇卡。每張都連去嗰個範疇嘅計分方法。
每個公佈嘅數字都帶住信賴區間;區間有重疊嘅參賽者會列為打成平手,而唔係分先後。一次抽 30 段錄音,零點幾個百分點只係雜訊,而一個將雜訊排名嘅榜,只會誤導人。
睇呢度Core 同 Full,再加難度篩選:同一批隊伍,三個誠實嘅角度。
四條問題,各有權重。轉寫得再準,漏咗保單號碼就係冇理解到;聲調一平,「買」就變咗「賣」,喺保險通話度呢個唔係小事;而對話係唯一一個停頓本身就係產品嘅範疇,所以只有嗰度會獎勵低延遲。你想參加幾多個範疇都得。
| 範疇 | 權重 | 問乜 | 邊個要跑 |
|---|---|---|---|
| 語音辨識 ASR | 20% | 聽唔聽得到? | 所有參賽者 |
| 語言理解 LLM | 25% | 答唔答得到? | 所有參賽者 |
| 語音合成 TTS | 30% | 講唔講得出? | 所有參賽者 |
| 對話 E2E | 25% | 傾唔傾得掂? | 可選 |
睇呢度權重,同埋呢個範疇會唔會左右晉級,一開頭就講明。
成套方法都公開:錄音點抽、區間點計、乜嘢會保留唔公開同點解。方法頁有個計分器你可以自己打字入去,計返同我哋一樣嘅數。一個冇人查得到嘅評測,就只係一篇新聞稿。
睇呢度嗰個實例——一次執行就係咁變成一個區間。
由第一次登入,到我哋連得到你個系統。呢啲全部都唔使用正式評分次數。
一版就答兩條問題:我下一步要做乜,同埋我而家企喺邊。「下一步」會跟住你嘅進度郁,永遠唔會吉——要自己估下一步嘅隊伍,最後都係要開支援單。
睇呢度Now 版最頂嗰個「下一步」。
你行一個 WebSocket 伺服器,我哋連過去。登記個網址,再跑連線測試——三段真實錄音、大約十秒,有咩唔掂會有一句睇得明嘅診斷。入門包係一個跑得起嘅 Python 同 Node 伺服器,所以第一個綠剔係幾分鐘嘅事,唔使成個下晝。
睇呢度四個端點同佢哋嘅狀態。一個 socket 可以應付四個。
8 段錄音,連正確嘅參考稿,一行一個講嘢回合咁排。撳時間標記就跳到嗰度,貼返你自己嘅結果,逐個字睇差異。啲錄音係真實客戶通話,所以永遠唔會離開平台——而呢啲全部都唔使用正式評分次數。
睇呢度練習次數不限。只有正式評分先會用次數。
由有帳戶到可以做正式評分,中間就只有呢一步。
一次正式評分要用幾多、話到你知乜,同埋幾時會公開。
一個回合每個範疇有 3 次正式評分,每次抽 30 段錄音。練習照樣不限。因為我哋平台壞咗而失敗嘅執行唔會計你數,亦唔會用次數;但第一段錄音已經傳咗出去之後你先停,就會計用咗一次。
睇呢度你打算跑嗰個範疇隔籬,仲剩幾多次。
一次做完嘅執行會報出字元錯誤率同佢嘅區間、回應時間,仲有啲錯誤實際係由乜組成——聽錯、寫咗簡體、用普通話答,係三個唔同嘅問題,三個唔同嘅修法。
睇呢度大數字下面嗰個分項。嗰度先係你改得到嘅嘢。
你未交之前,除咗你冇人睇到個數字。交咗係將呢啲錄音加入你嘅成績,唔係取代——所有交咗嘅錄音一齊計分,所以多做幾次係收窄個區間,唔係令個數字浮上浮落。交咗就唔可以收返:揀返最好彩嗰次執行,係冇嘢賺到嘅。
睇呢度交之前,會話你知你嘅成績會變成點。
你嘅 Core Score 同每個範疇,同公開排行榜上面嘅一模一樣。你交咗,啲數字先會郁。資格賽 2026年9月30日 截止;網上挑戰賽由 2026年10月12日 到 2026年10月26日。
睇呢度呢啲就係公佈嘅數字,你嘅成績可以下載做 CSV。
有問題嗰陣可以行嘅每一條路,同埋各自要幾耐。揀最快嗰條,唔使揀最有禮貌嗰條。
次數、截止時間、乜嘢會令參賽資格終止、點樣上訴——全部喺回合開始之前就寫好,唔係等到有人投訴先寫。可以用外部託管嘅 API,但要申報。喺正式評分入面有人手參與而唔講,係唯一一項會即刻終止參賽資格嘅事。
睇呢度晉級線嘅規則:喺線上打成平手,成個平手區間一齊入。
一句你睇唔明嘅錯誤訊息或者指示,係我哋寫得差,唔係你應該識答嘅問題。話我哋知,我哋改返版。