Cantonese Voice Benchmark粵語語音基準
EN繁中

常見問題

直接答你。

參加

係咪一定要有齊成套語音系統?
想排到名就要。核心分數係語音辨識、語言理解同語音合成三個範疇,換算成 100 分制;三個全部定案咗先會公布,所以少咗一個嘅參賽者會標示為未完成,唔會入排名——用三分之一嘅工作量嚟平均出一個分數,同做齊嘅隊伍放埋一齊排,係唔公平嘅。對話範疇自由參加,計入總分。你當然可以只參加部分範疇:每個範疇都會獨立公布,辨識做得好嘅系統唔會因為冇語音合成而被埋沒。至於某一輪按邊幾個範疇排名,回合開放期間會喺每個範疇頁寫明。
我有帳戶喇,仲差乜先可以做正式評分?
一步:喺 portal 提交你嘅申請,寫低你參加邊幾個範疇、做咗啲乜。一提交就即刻批核——主辦方開帳戶畀你嗰一步已經係審核——之後回合開放期間,嗰幾個範疇就可以做正式評分。喺咁之前已經可以練習。
係咪一定要寫系統說明?
係,喺成績定案之前要交——一至兩頁,喺 portal 度按住六條問題寫。核心分數唔受影響;總分會扣起直到收到為止,而排行榜會直接講明係等緊呢份嘢,唔會令你自己估。

技術對接

語音辨識要唔要分說話者?重疊說話同懶音又點處理?
唔使分。transcript 訊框得一個文字欄位,冇說話者欄位;答案稿本身記錄雙方嘅說話,但冇任何標記——所以唔好加「客戶:」「Agent:」:正規化只會刪走冒號,唔會刪個詞,標記會當多出嚟嘅字計錯。音檔係單聲道,通話雙方混埋喺同一條聲道;雙方講嘅嘢全部轉寫,照講嘢次序排,重疊嗰段兩個人講嘅都要寫——漏咗嘅當刪除計,而結果頁嘅「字對、位置錯」會話你知次序令你損失咗幾多。寫嘅係詞,唔係讀音:繁體字、香港用法、口語照口語寫(佢、嘅、咗),懶音唔會改變寫法——「你」讀成 lei 仍然寫「你」。「呃」「嗯」呢啲語氣詞都係說話,會計分。
理解範疇需唔需要保險公司嘅內部 SOP 或者知識庫?
主辦方唔會提供,而且答任何一題都唔需要保險公司嘅內部規則。你個系統點砌係你嘅自由:用公開嘅保險資料(產品頁、公開流程、一般香港保險做法)砌 RAG 或者做 fine-tune,係容許嘅,對術語同語體通常都有幫助。唯一嘅訓練限制係評測音檔本身:唔可以攞去訓練、轉發或者公開。外部資料補唔到嘅,係嗰通電話本身嘅事實:呢位客戶嘅結餘、呢張保單嘅狀態、呢通電話最後傾成點。呢啲要喺錄音度攞,我哋亦唔會提供、冇 sandbox 畀你查——如果一個事實唔喺通話入面,評分嗰邊一樣冇。評審收到嘅係同你一樣嘅 task、嗰通電話經核實嘅逐字稿,同埋主辦方就嗰通電話記低嘅重點事實;「保單準確度」問嘅係你引用嗰陣同通話所確立嘅內容啱唔啱,唔係你知唔知某條內部規則。通話入面講唔清楚嘅嘢,攞到分嘅答法係:講返通話支持到嘅嘢,講明邊啲確認唔到,再畀下一步。
接駁大概要幾耐?
語音辨識大概兩三個鐘,成套做齊大約一日。你架設一個 WebSocket 伺服器,由我哋連過去。登記咗個網址之後,portal 會用三段真實語音幫你做一次連線測試,有任何問題都會畀返一個睇得明嘅診斷,等你係喺我哋度知道,而唔係喺正式評測度先知道。
點解要連我個伺服器,而唔係收個檔案就算?
因為延遲同輪流講嘢係冇辦法喺一個檔案度量度到,而呢兩樣佔咗總分四分之一。上載檔案嘅方式作為後備仍然存在,但只計語音辨識,並且會喺排行榜上標明。單靠上載唔會有核心分數:核心分數仲需要語言理解同語音合成,而呢兩樣只可以經連線量度。
如果我個伺服器喺評測途中死咗會點?
該次測試會標示為「資料不足」,而唔係一個差分數,亦唔會用掉你嘅配額。屬於我哋責任嘅失敗會歸咎於我哋,並且免費重跑。一個連唔到嘅伺服器永遠唔會公布成 100% 錯誤率,因為咁樣係就你個系統講咗一件唔真確嘅事。
我可唔可以睇到自己邊幾段錯咗?
練習測試可以,仲會同時顯示標準答案同你嘅輸出。正式評測就只會見到逐段嘅狀態同你自己嘅回覆,唔會見到標準答案。

成績點運作

做完一次正式評測,係咪自動計分?
唔係。一次正式評測喺你喺該次測試嘅頁面撳「遞交」之前,只係草稿:淨係你自己睇到,唔會上排行榜,亦唔會入排名。冇人會幫你遞交,而且回合一截止就再遞交唔到。排行榜每個範疇顯示你最後遞交嗰次,所以跑得差嗰次唔交,對你冇任何影響——你嘅 portal 亦會列出邊個範疇仲有測試未遞交。
語言理解範疇由邊個評分?
兩個 Amazon Nova 模型——Pro 同 Lite——各自將每個答案評三次,對住公開嘅評分錨點,temperature 設為 0。取中位數,保留每次之間嘅分歧幅度;兩個模型相差超過一個評分點嘅項目會標示為有爭議,而唔係夾埋平均。喺叫任何模型之前,會先用一個確定嘅檢查將照抄來電嘅回覆壓到最低分——「呢個回覆係咪就係段來電」係一條有確定答案嘅字串問題,而模型喺短來電上面會判斷錯。兩個模型都係同一間廠商,所以呢個做法係避開單一模型嘅偏好,而唔係避開單一廠商;兩個唔同廠商仍然係目標,未做到之前呢版都會照講。揀呢兩個模型係量度出嚟嘅結果,唔係偏好:喺五段隨機抽出嚟嘅真實錄音上面,真正嘅答案都排喺照抄、原文重複同埋唔答之上,而用頂級模型做同一份工要貴二十倍。喺 2026 年 9 月 8 日之前,呢個範疇係用一個字詞重疊嘅評分方法。佢錯得好值得講清楚:喺一通真實來電上量度,一個正確嘅粵語答案得 1.41 分(滿分 5),而將來電頭 30% 原文照抄返去就有 4.97 分。佢出過嘅分數已經全部作廢。冇模型憑證嘅部署根本唔會評推理回合,唔會退返去用嗰個方法。無論點樣,呢個範疇計分之前都會同人手評審做驗證。
語音合成由邊個評分?
有薪嘅粵語母語聽眾,而且要先通過一套校準題。佢哋唔會知道邊個系統做嘅樣本,播放次序隨機,而且要段音真係播完咗,個評分先會被接受。
我會唔會被公開名字?
你自己揀先會。預設用代號,具名係自願,喺成績公布之前隨時可以改返。公布之後,具名嘅隊伍仍然可以要求主辦方改返代號,而呢個改動會有紀錄。
點解有三隊並列第二?
因為佢哋嘅置信區間互相重疊。三十段語音之下,零點幾個百分點嘅差距只係雜訊,硬要排出先後就係假精確。並列即係我哋分唔出高下,而老實講出嚟,比虛構一個贏家有用。

語料

我可唔可以攞啲數據去訓練?
唔可以。本屆期間你可以用嚟產生提交結果,而本屆結束之後三十日內要刪除所有副本。

有嘢喺呢度搵唔到答案?聯絡我哋