語料說明
香港保險業嘅真實通話,唔係朗讀語音。呢一頁完整交代成套語料;聲音本身要開咗戶口先攞得到,而點解要咁做,呢一頁一樣有講。
| 分組 | 段數 | 用途 | 取用方式 |
|---|---|---|---|
| 練習集 | 8 | 系統對接同練習 | 登入後可取,附標準答案 |
| 輪換語料池 | 56 | 正式時段,每次測試抽取 | 只喺時段內串流傳送 |
| 保留集 | 11 | 最終驗證 | 最後一次測試之前從未見過 |
難度分為容易、普通、困難三層,每次抽取都保持同一個比例。如果純粹隨機抽,可能一次抽到十五段困難嘅、下一次只抽到五段,咁樣兩個分數之間、同其他隊伍之間,都冇得比較。
每一段都係真實通話錄音,唔係讀稿:customer service 105 段。
三十秒到三分鐘嘅香港粵語。密集嘅中英夾雜、保險同醫療詞彙、逐個數字唸出嚟嘅保單號碼同索償金額、背景雜音、幾個人同時講嘢,以及好多時情緒激動嘅來電者。參考文字稿係連同錄音一齊交付,喺用嚟評任何人之前都會經過篩查。每份參考稿喺計分前都會折返香港繁體,令我哋自己嘅字體問題唔會計你錯;你嘅文字稿唔會被折返,所以寫咗簡體一樣照計錯,而測試結果版會顯示嗰部分佔幾多。每段錄音都會同佢自己嘅參考稿核對:查出係普通話嘅通話會從所有抽取中剔走;如果一份參考稿嘅句子次序同錄音對唔上,就會扣起,等有人親自聽過先算;任何一項檢查都判斷唔到嘅語音,一樣會扣起。每通電話嘅關鍵事實另外記錄,令資料抽取都可以評分。
將名同保單號碼從錄音入面移走,並唔等於去識別化。聲音本身係生物特徵識別資料;根據香港《個人資料(私隱)條例》,聲紋無論講咗啲乜,都係關於該名說話者嘅個人資料。將真實客戶嘅聲音做成一個匿名、永久、公開嘅下載,同一個受控嘅評測,喺性質上係兩回事。
所以每一段真實語音都只會發放畀一位已接受條款、身分明確嘅收件人。申請會喺一個工作天內處理,而對任何有真實系統嘅團隊嚟講,批核只係手續。如果日後我哋要公開一份可供引用嘅永久語料,嗰份會係由配音員錄製,而唔係來自客戶通話。
講清楚呢啲,本身就係語料說明嘅一部分,唔係擺喺最尾嘅免責聲明。呢套語料只涵蓋香港粵語,並不代表廣東或者海外嘅粵語變體。語料來自單一一間保險公司,所以詞彙會偏向嗰間公司嘅業務。模擬錄音係演出嚟嘅,而演員做唔出真正情緒激動嘅來電者嗰種不流暢。說話者嘅背景分布,就係打過嚟嗰批人嘅分布,並唔係一個平衡樣本。
語料池亦都仲細過佢最終應有嘅規模。以目前輪換池 56 段、每次抽 30, 100%。喺各個時段之間持續擴充語料池,先至令分數保持係一個量度,而唔係一個記憶測驗。
喺一次執行可以抽到嘅 105 段錄音,每一段嘅標準答案都係由人一邊聽電話一邊寫低,亦都喺我哋呢邊對住佢自己嘅音檔確認過。做呢輪確認嘅時候,同時搵到並改正咗當中嘅問題——簡體字,以及本身講緊普通話而唔係廣東話嘅通話。