- 語音辨識要唔要分說話者?重疊說話同懶音又點處理?
- 唔使分。transcript 訊框得一個文字欄位,冇說話者欄位;答案稿本身記錄雙方嘅說話,但冇任何標記——所以唔好加「客戶:」「Agent:」:正規化只會刪走冒號,唔會刪個詞,標記會當多出嚟嘅字計錯。音檔係單聲道,通話雙方混埋喺同一條聲道;雙方講嘅嘢全部轉寫,照講嘢次序排,重疊嗰段兩個人講嘅都要寫——漏咗嘅當刪除計,而結果頁嘅「字對、位置錯」會話你知次序令你損失咗幾多。寫嘅係詞,唔係讀音:繁體字、香港用法、口語照口語寫(佢、嘅、咗),懶音唔會改變寫法——「你」讀成 lei 仍然寫「你」。「呃」「嗯」呢啲語氣詞都係說話,會計分。
- 理解範疇需唔需要保險公司嘅內部 SOP 或者知識庫?
- 主辦方唔會提供,而且答任何一題都唔需要保險公司嘅內部規則。你個系統點砌係你嘅自由:用公開嘅保險資料(產品頁、公開流程、一般香港保險做法)砌 RAG 或者做 fine-tune,係容許嘅,對術語同語體通常都有幫助。唯一嘅訓練限制係評測音檔本身:唔可以攞去訓練、轉發或者公開。外部資料補唔到嘅,係嗰通電話本身嘅事實:呢位客戶嘅結餘、呢張保單嘅狀態、呢通電話最後傾成點。呢啲要喺錄音度攞,我哋亦唔會提供、冇 sandbox 畀你查——如果一個事實唔喺通話入面,評分嗰邊一樣冇。評審收到嘅係同你一樣嘅 task、嗰通電話經核實嘅逐字稿,同埋主辦方就嗰通電話記低嘅重點事實;「保單準確度」問嘅係你引用嗰陣同通話所確立嘅內容啱唔啱,唔係你知唔知某條內部規則。通話入面講唔清楚嘅嘢,攞到分嘅答法係:講返通話支持到嘅嘢,講明邊啲確認唔到,再畀下一步。
- 接駁大概要幾耐?
- 語音辨識大概兩三個鐘,成套做齊大約一日。你架設一個 WebSocket 伺服器,由我哋連過去。登記咗個網址之後,portal 會用三段真實語音幫你做一次連線測試,有任何問題都會畀返一個睇得明嘅診斷,等你係喺我哋度知道,而唔係喺正式評測度先知道。
- 點解要連我個伺服器,而唔係收個檔案就算?
- 因為延遲同輪流講嘢係冇辦法喺一個檔案度量度到,而呢兩樣佔咗總分四分之一。上載檔案嘅方式作為後備仍然存在,但只計語音辨識,並且會喺排行榜上標明。單靠上載唔會有核心分數:核心分數仲需要語言理解同語音合成,而呢兩樣只可以經連線量度。
- 如果我個伺服器喺評測途中死咗會點?
- 該次測試會標示為「資料不足」,而唔係一個差分數,亦唔會用掉你嘅配額。屬於我哋責任嘅失敗會歸咎於我哋,並且免費重跑。一個連唔到嘅伺服器永遠唔會公布成 100% 錯誤率,因為咁樣係就你個系統講咗一件唔真確嘅事。
- 我可唔可以睇到自己邊幾段錯咗?
- 練習測試可以,仲會同時顯示標準答案同你嘅輸出。正式評測就只會見到逐段嘅狀態同你自己嘅回覆,唔會見到標準答案。