Cantonese Voice Benchmark粵語語音基準
EN繁中

LLM · 佔總分 25% · 所有隊伍必考

你明唔明?

收到一通電話之後,系統知唔知來電者想要乜、答案有冇根據返份保單,同埋會唔會拒絕虛構一啲根本唔存在嘅保障?

兩個答案都好流利。

其中一個會令保險公司賠一筆。作大出嚟嘅保障範圍,喺轉寫文字上面睇唔出係錯——睇落仲似係好服務,所以先要同「字有冇轉寫啱」分開嚟評分。

客人問

我做physiotherapy,一個療程十次,一次八百蚊,我份plan cover唔cover到?

I need physiotherapy — ten sessions at $800 each. Does my plan cover it?

有根據

你張保單有物理治療嘅保障,不過我喺度睇唔到每次嘅上限同埋年度限額,要幫你查返份保單條款先可以講到準確數字。要唔要我而家幫你開個查詢,跟進返俾你?

講保單上面有嘅嘢,講明自己睇唔到嘅嘢,再俾下一步。佢答少過客人想要嘅,而咁樣先啱。

作出嚟

有嘅,你份plan完全cover到物理治療,每次八百蚊都喺保障範圍之內,一年最多可以做二十次,你直接去做就得,唔使預先approve。

每一句標記咗嘅都係保單文件入面冇嘅:保障範圍、每次上限、年度限額,同埋話唔使預先批核。客人就係信咗呢啲去 book 十次。

評審每個答案睇乜
有冇照做
佢有冇答到客人真正問嘅嘢,同埋做完件事?
係咪地道粵語
係自然嘅香港粵語,定係書面語照讀出嚟?
有冇作嘢
佢有冇作出根本唔存在嘅保障、金額或者手續?
引保單準唔準
佢引用保單嗰陣,引得啱唔啱?

你要傳返乜

一句用粵語答返來電者嘅說話——唔係轉寫稿,唔係通話摘要,亦唔係畀人照讀嘅稿。同一句說話喺每個 hello 訊框嘅 `task` 入面,你部伺服器可以直接讀,唔使記:

Answer the caller. In Cantonese, say what they need and what was agreed, grounded only in what the call actually contains. Do not repeat the call back — a transcript is not an answer — and do not invent coverage, amounts or policy terms that were not said.

量度啲乜

LLM-as-judge 模型評審

用結構化評分表,涵蓋指令遵循、粵語在地化、幻覺同保單準確度,每項按公開嘅評分錨點打 1 至 5 分。兩個 Amazon Nova 模型——Pro 同 Lite——各自將每個答案評三次,對住公開嘅評分錨點,temperature 設為 0。取中位數,保留每次之間嘅分歧幅度;兩個模型相差超過一個評分點嘅項目會標示為有爭議,而唔係夾埋平均。喺叫任何模型之前,會先用一個確定嘅檢查將照抄來電嘅回覆壓到最低分——「呢個回覆係咪就係段來電」係一條有確定答案嘅字串問題,而模型喺短來電上面會判斷錯。兩個模型都係同一間廠商,所以呢個做法係避開單一模型嘅偏好,而唔係避開單一廠商;兩個唔同廠商仍然係目標,未做到之前呢版都會照講。揀呢兩個模型係量度出嚟嘅結果,唔係偏好:喺五段隨機抽出嚟嘅真實錄音上面,真正嘅答案都排喺照抄、原文重複同埋唔答之上,而用頂級模型做同一份工要貴二十倍。冇模型憑證嘅部署根本唔會評推理回合,唔會退返去用之前嗰個字詞重疊評分方法,嗰個方法將照抄排喺真正作答之上。

資料抽取

系統有冇捉到下游流程需要嘅事實:保單號碼、索償金額、日期、醫療名詞,同埋最後究竟決定咗啲乜。

點解喺呢度特別難

虛構保障
代價最大嘅一種錯。就保障範圍講出一個好肯定但係錯嘅答案,比唔答仲差。
粵語語體
書面中文同口語粵語差別好大。一句睇落去啱嘅回覆,講出嚟可以完全唔對路。
有根有據
答案要來自保單文件本身,而唔係來自模型估計一間保險公司通常會點講。