LLM · 佔總分 25% · 所有隊伍必考
收到一通電話之後,系統知唔知來電者想要乜、答案有冇根據返份保單,同埋會唔會拒絕虛構一啲根本唔存在嘅保障?
其中一個會令保險公司賠一筆。作大出嚟嘅保障範圍,喺轉寫文字上面睇唔出係錯——睇落仲似係好服務,所以先要同「字有冇轉寫啱」分開嚟評分。
我做physiotherapy,一個療程十次,一次八百蚊,我份plan cover唔cover到?
I need physiotherapy — ten sessions at $800 each. Does my plan cover it?
你張保單有物理治療嘅保障,不過我喺度睇唔到每次嘅上限同埋年度限額,要幫你查返份保單條款先可以講到準確數字。要唔要我而家幫你開個查詢,跟進返俾你?
講保單上面有嘅嘢,講明自己睇唔到嘅嘢,再俾下一步。佢答少過客人想要嘅,而咁樣先啱。
有嘅,你份plan完全cover到物理治療,每次八百蚊都喺保障範圍之內,一年最多可以做二十次,你直接去做就得,唔使預先approve。
每一句標記咗嘅都係保單文件入面冇嘅:保障範圍、每次上限、年度限額,同埋話唔使預先批核。客人就係信咗呢啲去 book 十次。
一句用粵語答返來電者嘅說話——唔係轉寫稿,唔係通話摘要,亦唔係畀人照讀嘅稿。同一句說話喺每個 hello 訊框嘅 `task` 入面,你部伺服器可以直接讀,唔使記:
Answer the caller. In Cantonese, say what they need and what was agreed, grounded only in what the call actually contains. Do not repeat the call back — a transcript is not an answer — and do not invent coverage, amounts or policy terms that were not said.
用結構化評分表,涵蓋指令遵循、粵語在地化、幻覺同保單準確度,每項按公開嘅評分錨點打 1 至 5 分。兩個 Amazon Nova 模型——Pro 同 Lite——各自將每個答案評三次,對住公開嘅評分錨點,temperature 設為 0。取中位數,保留每次之間嘅分歧幅度;兩個模型相差超過一個評分點嘅項目會標示為有爭議,而唔係夾埋平均。喺叫任何模型之前,會先用一個確定嘅檢查將照抄來電嘅回覆壓到最低分——「呢個回覆係咪就係段來電」係一條有確定答案嘅字串問題,而模型喺短來電上面會判斷錯。兩個模型都係同一間廠商,所以呢個做法係避開單一模型嘅偏好,而唔係避開單一廠商;兩個唔同廠商仍然係目標,未做到之前呢版都會照講。揀呢兩個模型係量度出嚟嘅結果,唔係偏好:喺五段隨機抽出嚟嘅真實錄音上面,真正嘅答案都排喺照抄、原文重複同埋唔答之上,而用頂級模型做同一份工要貴二十倍。冇模型憑證嘅部署根本唔會評推理回合,唔會退返去用之前嗰個字詞重疊評分方法,嗰個方法將照抄排喺真正作答之上。
系統有冇捉到下游流程需要嘅事實:保單號碼、索償金額、日期、醫療名詞,同埋最後究竟決定咗啲乜。