用台灣考題考 AI 考幾分:iKala 發表 TMMLU+ v1.1,兩萬多題繁體中文考卷重新校對
科技前瞻

用台灣考題考 AI 考幾分:iKala 發表 TMMLU+ v1.1,兩萬多題繁體中文考卷重新校對

問過 AI 台灣的事、卻拿到很像對岸的答案嗎?這篇講的是根源。

台灣 AI 公司 iKala 發表了 TMMLU+ v1.1。它是一份專門考大型語言模型的繁體中文考卷:66 個科目、兩萬多道選擇題,從基礎科目到藥學、會計、驗光等專業考試,還有台灣地理與台語。這次更新以四種規則掃描 22,742 題,標出 6,116 題逐題複驗、691 題人工複審,最後 197 題更正答案、539 題整題刪除,剩 22,203 題,過時法規題也一併更新。資料集採 MIT 授權,商用免費。

先講為什麼 AI 需要考卷。2020 年 Dan Hendrycks 團隊提出 MMLU,用 57 科的考題測模型,當時最大的 GPT-3 也只比亂猜高出不到 20 個百分點。講白話,MMLU 就像 AI 界的學測。

但 MMLU 的 57 科含美國歷史這類美國背景的科目。各國於是各出各的考卷:2023 年 CMMLU 用中國語境的中文題目測了 18 個模型,多數平均不到五成;2024 年韓國 KMMLU 蒐了 35,030 道本地考題,GPT-4 也考不到六成。繁體中文這邊,TMMLU+ 是既有 TMMLU 的六倍擴充版,論文測了閉源模型與 26 個開放權重的中文模型,結論是繁體中文模型普遍落後簡體中文模型,平均分數還不及人類水準。

iKala 另對 v1.1 題庫做了排行榜,目前收 21 個跑完 66 科的模型,總分最高 96 分、前五名都在 86 分以上。iKala 說明 v1.0 分數須用 v1.0 題庫重跑,換句話說新舊分數不宜直接對比;榜上也沒標模型的繁簡屬性,看不出當年的落差是否縮小。但高分對考卷是壞消息。MMLU-Pro 的作者就觀察到,模型在 MMLU 上的表現趨於平緩、分不出高下,於是把選項從四個加到十個、拿掉太簡單的題目,準確率立刻掉了 16% 到 33%。講白話,全班都考一百分,老師就得換題。考卷得跟著學生長大。

這跟你有什麼關係?如果你的公司正在挑模型處理中文客服或公文,TMMLU+ 能反映它在稅務、公文管理這類台灣科目上懂多少。往外看一層,這也是語言政策問題。TMMLU+ 論文直言,繁體中文模型仍落後簡體中文模型,需要更專注的投入。一份考卷改變不了訓練資料的比例,但能讓差距被看見。看得見,才追得上。

來源
iKala,TMMLU+ 資料集頁(v1.1 更新說明與排行榜):https://huggingface.co/datasets/ikala/tmmluplus
Tam, Zhi-Rui 等,An Improved Traditional Chinese Evaluation Suite for Foundation Model,arXiv:2403.01858:https://arxiv.org/abs/2403.01858
Hendrycks 等,Measuring Massive Multitask Language Understanding:https://arxiv.org/abs/2009.03300
Li 等,CMMLU: Measuring massive multitask language understanding in Chinese:https://arxiv.org/abs/2306.09212
Son 等,KMMLU: Measuring Massive Multitask Language Understanding in Korean:https://arxiv.org/abs/2402.11548
Wang 等,MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark:https://arxiv.org/abs/2406.01574