AI變聲詐騙2萬人受害,人聽得出合成語音嗎?實驗室研究:只能抓出73%
如果你也在交友軟體上遇過聊得火熱、卻總覺得哪裡怪的網友,這篇值得你讀完。據公視新聞報導,檢方 2026 年 9 月偵結起訴一個 57 人的詐騙集團:自 2022 年起,他們用 AI 變聲軟體偽裝女聲在交友軟體上談感情,受害者超過 2 萬人、損失逾 9 億元,集團內還有工程師負責設計這套軟體。說來諷刺,連詐騙集團也完成了數位轉型。案情就講到這裡;這篇真正想回答的,是案件背後的科學問題:人耳為什麼靠不住?
人耳有多不可靠?科學給了數字
你可能覺得自己聽得出來。2023 年倫敦大學學院(UCL)發表在《PLOS ONE》的一項受控實驗,找來 529 名受試者,分成兩種情境:單獨聽一段音檔時,整體判斷正確率 70.35%,認出合成語音的比例是 73%;真假兩段並排比較時升到 85.59%。講白話,單獨聽的時候,每四句合成語音約有一句被當成真人;而現實裡你不會剛好有「確定是本人」的對照音檔。這個實驗測的是合成語音短音檔,和詐騙現場的情境不完全相同;研究團隊自己也預期,合成演算法越逼真,辨識會越難。研究同時測了英語和中文,結果相近;事前先聽過幾段深偽範例的受試者,表現平均也只提升 3.84 個百分點。這篇論文的標題本身就是一句警告:人類無法可靠地辨識語音深偽。
複製一個人的聲音,只要幾秒鐘
為什麼防不勝防?因為門檻低得驚人。2023 年發表的語音合成模型 VALL-E,論文摘要明寫只需要 3 秒鐘的錄音樣本,就能合成出那個人的個人化語音。翻成人話:AI 聽你講三秒鐘的話,就能用非常接近你的聲音,念出你沒說過的新句子。理論上,你在社群上發過的任何一段清楚人聲,都可能成為素材。
所以,怎麼驗證對面是不是真人?
這起案件真正動搖的,是「身分驗證」的未來。我們一直把聲音當成身分的一部分:家人憑一句「喂」認出彼此,許多服務也拿聲音確認你是你。當複製一個人的聲音只要幾秒鐘,所有把「聲音等於本人」當前提的系統與習慣,都得重新設計。從今以後,「聽起來像」不再是證據。耳朵靠不住,就換管道驗證。自稱親友來電借錢,掛掉後用你原本存的號碼回撥;網路認識的對象一談到錢、投資、代購就停下來;更進一步,和家人約定只有彼此知道的通關暗號。懷疑被騙,先打 165 反詐騙專線。真感情不會急著要你匯款;會急的,通常是劇本。辨識技術還會演進,但在那之前,別用耳朵做決定。
資料來源
公視新聞網(2026-09-02):以AI變聲愛情詐騙逾9億 黃姓夫婦遭求刑25年、18年 https://news.pts.org.tw/article/825232
Mai, K. T. 等(2023)Warning: Humans cannot reliably detect speech deepfakes,PLOS ONE,DOI:10.1371/journal.pone.0285333。https://journals.plos.org/plosone/article?id=10.1371/journal.pone.0285333
Wang, C. 等(2023)Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers(VALL-E),arXiv。https://arxiv.org/abs/2301.02111
內政部警政署 165 反詐騙諮詢專線官方網站(編輯補充,非上述論文內容)。https://165.npa.gov.tw/


