「爸、媽,我車禍了,急需匯款五萬塊到這個帳戶,請快一點!」
這通電話可能就在幾分鐘前打進你的手機。聲音熟悉、語氣焦急,甚至能聽出背景的車聲或哭腔。但在 2026 年,這個威脅遠比你想像的更近——AI 語音克隆工具僅需幾秒的取樣音頻,就能高度複製一個人的聲紋特徵,製造出幾乎難以辨別的合成語音。
威脅升級:2026 年的三大新趨勢
1. 克隆門檻崩潰——僅需幾秒即可
過去的語音克隆需要數分鐘甚至數小時的訓練素材。但如今,主流 AI 語音工具(包括已有商業服務採用的技術)僅需約 10 秒的清晰錄音,便能產出足以騙過一般人的仿聲結果。換言之,你孩子在家庭群組傳的語音問候,或長輩在 Facebook 直播的幾句話,都可能成為詐騙集團的「訓練素材」。
2. 多層次攻擊——聲音加臉孔一起偽裝
最新案例顯示,詐騙集團不再只用「聲音克隆」,而是升級為語音克隆 + 換臉 Deepfake 同步使用,製造出逼真的視訊通話。受害者看到家人的臉、聽到家人的聲音,判斷力會受到更強烈的心理壓制。
2023 年中國公安機關披露的福建案例中,詐騙集團利用 AI 換臉加聲音克隆,模仿受害者的熟人在視訊通話中偽裝,在約 10 分鐘內分兩筆騙走 430 萬人民幣(約 1,900 萬台幣),打破了「看得到就是真人」的心理防線。(來源:中國公安部 / 媒體報導,2023 年 5 月)