網路安全研究機構NCC Group最新報告顯示,AI語音偽造技術已突破關鍵瓶頸,成功實現"即時"偽造。這項突破性進展使得攻擊者能夠在普通通話中即時模仿他人聲音,實驗中的詐騙成功率接近百分之百。
與傳統變聲器不同,這項被稱為"深度偽造語音釣魚"的技術基於先進的AI模型,僅需對目標聲音進行短暫學習,便可在定製網頁介面上實現一鍵啟用。令人擔憂的是,該技術對硬體要求並不苛刻,研究人員在一臺搭載英偉達RTX A1000顯示卡的普通筆記型電腦上,成功實現了延遲低於0.5秒的即時語音轉換,且生成效果自然流暢,幾乎無法辨識真偽。

更嚴峻的是,該技術即使基於低質量的原始錄音,仍能生成極其逼真的語音副本。相較於以往需要數分鐘訓練、僅能生成固定音訊的舊式工具,新系統允許使用者在通話過程中根據情境即時調整語調和語速,這使得技術門檻大幅降低,普通使用者藉助筆記型電腦或智慧手機即可實現專業級的語音偽造。
在授權進行的模擬測試中,安全顧問Pablo Alobera透露,當即時語音偽造技術與來電號碼偽造結合使用時,幾乎每次實驗都能成功欺騙測試物件。這一結果凸顯了該項技術對現有安全體系的巨大威脅。
儘管語音偽造技術突飛猛進,即時影片深度偽造仍面臨技術瓶頸。專家指出,當前最先進的AI模型在即時影片生成中仍存在表情不一致、情緒不匹配及音畫不同步等問題,普通觀眾仍能透過觀察這些細節識別偽造痕跡。

隨著AI偽造技術的快速普及,實際損失案例已經開始出現。有企業在招聘過程中因影片深度偽造而上當,將筆記型電腦寄往虛假地址。此類事件表明,傳統的語音或視訊通話已不能再作為可靠的身份驗證方式。
專家強烈建議建立新型身份驗證機制,提出可借鑑棒球比賽中使用的"暗號"概念,透過獨特且結構化的訊號或程式碼在遠端交流中確認身份。若不及時採取應對措施,個人與機構都將面臨日益複雜的AI社會工程攻擊威脅,網路安全格局或將迎來重大變革。