网络钓鱼编年史 - 芦笛·编著
第二章 · 鱼钩的锻造
第七节

语音钓鱼(Vishing):当电话响起

从早期的"中奖电话"到AI语音克隆的精准猎杀,语音钓鱼利用了人类对"声音"的天然信任。当攻击者能够完美克隆你老板的声音、你家人的声音、甚至你自己的声音时,电话——这个最古老的通信工具——成为了最危险的钓鱼载体。

1876年3月10日,亚历山大·格雷厄姆·贝尔对着他新发明的装置说出了那句载入史册的话:"沃森先生,请过来一下,我需要你。"电话由此诞生,人类第一次实现了远距离的实时语音通信。将近一百五十年后,这个最初被设计来连接人与人的工具,却成为了欺骗者最得心应手的武器。语音钓鱼——Vishing——不是技术的胜利,而是人性的沦陷:我们天生信任声音,因为声音携带着情感、温度和身份。当技术能够完美伪造这一切时,"听到即相信"的本能反应,就变成了最致命的弱点。

一、从"中奖电话"到"技术支持":语音钓鱼的早期形态

语音钓鱼的历史几乎与电话的普及同步。早在20世纪80年代,"电话诈骗"就已经成为一种成熟的犯罪形式。当时的攻击手段极为原始:诈骗者随机拨打电话,声称受害者"中了大奖",需要支付"税费"或"手续费"才能领取奖金。这种"尼日利亚王子"式的电话诈骗,成功率极低——大多数人在听到"中奖"两个字时就挂断了电话。但它证明了语音渠道在欺骗中的独特价值:一个真实的人声,比任何文字都更能制造"真实感"。

亚历山大·格雷厄姆·贝尔(Alexander Graham Bell)于1876年打出了第一个电话

进入21世纪,语音钓鱼开始"专业化"。2000年代中期,"技术支持诈骗"(Tech Support Scam)在印度和菲律宾的呼叫中心兴起。诈骗者冒充Microsoft、Apple或ISP的技术支持人员,致电受害者,声称"检测到您的电脑存在严重病毒",诱导受害者允许远程访问或支付"修复费用"。这种诈骗的精妙之处在于它利用了普通用户对技术的不了解——当"专业人士"用流利的术语描述"系统漏洞"时,用户很难判断真假。

美国联邦贸易委员会(FTC)的数据显示,技术支持诈骗在2010年代迅速膨胀。2022年,美国共有32,538起技术支持诈骗投诉,造成损失8.066亿美元;2023年投诉量上升至37,560起,损失增至9.245亿美元。这15%的增长率背后,是诈骗产业链的日益成熟:从呼叫中心的规模化运营,到话术脚本的精心打磨,再到支付通道的洗钱设计——语音钓鱼已经从一个"个体犯罪"演变为"工业化生产"。

美国技术支持诈骗年度损失趋势(2019—2024)

数据来源:FBI IC3年度报告、FTC Consumer Sentinel Network

上图展示了美国联邦调查局互联网犯罪投诉中心(FBI IC3)统计的技术支持诈骗年度损失金额。2022年至2024年间,损失金额从8.07亿美元飙升至14.65亿美元,增幅高达81.5%。这一增长曲线清晰地反映了语音钓鱼从"手工操作"向"AI增强"转型的产业化进程。值得注意的是,2024年单年损失已接近2022年与2023年之和,标志着语音钓鱼进入了爆发式增长阶段。

然而,早期的语音钓鱼有一个根本性的局限:诈骗者只能"扮演"陌生人。他们无法模仿你认识的人的声音——你的老板、你的家人、你的朋友。这种"陌生感"是用户最后的防线:当接到一个陌生号码的来电时,大多数人会保持警惕。但这条防线在2019年之后被彻底摧毁——AI语音克隆技术的成熟,让"模仿任何人的声音"成为可能。

二、来电显示伪造:信任的第一道防线如何崩塌

在讨论AI语音克隆之前,我们必须先理解一个更基础的技术——来电显示伪造(Caller ID Spoofing)。这是语音钓鱼的"基础设施":如果诈骗电话显示的是一个陌生号码,用户可能会直接挂断;但如果显示的是"110""95588""10086",甚至是用户通讯录中某个联系人的名字,用户的警惕性就会大幅下降。

来电显示伪造的技术原理并不复杂。传统的PSTN(公共交换电话网络)和VoIP(网络电话)系统在设计时并未对来电号码进行严格的身份验证——呼叫者可以自行设置发送给被叫方的来电显示信息。这意味着,任何拥有VoIP服务的人,都可以将自己的来电显示设置为任意号码。早期的来电显示伪造需要一定的技术知识,但到了2010年代,在线"来电显示伪造服务"开始出现——用户只需支付少量费用,就可以通过网页界面输入目标号码和伪造号码,系统会自动完成呼叫。

一台80年代的老式答录机

为了应对这一问题,美国于2019年开始推广STIR/SHAKEN协议——一套用于验证来电号码真实性的技术标准。STIR/SHAKEN通过数字签名机制,确保来电显示的号码确实属于呼叫发起方。到2024年,美国主要运营商已基本完成STIR/SHAKEN的部署,伪造国内号码的难度大幅增加。但这一协议存在明显的局限性:它不适用于国际呼叫(大多数诈骗电话来自境外),不适用于短信(Smishing仍然猖獗),也不适用于使用合法号码但从事非法活动的场景(如入侵企业电话系统后发起呼叫)。

在中国,来电显示伪造同样是语音钓鱼的重要工具。犯罪分子利用VoIP网关和改号软件,将诈骗电话的来电显示伪造为银行客服号码、公检法机关号码或企业总机号码。由于中国的电话用户基数庞大,且许多老年人对来电显示号码深信不疑,这种伪造手法在中国尤为有效。2024年,中国公安部通报的多起案件中,诈骗分子利用伪造的"110"号码致电受害者,声称"您涉嫌洗钱犯罪,请配合调查"——受害者看到来电显示为"110",几乎不会怀疑其真实性。

三、AI语音克隆:三秒钟的音频,一辈子的信任

2019年,英国一家能源公司的CEO接到了一通来自"德国母公司CEO"的电话。电话中,"德国CEO"用熟悉的口音和语气,要求紧急转账24.3万美元到一个匈牙利供应商的账户。转账完成后,真正的德国CEO否认了这通电话——那声音是AI克隆的。这是历史上第一起被广泛报道的AI语音克隆诈骗案,它标志着一个新时代的开端:声音不再可信。

AI语音克隆技术的核心原理是深度学习。通过分析一个人的语音样本,神经网络可以学习其声纹特征——音调、音色、语速、停顿模式、甚至呼吸节奏——然后生成全新的、听起来与该人完全一致的话语。早期的语音合成技术需要数小时的语音样本才能生成自然的声音;但到了2024年,迈克菲(McAfee)的研究表明,仅需3秒钟的音频就足以克隆一个人的声音。这3秒钟可以来自一段YouTube视频、一条微信语音、一个会议录音、甚至是一个语音信箱的问候语。

语音克隆工具的门槛正在以惊人的速度降低。2023年至2025年间,ElevenLabs、Microsoft Azure Speech、谷歌云文本转语音(Google Cloud Text-to-Speech)等商业平台提供了高质量的语音克隆API,价格低至每分钟几美分。在暗网和Telegram频道中,开源的语音克隆工具(如So-VITS-SVC、RVC)被广泛传播,攻击者无需任何机器学习背景,只需上传音频样本,点击按钮,就能在几分钟内获得一个逼真的语音克隆。据网络安全实验室统计,仅2024年12月至2025年2月期间,就有超过2000个仿冒AI服务的山寨网站出现,提供"AI换声""AI换脸"等黑产服务,价格低至1元。

AI语音克隆对语音钓鱼的影响是革命性的。在AI之前,语音钓鱼的瓶颈在于"人"——攻击者需要真人拨打电话,用演技和话术来欺骗受害者。这限制了攻击的规模:一个诈骗呼叫中心每天能拨打的电话数量有限,且每个诈骗者只能同时欺骗一个人。AI语音克隆消除了这个瓶颈:攻击者可以生成数千个自动化的语音呼叫,每个呼叫使用不同的克隆声音,针对不同目标定制话术。语音钓鱼从"手工作坊"变成了"工业化流水线"。

AI语音克隆与语音钓鱼关键数据

  • 克隆门槛:仅需3秒音频即可克隆声音(McAfee 2024)
  • 语音钓鱼增长:2024年下半年较上半年激增442%(CrowdStrike 2025)
  • 深度伪造语音钓鱼:2025年Q1较2024年Q4激增1,633%(Keepnet 2025)
  • 语音钓鱼占比:2025年Q1,语音钓鱼占全部钓鱼相关事件的60%以上(CrowdStrike)
  • 最大单笔损失:香港某公司因深度伪造CFO视频通话被骗2亿港元(约2,560万美元)
  • 全球损失预测:深度伪造诈骗损失预计2027年达400亿美元(Deloitte)
  • 企业平均损失:每次语音欺诈攻击平均造成68万美元损失
  • 识别难度:人类对高质量深度伪造音频的识别准确率可低至24.5%
  • 诈骗电话量:2025年全球诈骗电话达25.6亿次(Truecaller)

四、TOAD攻击:短信与电话的协同猎杀

TOAD(Telephone Oriented Attack Delivery,电话导向攻击投递)是语音钓鱼的一种高级形态。它不再依赖单一的语音呼叫,而是将短信钓鱼(Smishing)和电话钓鱼(Vishing)结合起来,形成一个"信任建立→信任利用"的完整攻击链。

TOAD的典型攻击流程如下:第一步,攻击者发送一条钓鱼短信,内容通常是"您的账户存在异常,请致电客服处理",并附上一个客服电话号码。这个号码看似是官方客服,实则是攻击者控制的VoIP号码。第二步,受害者拨打电话后,接听的是经过AI语音克隆的"客服人员"——声音甜美、专业、带有官方口吻。第三步,"客服人员"以"验证身份"为由,诱导受害者提供银行卡号、密码、验证码等敏感信息。第四步,攻击者利用获取的信息完成转账或进一步的社会工程攻击。

TOAD的精妙之处在于它利用了"跨渠道信任迁移"。当用户在短信中看到"官方通知"时,已经对"需要致电处理"这一指令建立了初步信任;当电话接通后,AI克隆的"客服声音"进一步强化了这种信任;当"客服"要求提供敏感信息时,用户的心理防线已经大幅降低。APWG在2023年底的报告中指出,约6.1%的钓鱼活动使用了TOAD手法——虽然占比不高,但其成功率远高于单一渠道的钓鱼攻击。

2024年至2025年间,TOAD攻击的手法进一步升级。攻击者开始在短信中嵌入"验证码"——例如"您的验证码是123456,请勿泄露给他人",然后立即致电受害者,声称"系统检测到异常,需要您提供刚才收到的验证码以验证身份"。由于受害者确实收到了一条验证码短信,他们会本能地认为来电者是"官方人员",从而毫不犹豫地提供验证码——而这个验证码实际上是攻击者发起转账操作时的二次验证代码。

五、"冒充公检法":中国最经典的语音钓鱼剧本

在中国,"冒充公检法"是语音钓鱼中最经典、最持久、也是危害最大的诈骗类型。这种诈骗的剧本经过十余年的打磨,已经形成了一套高度成熟的话术体系和操作流程。

典型的"冒充公检法"诈骗流程如下:第一步,诈骗分子通过非法渠道获取受害者的个人信息(姓名、身份证号、住址等),然后致电受害者,自称"公安局民警"或"检察院检察官",声称受害者"涉嫌洗钱""涉嫌贩毒""涉嫌诈骗",并准确报出受害者的个人信息以增加可信度。第二步,诈骗分子要求受害者"配合调查",不得向任何人透露此事,否则将面临"逮捕""冻结资产"等严重后果。第三步,诈骗分子将电话"转接"至"上级领导"或"专案组",进一步施压。第四步,诈骗分子要求受害者将资金转入"安全账户"进行"资金清查",承诺调查结束后返还。

这种诈骗之所以在中国如此成功,根本原因在于它精准地击中了中国人对"公权力"的敬畏心理。在大多数中国人的认知中,公安机关和检察院是"不会骗人的"——这种根深蒂固的信任使得受害者即使产生怀疑,也不敢轻易挂断电话或核实信息。诈骗分子利用的正是这种"权威恐惧":当"警察"用严厉的语气告知你"涉嫌犯罪"时,大多数人的第一反应是"配合",而不是"质疑"。

2024年至2025年,"冒充公检法"诈骗出现了新的变种。诈骗分子开始利用AI语音克隆技术,模仿"警察"的口音和语气,使得通话更加逼真。更狡猾的是,诈骗分子会伪造"通缉令""逮捕令"等法律文书,通过社交软件发送给受害者——这些文书上印有受害者的照片和个人信息,进一步强化了"真实性"。2024年,多地出现冒充公检法人员的电信诈骗案件。诈骗分子利用人们对法律的畏惧心理,故意塑造紧迫感,从而诱骗受害者配合"调查"、转账至"安全账户"。此类案件在2024年呈高发态势,各地公安机关和反诈中心多次发布预警提示。

中国公安部和国家反诈中心近年来加大了对"冒充公检法"诈骗的打击力度,通过"96110"反诈预警专线和"国家反诈中心App"等技术手段,在诈骗发生前进行拦截和劝阻。但诈骗分子也在不断升级手法——从传统的电话诈骗,发展到"视频通话+AI换脸"的混合模式,使得识别难度进一步增加。

六、"孙子出事了":AI拟声如何击穿亲情防线

如果说"冒充公检法"利用的是权威恐惧,那么AI拟声诈骗利用的就是亲情软肋。2024年至2025年,中国多地出现了大量"AI克隆孙子声音"的诈骗案件,受害者以独居老人为主,涉案金额从数万元到数十万元不等。

这类诈骗的典型手法是:诈骗分子通过非法渠道获取老人孙辈的声音样本(如社交媒体上的短视频、家庭群聊中的语音消息),利用AI语音克隆技术合成逼真的"孙子声音"。然后,诈骗分子拨打老人的座机或手机,用带着哭腔的"孙子声音"声称"打架伤人需要赔偿""被警察抓了需要保释金""出车祸需要医药费"等紧急情况,并特别强调"不要告诉爸妈"。老人在听到"孙子"的哭声和哀求后,往往情绪激动,失去理性判断能力,立即凑钱转账或交给上门取款的"同学""朋友"。

2025年,多地公安机关通报了AI拟声诈骗老年人的典型案例。诈骗分子通过非法渠道获取老人孙辈的声音样本(如社交媒体上的短视频、家庭群聊中的语音消息),利用AI语音克隆技术合成逼真的"孙子声音"。随后,诈骗分子致电老人,用带着哭腔的"孙子声音"声称"打架伤人需要赔偿""被警察抓了需要保释金""出车祸需要医药费"等紧急情况,并特别强调"不要告诉爸妈"。老人在听到"孙子"的哭声和哀求后,往往情绪激动,失去理性判断能力,立即凑钱转账或交给上门取款的"同学""朋友"。多地案例中,诈骗分子因贪得无厌多次索要钱财,引起家属警觉后报警,才得以阻止更大损失。

中国老龄协会发布的2024年全国老年人权益保护典型案例中,收录了一起AI拟声诈骗案件:2024年3月,老人张某接到"孙子"的电话,称其与人发生口角、冲动伤人,对方要他赔偿2万元,否则就报警。电话中"孙子"的声音逼真,老人因救孙心切,取出2万元现金交给冒充"孙子朋友"上门取款的犯罪分子。事后调查发现,骗子通过非法渠道获取了老人家庭关系信息,并利用AI语音克隆技术合成了"孙子"的声音。法院以诈骗罪判处主犯有期徒刑一年。此类案件在2024年至2025年间呈高发态势,多地公安机关发布预警。

据多地公安机关通报,2024年至2025年间,AI换脸、拟声诈骗案件呈快速上升趋势,其中老年群体受骗占比较高。AI语音克隆技术的真实度不断提升,普通人仅凭听觉辨别真伪的难度越来越大。此类案件的典型特征是:诈骗分子利用非法获取的个人信息,通过AI技术合成受害者亲属的声音,以"出事了急需用钱"为由实施诈骗,并利用老年人对晚辈的关爱心理和对新技术的不了解,大幅降低其警惕性。

为什么老年人特别容易成为AI拟声诈骗的受害者?原因有多重:一是情感因素——老人对孙辈的关爱是无条件的,听到"孙子出事"的消息时,理性思考被情感淹没;二是技术隔阂——许多老年人不熟悉AI技术,不知道声音可以被克隆;三是信息孤立——独居老人与子女联系不频繁,难以第一时间核实情况;四是座机盲区——诈骗分子特意选择拨打座机,因为座机不显示来电号码,老人无法通过号码判断真伪。

七、语音钓鱼的真实案例

以下选取几个具有代表性的语音钓鱼案例,展示攻击的多样性和危害性。

案例一:2019年英国能源公司CEO语音克隆诈骗案

2019年,英国一家能源公司的CEO接到了一通来自"德国母公司CEO"的电话。电话中,对方用熟悉的德国口音和语气,要求紧急转账24.3万美元到一个匈牙利供应商的账户,理由是"正在进行的秘密收购项目"。由于声音和说话方式与真正的德国CEO完全一致,英国CEO没有产生任何怀疑,立即指示财务部门完成转账。转账完成后,英国CEO致电德国总部确认,才发现自己被骗了——那通电话中的声音是AI克隆的。这起案件是历史上第一起被广泛报道的AI语音克隆商业诈骗案,它向世界发出了一个令人不寒而栗的信号:声音,这个人类最古老的身份标识,已经不再可信。

案例二:2024年香港深度伪造CFO视频会议诈骗案

2024年,香港一家跨国公司分部的一名职员受邀参加总部"首席财务官"发起的一场"多人视频会议"。会议中,"CFO"和多位"总部高管"讨论了公司的财务安排,然后要求该职员将2亿港元转到5个本地银行账户。职员照做了。事后向总部查询时,才得知受骗——这起案件所谓的视频会议中只有受害人一人是真人,其余"参会人员"都是经过AI换脸和语音克隆后的诈骗人员。这是全球已知金额最大的深度伪造诈骗案之一,它展示了语音钓鱼与视频深度伪造结合后的恐怖威力:当攻击者能够同时伪造一个人的面容和声音时,传统的"眼见为实"和"耳听为实"都彻底失效。

案例三:2025年新加坡金融总监深度伪造诈骗案

2025年3月,新加坡某跨国公司金融总监收到"CEO"的视频会议请求。画面中"CEO"神态自然、声音逼真,要求紧急转账约37万美元(US$499,000)至"海外供应商账户"。警方通过国际反诈协作机制及时介入,冻结了部分资金。事后调查显示,骗子使用了仅需数秒语音样本就能克隆声纹的AI工具。亚信安全《2025年网络安全威胁预测》指出,深度伪造技术已使诈骗成功率显著提升。

案例四:2025年某地AI拟声连环诈骗案

2025年底至2026年初,某地连续发生三起AI拟声诈骗案件,三名老人分别被骗2万元,共计6万元。诈骗分子使用相同的作案手法:通过非法渠道获取老人孙辈的声音样本,利用AI语音克隆技术合成逼真的"孙子声音",然后致电老人,声称"在学校打架伤人需要赔偿"。诈骗分子还安排同伙上门取款,进一步增强了"真实性"。某人民法院对其中一名取款人吴某以诈骗罪判处有期徒刑两年一个月,并处罚金1.5万元。专家指出:"利用AI进行语音克隆和深度伪造技术的诈骗案件频率惊人,专门针对老年人,对司法系统和社会构成新的挑战。"

语音钓鱼技术演进与全球损失增长轨迹(2017—2027)

上图综合呈现了语音钓鱼从早期技术探索到AI工业化攻击的演进路径。2019年首例AI语音克隆商业诈骗标志着"声音可信性"的崩塌起点;2024年语音钓鱼激增442%和Arup案(2,560万美元)标志着深度伪造进入实战化阶段;2025年深度伪造语音钓鱼再激增1,633%,全球诈骗电话达25.6亿次。Deloitte预测,到2027年深度伪造诈骗损失将达400亿美元。右侧折线展示了全球深度伪造相关欺诈损失的指数级增长趋势,从2022年的约1亿美元飙升至2025年的约12.3亿美元,并将在2027年达到40亿美元。

八、当声音不再可信:信任的终极危机

语音钓鱼的终极威胁,不在于它能骗取多少钱,而在于它摧毁了一种人类最基础的信任机制——"我听到你的声音,所以我知道是你"。

在人类进化的漫长历史中,声音一直是身份验证的核心手段。从原始部落的呼喊识别,到电话时代的"喂,是我",声音承载着情感、记忆和关系。我们不需要看到对方,仅凭声音就能认出母亲、伴侣、挚友。这种"声音即身份"的认知如此根深蒂固,以至于当AI能够完美复制任何人的声音时,我们的大脑还没有准备好应对这种颠覆。

语音钓鱼的防御困境在于:技术解决方案总是滞后的。STIR/SHAKEN可以验证来电号码的真实性,但无法验证声音的真实性;AI检测工具可以识别合成语音,但攻击者也在不断改进合成质量以规避检测;用户教育可以提醒人们"不要轻信电话中的转账要求",但当听到"孙子"的哭声时,理性的提醒往往敌不过情感的冲动。

更深层的挑战在于,语音钓鱼攻击的是"关系"而非"信息"。电子邮件钓鱼攻击的是用户对信息的判断——"这个链接是否可信";而语音钓鱼攻击的是用户对关系的信任——"这个声音是否属于我爱的人"。前者可以通过技术工具辅助判断,后者则需要人类情感的参与——而情感,恰恰是理性思考的最大敌人。

2025年,全球诈骗电话数量达到25.6亿次(Truecaller数据)。在这些电话中,有多少使用了AI克隆的声音?有多少冒充了你认识的人?有多少在你最脆弱的时刻响起?这些问题没有确切的答案,但趋势是明确的:语音钓鱼正在从"边缘威胁"变成"主流攻击",从"随机拨打"变成"精准猎杀",从"真人表演"变成"AI生成"。

当技术能够完美复制人类的声音时,"声音"作为一种身份标识的价值正在归零。未来的身份验证可能需要依赖多因素组合——密码+生物特征+行为模式+上下文验证——但每一种新的验证方式,都可能成为下一轮钓鱼攻击的目标。这是一场没有终点的军备竞赛:防御者不断发明新的信任机制,攻击者不断找到伪造这些机制的方法。

语音钓鱼的历史告诉我们一个残酷的真理:人类对"声音"的信任,是基于数百万年进化的本能;而技术对这种信任的摧毁,只需要三秒钟的音频样本。在AI时代,我们可能需要学会一种全新的生存技能——在听到最熟悉的声音时,保持最冷静的怀疑。

"电话是人类发明的最亲密的沟通工具,也是最容易被滥用的欺骗工具。当AI能够完美克隆任何人的声音时,'听到即相信'的本能就变成了最危险的弱点。我们不是在防御技术攻击,我们是在防御自己进化了几百万年的大脑——那个听到孩子哭声就会失去理智的大脑。" —— 引自网络安全研究者对AI语音克隆威胁的反思

延伸阅读与参考

  • "Vishing Statistics 2025: AI Deepfakes Drive $40B in Losses." DeepStrike, 2025. 包含语音钓鱼增长442%、深度伪造语音钓鱼激增1,633%等关键数据。
  • "AI Voice Cloning Fraud Statistics 2026: Alarming Trends." SQ Magazine, 2026. 包含AI语音克隆市场增长、深度伪造音频识别率等数据。
  • "Phishing Statistics [2026]: Latest Attack Data & Trends." StationX, 2026. 综合钓鱼统计数据,含语音钓鱼和AI语音克隆分析。
  • "Social Engineering Statistics [2026]: 100+ Facts & Trends." StationX, 2026. 社会工程学统计,含语音钓鱼和深度伪造详细数据。
  • "Grandparents top AI swindlers' list." China Daily, April 9, 2026. 中国日报英文版对AI拟声诈骗老年人案件的深度报道。
  • "中国老龄协会发布2024年全国老年人权益保护典型案例." 中国老龄协会, 2025. 包含AI变声"亲情"诈骗典型案例及法院判决。
  • "UNODC Report: Emerging Threats - The Intersection of Criminal and Technological Innovation." UNODC, 2025. 联合国毒品和犯罪问题办公室关于AI语音克隆犯罪的权威报告。
  • "McAfee AI Voice Scam Report 2024." McAfee, 2024. 仅需3秒音频即可克隆声音的研究数据。
  • "真假难辨:再议AI深度伪造之法律边界." 金杜律师事务所, 2024. 中国首例AI生成声音侵权案法律分析。
  • "CrowdStrike Global Threat Report 2025." CrowdStrike, 2025. 语音钓鱼激增442%及深度伪造诈骗的权威数据来源。