基于电话与VoIP通信渠道的语音钓鱼攻击研究,覆盖AI语音克隆、来电号码伪造、自动拨号系统、交互式语音应答钓鱼、Vishing与Email协同攻击等全场景。本专题分三篇系统阐述威胁全景、检测原理与防御框架、典型案例与研究前沿。
语音钓鱼(Vishing,Voice Phishing)是利用电话、VoIP、即时通讯语音通话等音频通信渠道实施的钓鱼攻击。随着生成式AI与语音克隆技术的普及,Vishing已从传统"冒充客服"的人工诈骗,演进为AI驱动的工业化攻击向量。据CrowdStrike 2025全球威胁报告,Vishing攻击量在2024年下半年相较上半年激增442%,成为增速最快的钓鱼攻击形态。
CrowdStrike 2025全球威胁报告显示,2024年下半年Vishing攻击量相较上半年激增442%,并以约40%的复合月增长率持续扩张;其后续发布的2025年威胁狩猎报告进一步确认,2025年上半年的Vishing入侵量已超过2024年全年总量,CrowdStrike 2026全球威胁报告测得2025年Vishing活动同比增长134%。Mandiant M-Trends 2026报告(基于2025年超过50万小时的应急响应调查)将语音钓鱼列为2025年第二常见的初始感染向量,在可识别攻击路径的调查中占比约11%(仅次于漏洞利用的32%,高于邮件钓鱼的6%);在云端环境入侵中,语音钓鱼更是以23%的占比成为第一大初始感染向量。Pindrop 2025语音情报与安全报告(分析12亿通联络中心通话)显示,2024年深度伪造欺诈尝试增长超过1,300%,从平均每月1起跃升至每天7起;联络中心面临的欺诈敞口估计达445亿美元。Hiya 2025全球通话威胁报告显示,2025年第二季度标记了137亿次疑似垃圾通话,日均约1.5亿次,连续季度环比增长(2024年Q4:113亿次 → 2025年Q1:125亿次 → 2025年Q2:137亿次)。美国联邦贸易委员会(FTC)数据显示,2024年冒充类诈骗造成约29.5亿美元损失,为损失额最高的诈骗类别;电话是消费者报告的第二大诈骗接触渠道。Verizon 2025数据泄露调查报告(DBIR)显示,短信钓鱼与语音钓鱼合计已占全部数据泄露事件的19%;其2026年度报告进一步将借口套话(Pretexting,即实时语音或聊天对话操纵)单独列为初始访问向量,占比约6%。
语音钓鱼已从早期的人工"话术"模式,演进为完全工业化的攻击向量。2024—2026年的关键特征包括:
语音钓鱼防御技术经历了从被动黑名单到主动AI检测的四个主要阶段,每一阶段都对应着攻击手法的升级与防御需求的深化:
参照MITRE ATT&CK与主流事件响应报告(Mandiant、CrowdStrike、Microsoft)的归因分析,典型Vishing攻击可解构为六个阶段。理解攻击链的每个环节,是部署针对性防御措施的前提。
从LinkedIn、企业官网、泄露库、社交媒体获取目标姓名、职位、组织架构与语音样本
租用VoIP网关、伪造主叫号码、搭建仿冒IVR系统、训练语音克隆模型
拨打电话或发起视频通话,伪造官方号码/熟人声音/领导面孔,建立初步信任
制造紧迫感("账户异常""紧急转账""配合调查"),压制受害者的核实意愿
套取密码/验证码、重置MFA、安装远程控制工具、完成转账或数据窃取
利用获取的凭证横向渗透企业内网、窃取数据勒索,或将资金快速多级转移洗白
针对攻击链各环节,企业与个人可建立分层防御断点:
与其他钓鱼渠道相比,语音通道具有独特的攻防特性:
语音钓鱼并非孤立威胁,而是与邮件、短信、即时通讯、深度伪造视频共同构成多通道攻击矩阵。下表从触达方式、信任基础、防御难点等维度进行横向对比。
| 对比维度 | 邮件钓鱼 (Email Phishing) | 短信钓鱼 (Smishing) | 语音钓鱼 (Vishing) | 深度伪造视频钓鱼 |
|---|---|---|---|---|
| 触达方式 | 批量或定向邮件投递 | 伪基站、号码池群发短信 | VoIP外呼、改号呼叫、回拨、Help Desk直呼 | 伪造视频会议、FaceTime/微信视频通话 |
| 信任锚点 | 仿冒域名、品牌标识、邮件签名 | 官方号码段、钓鱼链接短网址 | 声音相似度、来电号码显示、"真人对话"临场感 | 面孔与声音的高度逼真、"多人会议"的群体暗示 |
| 典型载荷 | 恶意链接、附件、凭据钓鱼页 | 钓鱼短链接、木马APP下载 | 话术诱导:密码/验证码套取、远程工具安装、转账指令 | 会议场景下的转账授权、内部信息套取 |
| 防御难点 | URL变形、品牌仿冒、域名抢注 | 缺乏企业级短信安全网关 | 实时性压制查证、无URL可扫、身份无法目视确认 | 音画同步伪造、检测模型军备竞赛 |
| 核心防御 | 邮件网关、SPF/DKIM/DMARC、用户培训 | 运营商拦截、12321举报、机主警惕 | STIR/SHAKEN、AI语音检测、带外验证制度 | 音视频同步性检测、挑战性问题、转账复核 |
| 代表数据 | APWG统计2024年全球约376万起独立钓鱼攻击 | Verizon DBIR 2025:短信钓鱼与语音钓鱼合计占数据泄露事件的19% | CrowdStrike:2024下半年环比激增442% | Arup单案损失约2,500万美元 |
国内语音钓鱼在手法上与国际趋势同步演进,同时依托本土通信生态形成了独特的攻击路径。公安机关与行业监管部门持续开展打击治理与防范宣传。
语音钓鱼技术经历了从简单号码伪造到AI多模态深度伪造的演进。结合CrowdStrike、Mandiant、Pindrop等机构的威胁情报数据,当前主要存在以下六类核心攻击手法。
利用文本转语音(TTS)与语音转换(VC)技术,基于目标人物少量语音样本(FTC提示称几秒钟即可)克隆其声音特征,实施高度逼真的冒充诈骗。2024年深度伪造欺诈尝试增长超过1,300%(Pindrop)。攻击者使用ElevenLabs等商业平台或Bark、XTTS等开源工具生成克隆语音,通过VoIP拨号系统批量外呼。检测难点在于现代神经声码器(如HiFi-GAN、BigVGAN)生成的语音在频谱层面与真人高度相似。
数秒样本 → 克隆CEO声音 → 紧急转账指令利用VoIP技术和SS7信令漏洞伪造来电显示号码,冒充银行、公安、客服等官方号码。攻击者通过改号软件或自建VoIP网关,将主叫号码修改为与目标机构高度相似的号码。STIR/SHAKEN框架可对IP网络来电进行签名验证,但非IP网络转接与国际路由仍存在绕过空间;FCC 2024年8月对Lingo Telecom处以100万美元和解罚款,即因其未充分验证STIR/SHAKEN认证便传输了AI克隆语音诈骗通话。
+86-010-XXXX → 伪造为银行客服热线使用自动拨号系统(Predictive Dialer / Power Dialer)批量发送预录制的钓鱼语音消息。Hiya 2025年Q2标记137亿次疑似垃圾通话,其中大量为自动拨号系统发起。预录制内容通常伪装为"快递异常""账户冻结""中奖通知"等,诱导用户按数字键转接人工或访问钓鱼网站。2024年2月,FCC裁定AI生成语音在自动拨号中属于TCPA禁止的"人工或预录语音",为执法提供法律依据。
"您的包裹异常,按1转人工处理"搭建仿冒的交互式语音应答(IVR)系统,模拟银行、电信运营商的官方语音菜单,诱导用户输入银行卡号、密码、短信验证码等敏感信息。此类攻击常与号码伪造配合使用——用户看到熟悉的官方号码,听到标准化的语音提示,极易降低警惕。IVR系统可通过Asterisk、FreeSWITCH等开源PBX软件低成本搭建,配合语音合成引擎实现动态内容播报。
"请输入银行卡密码以验证身份"针对企业内部IT支持热线的精准攻击。攻击者通过公开信息(LinkedIn、企业官网)获取员工姓名与职位,冒充该员工拨打Help Desk请求密码重置或MFA变更。Mandiant M-Trends 2026报告显示,UNC3944等组织使用从公开资料获取的个人信息绕过身份验证问题,从初始访问到域管理员权限提升最快仅需数十分钟。MGM与Caesars 2023年入侵事件均以此方式得手,CISA随后发布专项安全公告(AA23-320A)指导企业加固。
"我是财务部张三,手机丢了需要重置MFA"将Vishing与Email、SMS、即时通讯组合为协同攻击链。典型模式:先发送钓鱼邮件诱导回拨(Callback Phishing,VIPRE 2025年Q4数据显示增长500%),或先进行"垃圾轰炸"(Spam Bombing)淹没受害者邮箱,再拨打伪造IT支持电话声称"检测到恶意活动"并诱导安装远程访问工具。Cisco Talos 2025年度回顾指出,针对IT管理员的语音钓鱼已实现三倍增长。TOAD模式自2023年起被APWG等组织持续追踪。
邮件诱导回拨 → 语音冒充IT → 远程工具安装根据Hiya 2025全球通话威胁报告,2025年第二季度标记了137亿次疑似垃圾通话,日均约1.5亿次,连续季度环比增长(Q4 2024: 113亿次 → Q1 2025: 125亿次 → Q2 2025: 137亿次)。CrowdStrike 2025威胁狩猎报告进一步指出,2025年上半年Vishing入侵量已超2024年全年总量,且2026上半年Vishing入侵量又达到2025下半年总量的两倍,连续四个半年期翻倍。Verizon 2025数据泄露调查报告(DBIR)显示,在社会工程相关数据泄露事件中,钓鱼占比最高、借口套话(Pretexting,语音通道是其主要载体)次之,而短信钓鱼与语音钓鱼合计已占全部数据泄露事件的19%。Verizon 2026年度报告中,借口套话单独作为初始访问向量占比约6%,电话模拟测试的点击率中位数(约2%)高于邮件模拟(约1.4%),凸显语音通道的欺骗效率优势。
从被动黑名单到主动AI检测,从单一号码验证到多模态融合判定,Vishing防御技术的每一次跃迁都深刻反映了语音通道攻防对抗的升级节奏。
基于用户举报和蜜罐数据构建高风险号码库,通过来电显示比对实现拦截。代表产品包括Truecaller、Hiya、YouMail等。此阶段的核心局限在于:号码更换成本极低,攻击者可在数小时内注册新号码;黑名单更新周期(以天或周计)远慢于攻击轮换速度;且无法应对号码伪造技术。据FTC统计,2019年美国消费者报告的欺诈损失已约达19亿美元,电话渠道的治理压力持续上升。
美国FCC推动STIR/SHAKEN框架部署,基于公钥基础设施(PKI)和数字签名验证来电ID真实性。TRACED法案(2019年12月签署)要求大型运营商在2021年6月前完成IP网络STIR/SHAKEN部署。框架定义A(完全认证)、B(部分认证)、C(网关认证)三级认证等级。然而,截至2025年9月,FCC Robocall Mitigation Database显示仅约44%的注册语音服务提供商(4,084/9,242)完全实施了STIR/SHAKEN,且非IP网络路由漏洞仍在封堵过程中。2024年8月,FCC对Lingo Telecom处以100万美元罚款,因其未充分验证STIR/SHAKEN认证即传输AI克隆语音诈骗通话。
基于声纹识别、语音活体检测和频谱伪影(artifacts)分析的检测技术进入商用阶段。ASVspoof系列评测(2015–2024)推动了反欺骗检测技术的标准化。Pindrop等厂商部署基于CNN和LSTM的语音反欺诈系统,检测合成语音中的高频噪声、相位不连续与基频异常。Xie等(2024)在IEEE/ACM Transactions on Audio, Speech and Language Processing发表Codecfake数据集与通用深度伪造音频检测方法,为跨TTS系统检测奠定基础。国内在语音深度伪造检测领域的研究亦取得显著进展,相关技术已在金融、电信等场景试点应用。
结合语音内容语义分析、呼叫行为模式、跨通道关联检测进行综合判定。大型语言模型(LLM)被用于实时通话内容的语义风险评分;图神经网络(GNN)分析呼叫关系图谱识别异常拨号模式;边缘AI部署将轻量级检测模型下沉至终端设备,实现通话中的实时预警。内容溯源方面,C2PA(内容真实性联盟)规范与Google SynthID、Meta AudioSeal等水印方案持续发展,但模拟信号传输中的"模拟鸿沟"(Analogue Gap)仍使数字水印与溯源信息在电话网络中面临挑战,实时通话溯源尚无成熟方案。2025年8月,FCC Enforcement Bureau分两批从Robocall Mitigation Database中移除了超过1,385家不合规提供商(第一批185家、第二批超过1,200家),形成迄今最严厉的执法行动,标志着治理侧从"框架建设"进入"强制清退"阶段。