子课题 11 · 公共互联网反网络钓鱼工作组

语音钓鱼 (Vishing)研究专题

基于电话与VoIP通信渠道的语音钓鱼攻击研究,覆盖AI语音克隆、来电号码伪造、自动拨号系统、交互式语音应答钓鱼、Vishing与Email协同攻击等全场景。本专题分三篇系统阐述威胁全景、检测原理与防御框架、典型案例与研究前沿。

0%
H1→H2 2024 增速
CrowdStrike 2025
0%
Mandiant调查占比
2025年初始感染向量#2
0%
深度伪造欺诈增长
Pindrop 2025
0亿美元
联络中心欺诈敞口
Pindrop 2025 预估

语音钓鱼攻击技术全景

语音钓鱼(Vishing,Voice Phishing)是利用电话、VoIP、即时通讯语音通话等音频通信渠道实施的钓鱼攻击。随着生成式AI与语音克隆技术的普及,Vishing已从传统"冒充客服"的人工诈骗,演进为AI驱动的工业化攻击向量。据CrowdStrike 2025全球威胁报告,Vishing攻击量在2024年下半年相较上半年激增442%,成为增速最快的钓鱼攻击形态。

关键数据洞察

CrowdStrike 2025全球威胁报告显示,2024年下半年Vishing攻击量相较上半年激增442%,并以约40%的复合月增长率持续扩张;其后续发布的2025年威胁狩猎报告进一步确认,2025年上半年的Vishing入侵量已超过2024年全年总量,CrowdStrike 2026全球威胁报告测得2025年Vishing活动同比增长134%。Mandiant M-Trends 2026报告(基于2025年超过50万小时的应急响应调查)将语音钓鱼列为2025年第二常见的初始感染向量,在可识别攻击路径的调查中占比约11%(仅次于漏洞利用的32%,高于邮件钓鱼的6%);在云端环境入侵中,语音钓鱼更是以23%的占比成为第一大初始感染向量。Pindrop 2025语音情报与安全报告(分析12亿通联络中心通话)显示,2024年深度伪造欺诈尝试增长超过1,300%,从平均每月1起跃升至每天7起;联络中心面临的欺诈敞口估计达445亿美元。Hiya 2025全球通话威胁报告显示,2025年第二季度标记了137亿次疑似垃圾通话,日均约1.5亿次,连续季度环比增长(2024年Q4:113亿次 → 2025年Q1:125亿次 → 2025年Q2:137亿次)。美国联邦贸易委员会(FTC)数据显示,2024年冒充类诈骗造成约29.5亿美元损失,为损失额最高的诈骗类别;电话是消费者报告的第二大诈骗接触渠道。Verizon 2025数据泄露调查报告(DBIR)显示,短信钓鱼与语音钓鱼合计已占全部数据泄露事件的19%;其2026年度报告进一步将借口套话(Pretexting,即实时语音或聊天对话操纵)单独列为初始访问向量,占比约6%。

数据来源:CrowdStrike 2025 Global Threat Report / CrowdStrike 2025 & 2026 Threat Hunting Report / CrowdStrike 2026 Global Threat Report / Mandiant M-Trends 2026 / Pindrop 2025 Voice Intelligence and Security Report / Hiya Global Call Threat Report Q2 2025 / FTC Consumer Sentinel Network Data Book 2024 / Verizon DBIR 2025 & 2026

攻击生态工业化

语音钓鱼已从早期的人工"话术"模式,演进为完全工业化的攻击向量。2024—2026年的关键特征包括:

  • AI语音克隆低成本化:FTC 2024年消费者提示指出,仅需几秒钟的音频样本(来自YouTube视频、会议录音或语音信箱问候语)即可生成足以欺骗常人的语音克隆。ElevenLabs、Play.ht等商业TTS平台以及Bark、XTTS等开源工具大幅降低了攻击门槛(McAfee 2024年研究亦曾以3秒样本完成克隆演示)
  • Help Desk成为首要攻击面:Mandiant M-Trends 2026报告指出,UNC3944(Scattered Spider / Octo Tempest)等威胁组织通过冒充员工拨打IT支持热线,诱导客服人员重置密码并变更MFA设置;公开应急响应报告显示,此类入侵从初始访问到域管理员权限提升最快仅需数十分钟,部分案例不足一小时。MGM、Caesars、Snowflake(约165家机构受害)、M&S、Co-op等知名企业均遭此类攻击入侵或波及
  • 多通道协同攻击:CrowdStrike 2025全球威胁报告记录了2024年至少6起威胁组织冒充IT支持人员拨打目标用户电话、诱导其建立远程支持会话的入侵行动,其中至少4起结合了"垃圾邮件轰炸"(Spam Bombing)作为前置手段——先向受害者邮箱灌入数千封垃圾邮件,再致电声称"检测到恶意活动"。此类手法也被业界称为TOAD(Telephone Oriented Attack Delivery,电话导向攻击投递)
  • Callback Phishing爆发:VIPRE Security Group 2025年第四季度邮件威胁报告(2026年2月发布)显示,回拨钓鱼(邮件诱导受害者回拨攻击者控制的号码)占全部钓鱼事件的比例从3%跃升至18%,增长500%,完全绕过了邮件URL扫描防御;LevelBlue的研究亦指出43%的BEC攻击包含回拨诱饵
  • 深度伪造视频通话:2024年Arup公司财务员工在一场深度伪造视频会议上向诈骗者转账约2,500万美元,会议中CFO及高管的面孔与声音均为AI生成,标志着Vishing进入多模态深度伪造阶段

防御技术演进路径

语音钓鱼防御技术经历了从被动黑名单到主动AI检测的四个主要阶段,每一阶段都对应着攻击手法的升级与防御需求的深化:

  • 黑名单阶段(2005–2015):基于用户举报和蜜罐数据构建高风险号码库,代表工具为Truecaller、Hiya等来电识别应用。核心局限在于无法应对新注册号码和号码伪造技术
  • 来电身份认证阶段(2015–2020):美国FCC推动STIR/SHAKEN框架部署,基于数字签名验证来电ID真实性。TRACED法案于2019年12月签署,要求大型运营商在2021年6月前完成IP网络部署。但截至2025年9月,FCC反自动电话数据库中仅约44%的注册语音服务提供商完全实施了STIR/SHAKEN
  • 语音生物特征阶段(2020–2024):引入声纹识别、语音活体检测(Liveness Detection)和频谱伪影(artifacts)分析技术。Pindrop等厂商开始部署基于深度学习的语音反欺诈系统,检测合成语音中的高频噪声与相位不连续。ASVspoof系列国际评测(2015–2024)持续推动反欺骗检测技术的标准化
  • 多模态融合阶段(2024–至今):结合语音内容语义分析、呼叫行为模式、跨通道关联检测进行综合判定。大型语言模型(LLM)被用于实时通话内容的风险评分,图神经网络(GNN)分析呼叫关系图谱识别异常拨号模式,Pindrop等厂商已推出面向Zoom、Teams、Webex会议的实时深度伪造检测产品

Vishing攻击链全景分析

参照MITRE ATT&CK与主流事件响应报告(Mandiant、CrowdStrike、Microsoft)的归因分析,典型Vishing攻击可解构为六个阶段。理解攻击链的每个环节,是部署针对性防御措施的前提。

1
情报收集

从LinkedIn、企业官网、泄露库、社交媒体获取目标姓名、职位、组织架构与语音样本

2
基础设施准备

租用VoIP网关、伪造主叫号码、搭建仿冒IVR系统、训练语音克隆模型

3
触达与伪装

拨打电话或发起视频通话,伪造官方号码/熟人声音/领导面孔,建立初步信任

4
信任操纵

制造紧迫感("账户异常""紧急转账""配合调查"),压制受害者的核实意愿

5
目标达成

套取密码/验证码、重置MFA、安装远程控制工具、完成转账或数据窃取

6
横向移动与变现

利用获取的凭证横向渗透企业内网、窃取数据勒索,或将资金快速多级转移洗白

防御断点在哪里?

针对攻击链各环节,企业与个人可建立分层防御断点:

  • 情报收集阶段:最小化公开个人与组织架构信息暴露;对高管公开演讲视频、会议录音中的语音资产进行暴露面管理
  • 基础设施阶段:STIR/SHAKEN来电认证、号码信誉库、跨境来话增强验证,压缩号码伪造空间
  • 触达阶段:AI来电筛选、声纹比对、来电显示官方号码时的"反向核实"习惯
  • 信任操纵阶段:制度化"转账确认机制"——任何涉及资金、密码、MFA变更的请求必须通过带外渠道二次确认
  • 目标达成阶段:Help Desk带外身份验证、支付双人复核、会话行为异常检测

语音通道的特殊性

与其他钓鱼渠道相比,语音通道具有独特的攻防特性:

  • 实时性压力:通话是同步交互,受害者没有"停下来查证"的时间窗口,攻击者可利用语气、语速制造紧迫感——这是邮件钓鱼不具备的心理压迫优势
  • 信任锚点不同:邮件钓鱼依赖域名与内容仿冒,Vishing直接利用"熟悉的声音""官方号码显示"作为信任锚点,而语音合成与改号技术已能同时伪造两者
  • 绕过邮件安全栈:Callback Phishing与TOAD模式刻意避开URL与附件检测,将攻击载荷转移到电话通道,迫使防御方在邮件网关之外建立语音侧检测能力
  • 身份验证困境:传统的"听声音识人"在AI克隆时代已不可靠,MGM等事件表明Help Desk的电话身份验证流程是企业最薄弱环节

钓鱼攻击渠道特征对比

语音钓鱼并非孤立威胁,而是与邮件、短信、即时通讯、深度伪造视频共同构成多通道攻击矩阵。下表从触达方式、信任基础、防御难点等维度进行横向对比。

对比维度 邮件钓鱼 (Email Phishing) 短信钓鱼 (Smishing) 语音钓鱼 (Vishing) 深度伪造视频钓鱼
触达方式 批量或定向邮件投递 伪基站、号码池群发短信 VoIP外呼、改号呼叫、回拨、Help Desk直呼 伪造视频会议、FaceTime/微信视频通话
信任锚点 仿冒域名、品牌标识、邮件签名 官方号码段、钓鱼链接短网址 声音相似度、来电号码显示、"真人对话"临场感 面孔与声音的高度逼真、"多人会议"的群体暗示
典型载荷 恶意链接、附件、凭据钓鱼页 钓鱼短链接、木马APP下载 话术诱导:密码/验证码套取、远程工具安装、转账指令 会议场景下的转账授权、内部信息套取
防御难点 URL变形、品牌仿冒、域名抢注 缺乏企业级短信安全网关 实时性压制查证、无URL可扫、身份无法目视确认 音画同步伪造、检测模型军备竞赛
核心防御 邮件网关、SPF/DKIM/DMARC、用户培训 运营商拦截、12321举报、机主警惕 STIR/SHAKEN、AI语音检测、带外验证制度 音视频同步性检测、挑战性问题、转账复核
代表数据 APWG统计2024年全球约376万起独立钓鱼攻击 Verizon DBIR 2025:短信钓鱼与语音钓鱼合计占数据泄露事件的19% CrowdStrike:2024下半年环比激增442% Arup单案损失约2,500万美元

中国语音钓鱼威胁特征与治理实践

国内语音钓鱼在手法上与国际趋势同步演进,同时依托本土通信生态形成了独特的攻击路径。公安机关与行业监管部门持续开展打击治理与防范宣传。

本土化攻击手法

  • VoIP改号冒充公检法:利用非法VoIP网关与改号软件,将来电显示伪造成"110"、公安机关办公电话或银行客服热线,配合"涉嫌洗钱""安全账户"话术实施诈骗。此类案件长期位居国内电信网络诈骗高发类型前列
  • FaceTime视频诈骗:多地公安机关发布预警,诈骗分子通过FaceTime发起视频通话,冒充公检法、客服或熟人,利用苹果用户对该界面的信任感实施诈骗。警方建议不常用FaceTime的机主关闭该功能或开启"仅限联系人"模式
  • 屏幕共享诱导诈骗:以"客服退款""取消会员扣费"等话术诱导受害者下载会议或远程协作APP并开启屏幕共享,实时窥视银行卡号、密码与验证码完成盗刷。该类手法被公安机关列为重点预警类型
  • AI换脸熟人诈骗:2023年内蒙古包头警方通报的典型案例中,诈骗分子通过盗用微信账号,利用AI换脸与拟声技术伪装成受害者好友,视频通话10分钟内骗取福州市某科技公司法人代表430万元(警银联动紧急止付336.84万元)。中国互联网协会随后发布公开提醒,指出"露脸且说话"的伪造视频制作成本已低至数十元

国内治理与防护基础设施

  • 国家反诈中心APP:提供涉诈来电、短信、APP预警拦截功能,是公安部推出的官方反诈工具
  • 12321举报受理中心:工业和信息化部委托设立的12321网络不良与垃圾信息举报受理中心,受理垃圾短信、骚扰电话、不良APP等举报,为行业封堵提供数据支撑
  • 运营商防骚扰服务:中国电信"天翼防骚扰"、中国联通"防骚扰管家"等官方服务基于云端号码库与AI识别,对疑似诈骗、骚扰来电进行拦截或标注
  • 打击黑灰产行动:公安机关持续打击为诈骗提供通信支撑的非法VoIP网关、GOIP设备、猫池与SIM卡贩运链条,切断语音钓鱼的基础设施供给
  • 行业规范:《中华人民共和国反电信网络诈骗法》自2022年12月1日起施行,对电话卡、物联网卡、金融账户、互联网账号的全链条治理作出系统性规定,为语音钓鱼源头治理提供法律依据

六大Vishing攻击技术体系

语音钓鱼技术经历了从简单号码伪造到AI多模态深度伪造的演进。结合CrowdStrike、Mandiant、Pindrop等机构的威胁情报数据,当前主要存在以下六类核心攻击手法。

01

AI语音克隆型(Voice Cloning)

利用文本转语音(TTS)与语音转换(VC)技术,基于目标人物少量语音样本(FTC提示称几秒钟即可)克隆其声音特征,实施高度逼真的冒充诈骗。2024年深度伪造欺诈尝试增长超过1,300%(Pindrop)。攻击者使用ElevenLabs等商业平台或Bark、XTTS等开源工具生成克隆语音,通过VoIP拨号系统批量外呼。检测难点在于现代神经声码器(如HiFi-GAN、BigVGAN)生成的语音在频谱层面与真人高度相似。

数秒样本 → 克隆CEO声音 → 紧急转账指令
02

来电号码伪造型(Caller ID Spoofing)

利用VoIP技术和SS7信令漏洞伪造来电显示号码,冒充银行、公安、客服等官方号码。攻击者通过改号软件或自建VoIP网关,将主叫号码修改为与目标机构高度相似的号码。STIR/SHAKEN框架可对IP网络来电进行签名验证,但非IP网络转接与国际路由仍存在绕过空间;FCC 2024年8月对Lingo Telecom处以100万美元和解罚款,即因其未充分验证STIR/SHAKEN认证便传输了AI克隆语音诈骗通话。

+86-010-XXXX → 伪造为银行客服热线
03

自动拨号系统型(Robocall / Auto-dialer)

使用自动拨号系统(Predictive Dialer / Power Dialer)批量发送预录制的钓鱼语音消息。Hiya 2025年Q2标记137亿次疑似垃圾通话,其中大量为自动拨号系统发起。预录制内容通常伪装为"快递异常""账户冻结""中奖通知"等,诱导用户按数字键转接人工或访问钓鱼网站。2024年2月,FCC裁定AI生成语音在自动拨号中属于TCPA禁止的"人工或预录语音",为执法提供法律依据。

"您的包裹异常,按1转人工处理"
04

交互式语音应答钓鱼(IVR Phishing)

搭建仿冒的交互式语音应答(IVR)系统,模拟银行、电信运营商的官方语音菜单,诱导用户输入银行卡号、密码、短信验证码等敏感信息。此类攻击常与号码伪造配合使用——用户看到熟悉的官方号码,听到标准化的语音提示,极易降低警惕。IVR系统可通过Asterisk、FreeSWITCH等开源PBX软件低成本搭建,配合语音合成引擎实现动态内容播报。

"请输入银行卡密码以验证身份"
05

Help Desk冒充型(Help Desk Impersonation)

针对企业内部IT支持热线的精准攻击。攻击者通过公开信息(LinkedIn、企业官网)获取员工姓名与职位,冒充该员工拨打Help Desk请求密码重置或MFA变更。Mandiant M-Trends 2026报告显示,UNC3944等组织使用从公开资料获取的个人信息绕过身份验证问题,从初始访问到域管理员权限提升最快仅需数十分钟。MGM与Caesars 2023年入侵事件均以此方式得手,CISA随后发布专项安全公告(AA23-320A)指导企业加固。

"我是财务部张三,手机丢了需要重置MFA"
06

多通道协同型(Multi-channel / TOAD)

将Vishing与Email、SMS、即时通讯组合为协同攻击链。典型模式:先发送钓鱼邮件诱导回拨(Callback Phishing,VIPRE 2025年Q4数据显示增长500%),或先进行"垃圾轰炸"(Spam Bombing)淹没受害者邮箱,再拨打伪造IT支持电话声称"检测到恶意活动"并诱导安装远程访问工具。Cisco Talos 2025年度回顾指出,针对IT管理员的语音钓鱼已实现三倍增长。TOAD模式自2023年起被APWG等组织持续追踪。

邮件诱导回拨 → 语音冒充IT → 远程工具安装

行业监测数据

根据Hiya 2025全球通话威胁报告,2025年第二季度标记了137亿次疑似垃圾通话,日均约1.5亿次,连续季度环比增长(Q4 2024: 113亿次 → Q1 2025: 125亿次 → Q2 2025: 137亿次)。CrowdStrike 2025威胁狩猎报告进一步指出,2025年上半年Vishing入侵量已超2024年全年总量,且2026上半年Vishing入侵量又达到2025下半年总量的两倍,连续四个半年期翻倍。Verizon 2025数据泄露调查报告(DBIR)显示,在社会工程相关数据泄露事件中,钓鱼占比最高、借口套话(Pretexting,语音通道是其主要载体)次之,而短信钓鱼与语音钓鱼合计已占全部数据泄露事件的19%。Verizon 2026年度报告中,借口套话单独作为初始访问向量占比约6%,电话模拟测试的点击率中位数(约2%)高于邮件模拟(约1.4%),凸显语音通道的欺骗效率优势。

数据来源:Hiya Global Call Threat Report Q2 2025 / CrowdStrike 2025 & 2026 Threat Hunting Report / CrowdStrike 2026 Global Threat Report / Verizon DBIR 2025 & 2026 / Mandiant M-Trends 2026

Vishing防御技术演进史

从被动黑名单到主动AI检测,从单一号码验证到多模态融合判定,Vishing防御技术的每一次跃迁都深刻反映了语音通道攻防对抗的升级节奏。

第一代 · 2005–2015 已完成

黑名单与来电识别阶段

基于用户举报和蜜罐数据构建高风险号码库,通过来电显示比对实现拦截。代表产品包括Truecaller、Hiya、YouMail等。此阶段的核心局限在于:号码更换成本极低,攻击者可在数小时内注册新号码;黑名单更新周期(以天或周计)远慢于攻击轮换速度;且无法应对号码伪造技术。据FTC统计,2019年美国消费者报告的欺诈损失已约达19亿美元,电话渠道的治理压力持续上升。

号码黑名单用户举报来电识别Truecaller
第二代 · 2015–2020 已完成

来电身份认证框架阶段

美国FCC推动STIR/SHAKEN框架部署,基于公钥基础设施(PKI)和数字签名验证来电ID真实性。TRACED法案(2019年12月签署)要求大型运营商在2021年6月前完成IP网络STIR/SHAKEN部署。框架定义A(完全认证)、B(部分认证)、C(网关认证)三级认证等级。然而,截至2025年9月,FCC Robocall Mitigation Database显示仅约44%的注册语音服务提供商(4,084/9,242)完全实施了STIR/SHAKEN,且非IP网络路由漏洞仍在封堵过程中。2024年8月,FCC对Lingo Telecom处以100万美元罚款,因其未充分验证STIR/SHAKEN认证即传输AI克隆语音诈骗通话。

STIR/SHAKENTRACED法案PASSporT数字签名
第三代 · 2020–2024 主流应用

语音生物特征与深度学习检测阶段

基于声纹识别、语音活体检测和频谱伪影(artifacts)分析的检测技术进入商用阶段。ASVspoof系列评测(2015–2024)推动了反欺骗检测技术的标准化。Pindrop等厂商部署基于CNN和LSTM的语音反欺诈系统,检测合成语音中的高频噪声、相位不连续与基频异常。Xie等(2024)在IEEE/ACM Transactions on Audio, Speech and Language Processing发表Codecfake数据集与通用深度伪造音频检测方法,为跨TTS系统检测奠定基础。国内在语音深度伪造检测领域的研究亦取得显著进展,相关技术已在金融、电信等场景试点应用。

ASVspoof声纹识别CNN/LSTMCodecfake
第四代 · 2024–至今 前沿探索

多模态融合与实时检测阶段

结合语音内容语义分析、呼叫行为模式、跨通道关联检测进行综合判定。大型语言模型(LLM)被用于实时通话内容的语义风险评分;图神经网络(GNN)分析呼叫关系图谱识别异常拨号模式;边缘AI部署将轻量级检测模型下沉至终端设备,实现通话中的实时预警。内容溯源方面,C2PA(内容真实性联盟)规范与Google SynthID、Meta AudioSeal等水印方案持续发展,但模拟信号传输中的"模拟鸿沟"(Analogue Gap)仍使数字水印与溯源信息在电话网络中面临挑战,实时通话溯源尚无成熟方案。2025年8月,FCC Enforcement Bureau分两批从Robocall Mitigation Database中移除了超过1,385家不合规提供商(第一批185家、第二批超过1,200家),形成迄今最严厉的执法行动,标志着治理侧从"框架建设"进入"强制清退"阶段。

LLM语义分析GNN图谱边缘AIC2PA溯源FCC强制清退

探索其他子课题