子课题 11 · 公共互联网反网络钓鱼工作组

检测原理与防御框架技术专题

从频谱伪影分析到STIR/SHAKEN数字签名认证,从声纹生物特征到LLM语义风险评分,系统构建覆盖"终端—网络—平台—人员"四层防御体系的Vishing检测技术框架。

AI合成语音检测技术体系

AI语音克隆技术的爆发式增长催生了多层次的检测技术体系。从传统信号处理到深度神经网络,从单一声学特征到多模态融合,检测技术正经历从"判别真伪"到"溯源归因"的能力跃迁。

频谱与声学特征检测

基于信号处理与声学分析的传统检测方法,利用合成语音在频谱域的固有伪影(artifacts)进行判别:

  • 高频噪声分析:神经声码器(如HiFi-GAN、BigVGAN)在重构高频成分时引入的伪影具有统计规律性。通过分析8kHz以上频段的能量分布异常,可识别多数TTS系统生成的语音
  • 相位不连续性检测:真实语音的相位谱具有时间连续性,而合成语音因帧级处理导致相位跳变。利用短时傅里叶变换(STFT)相位导数方差可量化此不连续性
  • 基频(F0)轨迹异常:真实人声基频轨迹具有微扰(jitter)与shimmer的自然波动,合成语音基频过于平滑。通过提取F0轮廓并计算其分形维数与熵值,可区分真伪
  • 线性预测残差分析:真实语音的线性预测(LP)残差具有类噪声特性,而合成语音残差中残留周期性成分。利用残差信号的倒谱分析可捕获此类差异
D_phase = Var(∂φ/∂t) —— 相位导数方差
H_F0 = -Σ p(f0) log p(f0) —— 基频分布熵
R_lp = x(n) - Σ a_k x(n-k) —— 线性预测残差

深度神经网络检测

基于端到端深度学习的检测方法,直接从原始波形或频谱图中学习真伪判别特征:

  • RawNet2架构:直接从原始音频波形提取特征的端到端检测系统,利用Sinc卷积层学习可解释的滤波器组,在ASVspoof 2021 LA任务中作为强基线取得领先性能。RawNet2避免了传统手工特征工程,对未知TTS系统具有更强的泛化能力
  • AASIST模型:基于图神经网络的音频反欺骗系统,将频谱图视为图结构数据,利用图注意力机制捕获频谱单元之间的长程依赖关系。AASIST在ASVspoof 2021 LA基准上实现了当时最优的等错误率(EER)之一
  • Codecfake通用检测:Xie等(2024)在IEEE/ACM Transactions on Audio, Speech and Language Processing发表的工作提出了Codecfake数据集与通用深度伪造音频检测框架,覆盖多种神经编解码器(SoundStream、EnCodec、AudioDec)生成的伪造音频,解决了跨TTS/VC系统检测的泛化难题
  • CLAD对比学习:Wu等(2024)提出的CLAD框架利用对比学习增强检测器对操控攻击的鲁棒性,通过构建正负样本对在特征空间拉近真实语音、推远伪造语音
原始波形
Sinc卷积
GRU编码
全连接层
真伪判别

语音生物特征与活体检测

基于说话人身份验证的防御技术,将Vishing检测转化为"验证说话人身份"的问题:

  • 声纹识别(Speaker Verification):利用x-vector、ECAPA-TDNN等深度声纹嵌入模型,将通话语音与注册声纹模板比对。若相似度低于阈值,则触发警报。Pindrop等厂商已将其部署于联络中心场景
  • 语音活体检测(Liveness Detection):通过要求用户复述随机生成的挑战短语(Challenge-Response),验证语音的实时性。攻击者无法预先克隆未公开的随机内容,从而有效防御重放攻击与预录克隆。2024年Ferrari员工正是利用挑战性问题识破了一起深度伪造CEO电话诈骗
  • 呼吸与停顿分析:分析语音中的自然呼吸节奏、停顿模式与填充词(filler words)分布。合成语音通常缺乏自然的呼吸生理特征,停顿位置过于规律
  • 情感一致性检测:检测语音情感与声称场景的匹配度。例如,声称"账户异常"的语音若缺乏焦虑或紧迫感,可能为合成语音

LLM语义风险评分

利用大型语言模型对通话内容进行实时语义分析,识别钓鱼话术与诱导性表述:

  • 话术模式识别:构建紧急话术库("立即转账""安全账户""配合调查"等),利用LLM对通话转录文本进行语义匹配与风险评分。KnowBe4 2025年钓鱼行业基准研究显示,安全意识培训可在12个月内将员工钓鱼易感性从33.1%降至4.1%,降幅达86%
  • 上下文一致性检测:分析通话中声称身份与所提要求的逻辑一致性。例如,"银行客服"要求提供短信验证码即存在逻辑矛盾
  • 跨语言检测:针对多语言Vishing攻击,利用多语言预训练模型(如mBERT、XLM-R)实现跨语言话术识别,覆盖英语、中文、粤语等常见攻击语言
  • 流式分析架构:对通话音频流进行分段实时转录与分析,无需等待完整通话即可输出风险评分,实现近实时的预警

STIR/SHAKEN来电身份认证框架

STIR/SHAKEN(Secure Telephony Identity Revisited / Signature-based Handling of Asserted information using toKENs)是当前全球最重要的来电身份认证技术框架。本节从技术原理、部署现状与局限性三个维度进行系统解析。

STIR/SHAKEN 认证架构

基于PKI的端到端来电身份数字签名验证

发起运营商
Originating VSP
中间运营商
Intermediate VSP
落地运营商
Terminating VSP
SIP信令路径 · PASSporT身份令牌
私钥签名
Identity Header
令牌传递
SIP INVITE
公钥验证
Attestation Level
证书链验证 · STI-GA治理
终端设备 · 来电显示可信度判定

技术原理与PASSporT令牌

STIR/SHAKEN框架基于IETF RFC 8224(STIR)与ATIS-1000074(SHAKEN)标准,利用公钥基础设施(PKI)对SIP呼叫中的来电身份信息进行数字签名:

  • PASSporT结构:基于JSON Web Token(JWT)格式的身份断言,包含发起号码(orig)、目标号码(dest)、时间戳(iat)与认证等级(attest)。使用ES256算法进行签名
  • 三级认证等级:A级(Full Attestation)——运营商完全验证用户身份与号码所有权;B级(Partial Attestation)——运营商验证用户身份但未完全验证号码所有权;C级(Gateway Attestation)——仅验证呼叫通过网关进入网络,无法验证发起方身份
  • 证书管理:由STIR治理机构(STI-GA)制定证书策略,STI政策管理机构(STI-PA,由iconectiv担任)负责颁发服务提供商代码(SPC)令牌并管理证书基础设施
  • RMD数据库:FCC Robocall Mitigation Database要求所有语音服务提供商注册并提交反自动电话缓解计划。2025年8月,FCC Enforcement Bureau先移除185家不合规提供商,随后同月再移除超过1,200家,两批合计超过1,385家,形成迄今最严厉的执法行动
PASSporT = Base64Url(Header) . Base64Url(Payload) . Base64Url(Signature)
Header: {"alg":"ES256","ppt":"shaken","typ":"passport","x5u":"https://cert.example/cert.pem"}
Payload: {"attest":"A","dest":{"tn":["+1-202-555-0123"]},"iat":1720000000,"orig":{"tn":"+1-202-555-0100"}}

部署现状与监管演进

STIR/SHAKEN自2019年TRACED法案签署以来经历了多轮监管强化,但全面部署仍面临结构性挑战:

  • 部署进度:截至2025年9月,FCC Robocall Mitigation Database共有9,242家注册语音服务提供商,其中4,084家完全实施STIR/SHAKEN(约44%)。完全实施数量较2024年的4,365家有所下降,主因FCC加强了执法、移除不合规提供商
  • 第三方签名新规:FCC于2024年11月通过第八份来电认证报告与命令(FCC 24-120),要求承担STIR/SHAKEN签名义务的提供商自2025年9月18日起使用自有数字证书为呼叫签名,不得完全依赖第三方证书;部分转售商获得豁免
  • 非IP网络漏洞:STIR/SHAKEN仅适用于IP网络(SIP信令)。攻击者可通过传统PSTN转接或国际网关绕过认证。FCC已就此提出规则制定提案(NPRM),研究要求非IP网络实施替代认证技术的方案
  • 国际互认缺失:目前STIR/SHAKEN主要在美国部署。英国通信管理局Ofcom于2024年2月评估后未强制要求CLI认证,而是采取"Do Not Originate"清单等替代措施;比利时自2024年9月起阻断所有显示比利时号码的国际来电,为国际侧治理提供了实践样本
  • 拟议的强化处罚:FCC在2025年的后续合规程序中提出进一步加强Robocall Mitigation Database管理,拟对提交虚假信息者处以1万美元罚款、对逾期更新信息者按日处以1,000美元罚款,并拟引入申报费用机制(截至本专题发布时处于审议推进阶段)

STIR/SHAKEN 核心局限

STIR/SHAKEN框架的核心局限在于:它验证的是电话号码的真实性,而非通话内容或说话人的真实性。FCC有线竞争局发布的STIR/SHAKEN效能评估报告确认,该框架在正确应用时能够有效认证来电ID信息——但"认证"的范围有明确边界:攻击者可将克隆语音通过已认证的合法号码拨出,此时框架完全失效。此外,模拟信号传输中的"模拟鸿沟"(Analogue Gap)使数字水印与内容溯源信息在PSTN网络中难以存活;C2PA等内容溯源规范与Google SynthID、Meta AudioSeal等水印方案虽在数字媒体领域持续推进,但均无法解决实时电话通话中的溯源问题。因此,STIR/SHAKEN是必要但不充分的防御层,必须与语音内容检测、行为分析等技术协同部署。

数据来源:FCC Wireline Competition Bureau STIR/SHAKEN Efficacy Report / FCC Eighth Caller ID Authentication Report and Order (FCC 24-120, Nov 2024) / Ofcom Tackling Scam Calls and Texts (Feb 2024)

企业级Vishing防御框架

基于Mandiant、Microsoft、CISA等机构的威胁情报与事件响应经验,构建覆盖"终端感知—网络认证—平台检测—人员意识"四层防御架构。

四层防御架构

终端感知 · 网络认证 · 平台检测 · 人员意识

第四层
人员意识与流程
安全培训 · 红队演练 · 转账确认制度
第三层
平台检测与响应
语音网关AI检测 · 呼叫行为分析 · IVR蜜罐
第二层
网络认证与过滤
STIR/SHAKEN验证 · 号码信誉库 · 跨境过滤
第一层
终端感知与拦截

第一层:终端感知与拦截

在用户终端侧部署来电识别、语音检测与行为拦截能力:

  • AI来电筛选:iOS与Android系统已原生集成来电识别与垃圾通话过滤功能,企业可部署第三方增强方案(如Hiya Enterprise),由AI助手先行接听并甄别来电意图
  • 边缘语音检测:将轻量级RawNet2或MobileNet音频分类模型部署至企业终端设备,对通话音频进行实时真伪判别。模型可压缩至数MB量级,实现低延迟推理
  • 号码信誉查询:集成Truecaller、Hiya等第三方号码信誉API,在来电振铃前完成号码风险评分。对高风险号码自动转语音信箱或要求额外验证
  • 企业通讯录白名单:对声称来自内部领导、财务部门的来电进行企业通讯录号码白名单校验。非白名单号码声称内部身份时自动触发二次验证流程

第二层:网络认证与过滤

在电信网络侧构建来电身份认证与异常流量过滤能力:

  • STIR/SHAKEN强制验证:企业PBX与SBC(Session Border Controller)配置为仅接受A级或B级认证来电,拒绝C级或未认证来电。对国际来电实施额外验证流程
  • 呼叫行为分析:分析呼叫频率、时长、目的地、时间分布等异常模式。例如,短时间内大量呼叫不同员工的同一号码,或凌晨时段的"紧急"来电,均触发异常警报
  • 跨境过滤规则:针对境外来电诈骗高发的态势,对境外来电实施增强验证。比利时阻断显示本国号码的国际来电的做法可作为参考
  • DDoS与SIP Flood防护:在SBC上配置速率限制、动态黑名单与最大注册速率阈值,防止自动拨号系统通过SIP注册洪泛耗尽企业语音网关资源

第三层:平台检测与响应

在企业语音平台与联络中心部署AI检测与自动化响应能力:

  • 语音网关AI检测:在企业PBX/语音网关上部署实时语音分析模块,检测来电语音的声纹特征、频谱伪影与语义内容。Pindrop 2025报告显示,零售行业联络中心约每127通电话中就有1起欺诈尝试,欺诈率为金融服务行业的5倍;联络中心整体欺诈敞口估计达445亿美元
  • IVR蜜罐:部署模拟的交互式语音应答系统作为蜜罐,捕获并分析攻击者的IVR钓鱼话术与按键序列。蜜罐数据可用于训练检测模型与更新威胁情报
  • 跨通道关联检测:将语音通话数据与邮件、SMS、即时通讯数据进行关联分析。若同一号码在短时间内同时发送钓鱼邮件并拨打语音电话,自动提升风险等级
  • 实时转录与LLM评分:对Help Desk来电进行实时语音转录,利用LLM分析转录文本中的诱导性表述、紧急话术与身份声称不一致性,输出风险评分并联动处置

第四层:人员意识与流程

通过制度设计与安全意识培训,构建"人"这一最后防线的韧性:

  • Help Desk身份验证强化:Mandiant与CISA均建议,Help Desk在处理密码重置与MFA变更请求时,必须执行带外(Out-of-Band)身份验证——即通过预注册备用联系方式(如企业IM、备用邮箱)进行二次确认,不可仅凭来电声称身份即操作
  • 转账确认机制:建立"语音指令不可单独作为转账依据"的安全制度。所有资金转移必须辅以书面审批、企业IM确认或面对面二次验证。MGM与Caesars事件的核心教训即在于Help Desk流程缺失
  • Vishing红队演练:定期开展模拟Vishing攻击演练,测试员工对语音诈骗的识别能力。KnowBe4 2025年基准数据显示,安全意识培训可在12个月内将钓鱼易感性从33.1%降至4.1%,降幅达86%。Verizon 2026 DBIR进一步指出,电话模拟测试的点击率中位数(约2%)高于邮件模拟(约1.4%),说明语音通道的欺骗效率更高,针对性演练尤为必要
  • 事件响应预案:制定Vishing事件专项响应预案,明确从发现到隔离、取证、通报的完整流程。针对Help Desk被攻破的场景,预设"冻结全部近期重置账户"的应急操作手册

企业Vishing事件快速响应清单

参照CISA AA23-320A公告与Mandiant事件响应建议,当怀疑遭遇Help Desk冒充型Vishing攻击时,可按以下清单执行应急处置。

立即冻结近期变更账户

锁定过去24–72小时内通过Help Desk完成密码重置、MFA变更的所有账户,强制重新进行带外身份验证。

审计Help Desk工单与通话记录

调取近期全部密码重置与MFA变更工单,核对发起号码、验证方式与操作时间线,识别异常条目。

排查新增设备与令牌注册

检查身份提供商(IdP)日志中新注册的设备与认证令牌,攻击者通常会在得手后立即注册自有MFA设备。

横向移动痕迹排查

搜索可疑登录后的权限枚举、数据访问与外传行为;重点检查VPN、邮箱规则变更、云存储共享设置变更。

重置暴露凭证并升级验证强度

对受影响账户执行凭证轮换,将Help Desk身份验证升级为带外多因素核验,必要时暂停电话渠道的重置服务。

留存证据并依法报告

保存通话记录、工单、日志等证据链;涉及个人信息或重大损失的,按法规要求向监管部门报告,并配合公安机关调查。

个人用户Vishing防护指南

基于FTC、FBI及国内公安机关的消费者保护建议,提炼面向个人用户的高可操作性防护策略。

识别与验证策略

  • 回拨验证:对声称来自银行、公安、客服的来电,主动挂断后通过官方渠道(银行卡背面号码、110报警台、官网客服电话)回拨核实。切勿使用来电者提供的"核实号码"——FTC将其列为防范冒充诈骗的第一原则
  • 官方渠道优先:涉及资金、账户、密码的任何操作,优先通过官方APP、官方网站或实体柜台办理。绝不通过电话向任何人透露银行卡密码、短信验证码、支付密码
  • AI语音警惕信号:对声音过于"完美"、缺乏自然呼吸和停顿、情感表达与声称场景不匹配的来电保持高度警惕。可要求对方复述随机生成的内容(如约定的暗语、只有真人才知道的问题)以验证实时性——这正是Ferrari员工2024年识破深度伪造CEO来电的关键动作
  • 号码标记与举报:使用来电标记功能与运营商防骚扰服务(如天翼防骚扰、联通防骚扰管家),对疑似诈骗来电进行标记;通过12321平台或国家反诈中心APP举报

高风险场景清单

  • 冒充公检法:"您涉嫌洗钱/贩毒,需将资金转入安全账户配合调查"——公安机关不会通过电话、视频办案,不存在"安全账户"
  • 冒充客服:"您的快递丢失/账户异常/订单退款"——主动挂断后通过官方APP核实,绝不点击短信中的链接、绝不开启屏幕共享
  • 冒充领导熟人:"我是XX总/我是你领导,有笔急款需要处理"——AI换脸视频也可能造假,务必通过已知联系方式或见面二次确认;2023年包头430万元AI换脸案即此类手法
  • FaceTime陌生视频来电:多地警方预警此类冒充公检法诈骗;不常使用FaceTime的机主建议关闭该功能或设置"仅限联系人"
  • 技术支持诈骗:"我是微软/苹果客服,检测到您的设备有病毒"——正规厂商不会主动致电用户要求远程控制电脑或下载远程软件
  • 中奖/退税诈骗:"您中奖了/可以退税,需先缴纳手续费"——所有要求先付费、先转账的"奖励"均为诈骗

探索其他子课题