网络钓鱼编年史 - 芦笛·编著
第九章 · 智能猎手
第五节

多模态猎杀——文本+语音+视频的组合攻击

现代AI钓鱼攻击不再局限于单一渠道。TOAD模式将邮件钓鱼与语音钓鱼结合,深度伪造视频会议诈骗层出不穷。当攻击者可以同时伪造你的视觉、听觉和文字感知,人类的多重验证机制还能否奏效?

2023年4月20日中午,福州市某科技公司法人代表郭先生的微信突然弹出一条视频通话请求——来电显示是他相识多年的好友。视频中,那张熟悉的面孔、那口亲切的乡音,一切都与真人无异。"好友"说,自己正在外地竞标,急需430万元保证金,需要借用郭先生公司的账户走一下账。郭先生在视频中确认了面孔和声音,没有多想,于11时49分先后分两笔将430万元转到了对方指定的账户。转账后他给好友发了一条微信,对方回了一个问号。郭先生拨通电话,真正的好友说:"我根本没给你打过视频。"骗子通过智能AI换脸和拟声技术,佯装成好友对他实施了诈骗。

从接通视频到完成转账,全程不到10分钟。这起案件由内蒙古自治区包头市公安局电信网络犯罪侦查局发布通报,警银联动成功紧急止付336.84万元,但仍有93.16万元被转移。这不是科幻电影的情节,而是AI多模态组合攻击走进现实的标志性事件——当视觉、听觉和文字三个维度的信任基石同时被AI攻破,人类赖以生存的多重验证机制正在面临前所未有的崩塌危机。

一、从"单点突破"到"立体围剿":多模态攻击的进化逻辑

在人类漫长的欺骗史中,攻击者始终遵循一条朴素的法则:信任建立在多重感知的交叉验证之上。我们相信一个人,是因为我们同时看到了他的面孔、听到了他的声音、读到了他的文字——三种感知渠道的一致性,构成了信任的三角支架。传统钓鱼攻击之所以成功率有限,正是因为它通常只攻破其中一个维度:一封伪造的邮件只触及文字,一通冒充的电话只触及听觉,一个伪造的视频只触及视觉。受害者总有机会通过其他渠道进行交叉验证——"我收到了老板的邮件,但我打个电话确认一下",或者"我接到了银行的电话,但我登录官网核实一下"。

AI多模态组合攻击的颠覆性,在于它同时攻破了所有三个维度的信任基石。

2023年5月,当包头警方通报郭先生AI换脸诈骗案时,许多人第一次意识到:骗子不再满足于"冒充",而是开始"扮演"。他们利用AI换脸技术生成与真人几乎无法区分的视频形象,利用AI拟声技术克隆目标的声音特征,再利用精心设计的文本话术引导受害者完成转账。三个维度同时被攻破,意味着受害者失去了所有交叉验证的可能——当你看到视频中的"好友"、听到他的声音、读到他的文字,你还有什么理由怀疑这不是他本人?

这种"立体围剿"模式的进化,遵循着攻击者利益最大化的逻辑。据CrowdStrike 2025年全球威胁报告,2024年下半年语音钓鱼(Vishing)攻击激增442%,2025年上半年语音钓鱼总量已超过2024年全年。Mandiant M-Trends 2026报告将语音钓鱼列为2025年第二大常见初始感染向量,占Mandiant调查案件的11%。Pindrop 2025年语音智能与安全报告记录了2024年深度伪造欺诈尝试同比增长1,300%——从平均每月1起跃升至每天7起。这些数字背后,是攻击者从"单点突破"向"立体围剿"的战略转型:不再依赖单一渠道的成功率,而是通过多模态组合制造"无懈可击"的信任幻觉。

更深层的变化在于攻击的"心理维度"。传统钓鱼依赖"信息不对称"——攻击者知道一些受害者不知道的事。多模态组合攻击则依赖"感知一致性"——攻击者让受害者"亲眼看到、亲耳听到"虚假的现实。前者是理性的欺骗,后者是感性的催眠。当三种感知渠道同时被攻破时,人类的理性防御机制几乎无法启动——因为感性层面的"确信"已经先于理性层面的"怀疑"占据了主导。

深度伪造网络钓鱼与传统网络钓鱼的区别

多模态攻击进化关键数据

  • 语音钓鱼增长:2024年H1至H2增长442%(CrowdStrike 2025全球威胁报告)
  • 2025年H1语音钓鱼总量:已超过2024年全年(CrowdStrike 2025威胁狩猎报告)
  • 语音钓鱼在初始感染向量中排名:第2位,占Mandiant调查案件的11%(Mandiant M-Trends 2026)
  • 深度伪造欺诈增长:2024年同比增长1,300%,从每月1起增至每天7起(Pindrop 2025)
  • 合成语音在联络中心通话中占比:2024年Q4达0.33%,较Q1增长173%(Pindrop 2025)
  • 联络中心欺诈暴露:2025年预计达445亿美元(Pindrop 2025)
  • AI生成钓鱼邮件点击率:54%,是传统钓鱼的4.5倍(CrowdStrike 2025)
  • 深度伪造欺诈在金融领域增长:2023年激增700%(Deloitte金融服务研究中心)

多模态攻击关键指标增长趋势

数据来源:CrowdStrike 2025、Pindrop 2025、Mandiant M-Trends 2026、Deloitte 2024

2024-2025年间,语音钓鱼攻击量激增442%(CrowdStrike),深度伪造欺诈尝试同比增长1,300%(Pindrop),AI生成钓鱼邮件点击率达54%(传统钓鱼的4.5倍)。多模态攻击正从"单点突破"加速演变为"立体围剿"。

二、TOAD:邮件与语音的"双簧戏"

在多模态攻击的谱系中,TOAD(Telephone Oriented Attack Delivery,电话导向攻击投递)是一个相对"传统"但正在快速进化的模式。它的运作逻辑并不复杂:攻击者先发送一封伪造邮件,诱导受害者拨打邮件中提供的"客服电话";当受害者拨通电话后,另一端的攻击者用克隆的声音或精心训练的话术,进一步引导受害者安装恶意软件、泄露敏感信息或完成转账。

Proofpoint在其《2025年人类因素报告》中披露,该公司每年拦截1.17亿次TOAD威胁。这一数字本身就说明了TOAD攻击的规模化程度。但更令人警惕的是TOAD与AI技术的结合:攻击者不再依赖人工接听电话,而是利用AI语音克隆和对话机器人实现24小时不间断的"自动钓鱼"。

2024年至2025年间,TOAD攻击呈现出几个显著的新特征。首先是"主题多样化":从传统的"快递异常通知""银行账户冻结",扩展到"演唱会门票确认""医疗预约提醒""政府补贴申领"等更加生活化的场景。其次是"话术精细化":AI生成的语音不再是一成不变的机械朗读,而是能够根据受害者的回应实时调整语气和内容,模拟真实客服的对话节奏。第三是"渠道融合化":TOAD不再孤立运作,而是与短信钓鱼(smishing)、二维码钓鱼(quishing)和社交媒体钓鱼形成完整的攻击链条。

CrowdStrike在2025年追踪了至少六个以IT支持人员身份进行语音钓鱼的独立活动,以及至少四个利用"垃圾邮件轰炸"作为前置手段的后续语音钓鱼活动。攻击者先向目标邮箱发送数千封垃圾邮件,然后致电目标声称"您的邮箱被恶意软件感染,需要立即进行IT支持"。这种"先制造恐慌、再提供解决方案"的话术设计,充分利用了人类在焦虑状态下的判断力下降。

命名威胁组织如CURLY SPIDER(利用垃圾邮件轰炸+语音钓鱼部署后门)和CHATTY SPIDER(俄罗斯背景,以回调钓鱼进行数据窃取和勒索)的出现,标志着TOAD攻击从"散兵游勇"走向"组织化运营"。这些组织拥有明确的分工:有人负责邮件投递,有人负责语音交互,有人负责后续渗透,有人负责资金洗白。一条完整的"语音钓鱼产业链"正在暗网中形成。

TOAD攻击关键数据与特征

  • Proofpoint年拦截TOAD威胁:1.17亿次(Proofpoint 2025人类因素报告)
  • CrowdStrike追踪IT支持语音钓鱼活动:2024年至少6个独立活动
  • 垃圾邮件轰炸+语音钓鱼组合活动:至少4个(CrowdStrike 2025)
  • CURLY SPIDER攻击链完成时间:从初始接触到后门创建不到4分钟(CrowdStrike 2025)
  • TOAD主题演变:从银行/快递扩展至演唱会、医疗、政府补贴等生活化场景
  • AI语音克隆准确率:McAfee调查显示高达95%
  • 接到AI诈骗电话后蒙受经济损失比例:美国77%(McAfee 2024)

三、深度伪造视频会议:三模态攻击的枢纽

如果说TOAD是"邮件+语音"的双模态组合,那么深度伪造视频会议则是"邮件+语音+视频"的三模态终极形态。这种攻击模式的可怕之处不在于它攻破了单一感官,而在于它同时攻破了人类依赖的三种验证手段——当邮件、电话、视频三个渠道传递的信息完全一致时,受害者几乎丧失了所有交叉验证的可能。

关于深度伪造视频会议的典型案例,可参见本章第三节对Arup案和新加坡案的详细分析。这里需要强调的是,这些案例在多模态攻击的语境下呈现出新的意义:攻击者并非孤立地使用视频伪造技术,而是将其嵌入一个完整的攻击链条中。以新加坡案为例,攻击者先通过WhatsApp建立初步联系,再发送伪造的法律文件构建合法性,最后以深度伪造视频会议完成"信任确认"——三个渠道层层递进,每一步都在消除受害者的疑虑。

在中国,深度伪造视频会议诈骗同样呈爆发态势。2025年5月,深圳某公司遭遇AI换脸冒充董事长视频会议诈骗,损失98万元,诈骗分子使用4K分辨率伪造视频下达转账指令。2025年9月,深圳某企业会计再次遭遇同类诈骗。这些案例与Arup案、新加坡案的技术路径高度相似,说明深度伪造视频会议的手法正在全球范围内快速复制和传播。

技术门槛的降低是这种传播的关键推手。据行业分析,仅需一张静态照片和数分钟音频样本,攻击者就能生成足以以假乱真的实时视频。开源工具如DeepFaceLab、FaceSwap等已使深度伪造技术普及化,暗网上的商业化服务价格从几百美元到数万美元不等。更关键的是,2024-2025年间出现的实时深度伪造技术,可以在视频通话过程中实时替换通话者的面部和声音——攻击者不再需要预先制作伪造视频,而是可以在真实通话中"实时扮演"任何人。

从多模态攻击的视角看,实时深度伪造技术的意义在于:它将视频渠道从"静态确认工具"升级为"动态交互工具"。在Arup案中,受害者多次进入视频会议"确认"转账,而每一次屏幕上的"CFO"都能根据情境调整语气和表情——这种实时响应能力,是传统预录视频无法实现的,也是多模态攻击最具欺骗性的特征。

深度伪造视频会议诈骗关键案例与数据

  • Arup香港办公室诈骗案(2024年1月):AI生成CFO和同事深度伪造视频,财务员工转账2亿港元(约2,560万美元)
  • 新加坡跨国公司Zoom诈骗案(2025年3月):深度伪造CFO视频会议,损失49.9万美元
  • 深圳某公司AI换脸冒充董事长案(2025年5月):4K分辨率伪造视频,损失98万元
  • 深圳某企业会计伪造领导视频案(2025年9月):高分辨率伪造视频指令诈骗
  • 深度伪造欺诈增长:2024年同比增长1,300%(Pindrop 2025)
  • 2025年Q1深度伪造诈骗事件:179起,超2024年全年150起
  • 深度伪造欺诈在金融领域增长:2023年激增700%(Deloitte金融服务研究中心)
  • AI生成欺诈损失预测:美国2027年将达400亿美元,2023年为123亿美元,CAGR 32%(Deloitte)
  • 仅0.1%的人能持续识别深度伪造(iProov 2025测试2,000名英美消费者)

深度伪造视频会议诈骗典型案例时间线

数据来源:Arup、Pindrop、Deloitte、深圳反诈中心、包头市公安局 2023-2025

从2023年福州郭先生10分钟被骗430万元,到2024年Arup香港办公室2亿港元深度伪造视频会议诈骗,再到2025年深圳98万元AI换脸冒充董事长案——深度伪造视频会议诈骗已从"偶发事件"演变为"常态化威胁",技术精度从低分辨率跃升至4K实时伪造。

四、组合机制:三种伪造手段如何相互强化

多模态攻击的终极形态,是将文本、语音和视频三种伪造手段无缝融合,构建一个"全感官"的欺骗环境。在这种攻击中,受害者不仅收到一封看似正常的邮件,还会接到一通"确认电话",甚至可能被邀请参加一场"视频会议"——而邮件、电话和视频会议中的"人",全部是AI生成的虚假存在。

福州郭先生被骗430万元案(详见本章第二节)和Arup案(详见本章第三节)都是这种组合攻击的实例。但本节需要分析的,不是案例本身,而是组合攻击的运作机制:三种伪造手段如何分工协作,如何层层递进地瓦解受害者的防御心理。

第一步,文本建立"认知框架"。邮件或消息的作用是设定场景——"机密收购""紧急付款""账户异常"——并为后续的电话和视频通话提供叙事铺垫。文本的内容经过精心设计,既包含足够的细节以增加可信度(如具体的金额、时间、对方公司名称),又制造适度的紧迫感以压缩受害者的思考时间。

第二步,语音提供"情感确认"。电话或语音消息的作用,是将文本中的抽象信息转化为带有情感色彩的人际互动。克隆的声音不仅传递信息,更传递"身份"——当受害者听到熟悉的声音时,大脑会自动激活与之相关的信任记忆,这种反应发生在理性判断之前。

第三步,视频完成"信任闭环"。视频会议的作用,是消除最后残留的疑虑。当受害者看到屏幕上"真人"的面孔、表情、肢体语言时,视觉确认的冲动会压倒一切怀疑。在Arup案中,受害者多次进入视频会议"确认"转账,正是因为视频提供了其他渠道无法比拟的"在场感"。

三种手段的组合效果,远大于各自效果的简单相加。心理学中的"多通道效应"表明,当同一信息通过多个感官通道同时呈现时,大脑对其真实性的评估会显著提升——这不是理性计算的结果,而是认知系统的固有偏好。多模态攻击正是利用了这一偏好:受害者以为自己正在进行"交叉验证",实际上只是在同一个谎言的不同表现形式之间循环确认。

2025年Zscaler ThreatLabz报告指出,攻击者正从大规模垃圾邮件转向精密社会工程攻击,利用"多模态上下文"构建闭环陷阱——在邮件中预告视频会议的内容,在视频会议中确认邮件的细节,在电话中补充前两者遗漏的信息。这种跨渠道的信息呼应,使受害者难以察觉任何单一渠道的异常,因为异常被分散到了三个渠道的整体一致性中。

三位一体多模态攻击典型案例

  • 福州郭先生AI换脸+拟声诈骗案(2023年4月):微信视频通话中AI换脸+拟声,10分钟被骗430万元
  • 香港多人视频会议深度伪造案(2024年2月):除受害者外所有与会者均为AI换脸生成,被骗2亿港元
  • 深圳AI语音克隆冒充CFO案(2024年):克隆CFO声音,骗取财务人员转账198万元
  • 新加坡WhatsApp+Zoom多模态诈骗案(2025年3月):WhatsApp建立联系→Zoom深度伪造视频会议→转账,损失49.9万美元
  • 意大利国防部长克隆语音诈骗案(2025年2月):AI克隆国防部长语音,诈骗商界名流,莫拉蒂被骗100万欧元
  • Zscaler制药公司深度伪造语音收购诈骗案(2025年):深度伪造CFO和CIO语音,试图骗取3500万美元
  • 冒充类诈骗在AI诈骗中占比:高达62%(新京报2025年3月报道)

五、中国战场:多模态钓鱼的本土化与产业化

中国的数字生态与欧美存在显著差异:微信取代了电子邮件成为商务沟通的核心渠道,移动支付的高度普及使资金转移极为便捷,社交媒体的实名制与信息泄露的叠加为攻击者提供了丰富的目标画像。这些特征决定了中国的多模态钓鱼呈现出独特的本土化形态。

微信生态:从社交工具到攻击向量。微信在中国不仅是通讯工具,更是集工作协同、商务沟通、金融支付于一体的超级应用。攻击者将多模态钓鱼的主战场从电子邮件转移到微信生态,正是看中了其"一站式"特性——在一个应用内即可完成身份伪装、信息传递和支付诱导。福州郭先生案(详见本章第二节)就是典型:攻击者通过微信视频通话同时伪造面容和声音,受害者无需切换应用即可完成转账,整个攻击链条被压缩至极短。

与欧美以企业财务人员为主要目标的BEC模式不同,中国的多模态钓鱼呈现出"双线并行"的特征:一条线针对企业财务人员(AI换脸冒充领导视频会议),另一条线针对普通家庭(AI拟声冒充亲友电话)。后者的情感操控更为精准——攻击者利用AI拟声技术生成"孙子""女儿"的哭腔,配合"车祸""急救"等紧急话术,在电话中制造恐慌场景。杭州退休教师被骗28万元案、广西市民被骗15万元案,都属于这一类型。这类诈骗的得逞,本质上不是技术精度的胜利,而是情感软肋被精准击中的结果。

产业化趋势:从个体犯罪到链条分工。2025年8月,北京反诈中心破获的一起涉案金额2000万元的AI换脸诈骗案,揭示了多模态钓鱼的产业化结构:上游技术提供者通过暗网兜售"AI换脸套餐",价格从几百元到数万元不等;中游推广者利用非法获取的个人信息库,通过社交软件精准投放诈骗信息;下游洗钱者通过虚拟货币、跑分平台等渠道转移资金。这种分工使攻击的专业度和规模化程度大幅提升——技术提供者不必亲自实施诈骗,诈骗实施者也不必掌握技术,产业链的每个环节都可以独立运作、灵活组合。

治理应对:制度与技术的双重发力。面对多模态钓鱼的产业化趋势,中国的应对策略呈现出"制度先行、技术跟进"的特征。《反电信网络诈骗法》构建了从源头治理到资金拦截的法律框架;《深度合成管理规定》和《生成式人工智能服务管理暂行办法》对AI生成内容提出了标识要求;公安部2025年侦破25.8万起电诈案件、紧急止付2,170.7亿元涉诈资金,展示了执法层面的高压态势。但产业化攻击的跨境特性——技术提供者可能在境外、洗钱渠道可能涉及多国——意味着单一国家的治理努力存在天然边界,国际协作仍是短板。

中国多模态钓鱼典型案例与治理数据

  • 福州郭先生AI换脸+拟声诈骗案(2023年4月):微信视频通话,10分钟被骗430万元,警银联动止付336.84万元
  • 杭州退休教师AI拟声诈骗案(2024年12月):伪造孙子车祸急救场景,三小时转账28万元
  • 广西市民AI拟声女儿车祸案(2024年6月):克隆女儿哭啼声,转账15万元至虚假医院账户
  • 深圳AI换脸冒充董事长案(2025年5月):4K分辨率伪造视频会议,损失98万元
  • 北京反诈中心破获AI换脸诈骗团伙(2025年8月):涉案金额2000万元,通过数字水印逆向备课
  • 2025年全国侦破电诈案件:25.8万起(公安部)
  • 2025年拦截诈骗电话/短信:36亿次/33亿条
  • 2025年紧急止付涉诈资金:2,170.7亿元
  • 国家反诈中心APP安装量:超6.5亿
  • 2024年紧急拦截涉案资金:3,151亿元
  • 2024年见面劝阻:477.8万人次

中国多模态钓鱼治理成效数据

数据来源:公安部新闻发布会、国家反诈中心、新华社 2021-2025

2025年全国侦破电信网络诈骗案件25.8万起,拦截诈骗电话36亿次、短信33亿条,紧急止付涉诈资金2,170.7亿元。国家反诈中心APP安装量超6.5亿,2025年上半年日均拦截诈骗电话2.1亿次,见面劝阻477.8万人次。

六、技术解剖:多模态攻击的"流水线"运作

要理解多模态攻击的运作机制,我们需要深入其技术内核,看看攻击者是如何一步步将公开信息转化为致命诱饵的。

第一步:OSINT自动侦察——你的公开信息就是攻击者的"情报库"。现代多模态攻击的第一步,是自动化开源情报(OSINT)收集。攻击者使用专门的爬虫工具和API接口,自动抓取目标的公开数字足迹:LinkedIn上的职业履历、社交媒体上的照片和视频、公司官网上的新闻稿、甚至学术会议上的演讲视频。这些信息对于攻击者来说,不是"隐私",而是"弹药"——照片用于训练换脸模型,视频用于提取语音样本,文字用于生成定制化话术。

据行业分析,一个熟练的攻击者借助自动化OSINT工具,可以在几分钟内收集到关于一个目标的数百条公开信息。这些信息被输入到AI模型中,作为生成多模态伪造内容的"训练数据"。例如,如果AI发现目标最近在社交媒体上分享了一段演讲视频,它就可以提取视频中的面部特征和语音样本,用于生成深度伪造视频和语音克隆。

第二步:多模态内容生成——从"单一伪造"到"全感官欺骗"。攻击者利用收集到的素材,同时启动三种伪造流程:文本生成(使用大语言模型生成定制化邮件或消息内容)、语音克隆(使用语音合成模型克隆目标的声音)、视频伪造(使用深度伪造模型生成目标的虚假视频形象)。三种内容共享同一个"叙事脚本"——邮件中提到的内容,会在电话中被"确认",在视频会议中被"展示"。

语音克隆技术的门槛正在快速降低。McAfee 2024年调查显示,语音克隆工具的准确率高达95%,仅需3-5秒音频样本即可生成逼真语音。ElevenLabs、Play.ht等商业平台提供每月5美元的语音克隆服务,使得任何拥有基本技术能力的人都可以克隆他人的声音。而开源工具如DeepFaceLab、FaceSwap等则让深度伪造视频技术"民主化"——任何拥有基本计算机操作能力的人都可以尝试制作伪造视频。

第三步:渠道编排——在"正确的时间"通过"正确的渠道"发起攻击。最高级的多模态攻击,不仅关注"伪造什么",更关注"何时通过何种渠道传递"。攻击者利用AI分析目标的工作日程、邮件往来模式和社交媒体活跃度,在"最佳时机"发起攻击。例如,在目标刚结束一场真实视频会议后,立即发送一封"会议纪要确认"邮件并跟进一通"补充说明"电话——目标正处于"视频会议模式"的心理状态中,更容易接受另一场"视频会议"的邀请。

第四步:实时交互——从"预录伪造"到"实时扮演"。最先进的多模态攻击已经具备了"实时交互"能力。攻击者利用实时深度伪造技术,在视频通话过程中实时替换通话者的面部和声音。这意味着,攻击者不再需要预先制作完整的伪造视频,而是可以在真实的视频通话中"实时扮演"任何他们想扮演的人——回答受害者的问题、回应受害者的表情、甚至根据受害者的反应调整话术策略。

第五步:反馈循环——从失败中学习的"智能猎手"。最先进的多模态攻击系统已经具备了"自我进化"能力。攻击者可以追踪每次攻击的"表现数据":哪种话术在特定行业效果最佳、哪种发送时间窗口的点击率最高、哪种伪造技术的"逼真度评分"最高。然后,AI根据这些反馈数据自动调整生成策略,使得下一次攻击更加精准、更加难以察觉。

多模态攻击技术链条

  • OSINT自动侦察:自动化抓取照片、视频、语音样本等公开信息,数分钟内收集数百条目标数据
  • 文本生成:大语言模型生成定制化邮件/消息内容
  • 语音克隆:3秒音频样本即可生成95%准确率的克隆语音(McAfee 2024)
  • 视频伪造:一张静态照片即可生成实时深度伪造视频
  • 渠道编排:分析工作日程和社交活跃度,在心理脆弱时刻发起攻击
  • 实时交互:视频通话中实时替换面部和声音,实现"实时扮演"
  • 反馈循环:追踪攻击表现数据,通过强化学习自动优化生成策略
  • 犯罪即服务(CaaS):暗网"AI换脸套餐"价格从几百元到数万元不等

七、防御困局:当每一道防线都被绕过

面对多模态攻击的汹涌浪潮,传统的防御体系正在经历一场前所未有的危机。这种危机不是某一类技术的失效,而是整个防御范式的动摇——当攻击者可以同时伪造视觉、听觉和文字三个维度的感知,传统的"交叉验证"防御策略从根本上失去了意义。

第一道防线崩溃:安全意识培训的失效。过去二十年来,"安全意识培训"一直是企业防御钓鱼攻击的核心策略。培训内容通常包括:识别拼写错误、警惕陌生发件人、不要点击可疑链接、核实异常请求。这些准则在多模态攻击面前几乎全部失效。AI生成的多模态内容没有拼写错误,发件人地址经过精心伪装,视频中的"人"与真人几乎无法区分,电话中的"声音"与本人一模一样。

据KnowBe4 2025年数据,经过12个月的持续培训,员工钓鱼点击率可从33.1%降至4.1%。但问题在于:当多模态攻击的逼真度不断提升时,培训的"边际效益"是否会递减?如果AI能够生成与真实通信在感知层面无法区分的攻击内容,那么无论培训多么充分,人类用户终究会犯错——而攻击者只需要一次成功。

第二道防线崩溃:传统检测技术的失灵。传统的邮件安全网关依赖关键词黑名单、URL信誉库和发件人IP声誉三种核心机制。这三种机制在多模态攻击面前几乎全部失效。AI生成的邮件可以完美避开敏感关键词;攻击者使用一次性域名或合法云服务托管恶意载荷;发件人IP可以通过被劫持的合法服务器发送。更棘手的是,多模态攻击的"跨渠道"特性使得单一渠道的检测更加困难——邮件网关无法检测语音通话,语音分析系统无法检测视频会议。

据微软2025年度数字安全报告,某主流邮件网关对AI生成钓鱼邮件的检出率不足35%,而对传统模板邮件可达89%。360安全智能体2025年攻防演练数据显示,采用"AI生成+场景诱导"的钓鱼邮件使传统检测工具拦截率跌至49.8%。在多模态攻击面前,这些数字可能更加悲观——因为攻击者同时在三个渠道部署伪造内容,即使其中一个渠道被检测,另外两个渠道仍可能成功。

第三道防线承压:多因素认证的绕过。即使攻击者成功窃取了用户的凭证,多因素认证(MFA)本应成为阻止进一步入侵的最后一道屏障。然而,多模态攻击正在开发绕过MFA的新手段。实时钓鱼代理(AiTM,Adversary-in-The-Middle)攻击利用AI生成与合法登录页面像素级一致的伪造页面,实时转发用户的MFA验证码。Scattered Spider等威胁组织通过语音钓鱼诱导IT帮助台重置MFA凭证,从初始接触到获得域管理员权限仅需约40分钟(Mandiant M-Trends 2026)。

中国的防御探索。面对多模态攻击的严峻挑战,中国正在探索一条"技术+制度+教育"的综合防御路径。在技术层面,度小满等科技企业于2025年升级了声纹识别系统与防深伪模型,累计为45.39万名客户发出精准诈骗预警,成功拦截电诈金额高达2.17亿元。国家反诈中心APP安装量超6.5亿,2025年上半年日均拦截诈骗电话2.1亿次。在制度层面,《反电信网络诈骗法》构建了从源头治理到资金拦截的完整法律框架,转账设24小时冻结期,追回率升至35.7%。在教育层面,公安部联合中央广播电视总台推出《全民反诈公开课》,通过剖析真实案例提升群众防范意识。

然而,防御的根本困境依然存在:攻击者只需要找到一个漏洞,而防御者必须堵住所有漏洞。在多模态攻击时代,这个"不对称性"被进一步放大——攻击者可以同时从三个维度发起攻击,而防御者必须在三个维度同时建立有效防线。

多模态攻击防御困局与应对数据

  • 培训前用户识别率:仅34%能成功识别钓鱼模拟(Hoxhunt 2025)
  • 12个月培训后点击率:从33.1%降至4.1%(KnowBe4 2025)
  • 主流网关AI钓鱼检出率:不足35%(微软2025)
  • 传统检测工具拦截率:跌至49.8%(360 2025)
  • Scattered Spider从初始接触到域管理员权限:约40分钟(Mandiant M-Trends 2026)
  • 度小满精准诈骗预警:45.39万名客户,拦截2.17亿元
  • 国家反诈中心APP日均拦截:2.1亿次诈骗电话(2025年H1)
  • 转账冻结期:24小时,追回率升至35.7%
  • 2024年紧急拦截涉案资金:3,151亿元
  • 2024年见面劝阻:477.8万人次

八、结语:在"全感官欺骗"的时代重建信任

多模态攻击的可怕之处,不在于它使用了多么先进的技术,而在于它精准地利用了人类认知系统的一个设计缺陷:我们对"多源确认"的过度信赖。当邮件、电话、视频三个渠道传递的信息完全一致时,大脑会自动降低警觉——这是进化赋予我们的节能策略,在原始社会极少出错,在数字时代却成了致命的弱点。

从攻击者的视角看,多模态组合是一种"风险对冲"策略。单一渠道的伪造可能被识破——邮件的措辞可能有破绽,电话的声音可能有瑕疵,视频的面孔可能有漏洞。但当三个渠道同时呈现时,受害者很难同时识别所有渠道的异常;即使发现某一个渠道的可疑之处,也会被其他两个渠道的"正常"所抵消。这种"分散怀疑"效应,使多模态攻击的成功率远高于单一渠道攻击。

防御多模态攻击的关键,在于打破"渠道一致性=真实性"的认知惯性。企业需要建立"跨渠道独立验证"机制:邮件中的请求必须通过非邮件渠道确认,电话中的指令必须通过非电话渠道核实,视频中的承诺必须通过非视频渠道验证。这种设计的核心,是强制引入"渠道错配"——让攻击者无法在同一时间控制所有验证渠道。

中国在多模态钓鱼治理方面的经验表明,技术防御、流程控制和法律规制三者缺一不可,但各自都有边界。技术检测可以识别已知的伪造模式,但无法预测未知的变种;流程控制可以阻断大部分攻击,但无法消除人为疏忽;法律规制可以震慑境内犯罪,但难以约束跨境攻击。三者的叠加,才能构建起相对完整的防御体系。

最终,多模态攻击的应对之道,或许可以归结为一句话:不要让任何一个渠道成为信任的充分条件。邮件可信,但邮件不够;电话可信,但电话不够;视频可信,但视频不够。只有当多个独立渠道的验证结果相互吻合时,信任才具备足够的基础。在AI可以伪造一切感官体验的时代,"多疑"不是一种病态,而是一种必要的生存技能。

"当三个渠道同时告诉你同一件事时,你的大脑会本能地选择相信。但在AI时代,这种本能就是最大的漏洞。多模态攻击教会我们的,不是如何识别伪造,而是如何拒绝被'一致性'所催眠——在每一次'确认'之前,都习惯性地寻找第四个、第五个独立的验证来源。" —— 编者

延伸阅读与参考

  • CrowdStrike. "2025 Global Threat Report." February 2025. — 披露2024年H1至H2语音钓鱼激增442%、AI生成钓鱼邮件点击率54%等关键威胁数据。
  • CrowdStrike. "2025 Threat Hunting Report." August 2025. — 追踪2024年7月至2025年6月交互式入侵增长27%,eCrime占73%,云环境入侵激增136%。
  • Mandiant. "M-Trends 2026." March 2026. — 语音钓鱼位列2025年第二大初始感染向量,占Mandiant调查案件的11%;Scattered Spider从接触到域管理员权限仅需约40分钟。
  • Pindrop. "2025 Voice Intelligence and Security Report." 2025. — 分析12亿次联络中心通话,记录2024年深度伪造欺诈尝试同比增长1,300%,从每月1起增至每天7起。
  • Proofpoint. "The Human Factor 2024." 2024. — 披露Proofpoint每年拦截1.17亿次TOAD威胁,分析邮件与语音组合攻击的规模化趋势。
  • Deloitte Center for Financial Services. "Deepfake Banking Fraud Risk on the Rise." 2024. — 预测美国AI赋能欺诈损失2027年将达400亿美元,2023年为123亿美元,CAGR 32%。
  • McAfee. "AI Voice Clone Threat Report 2024." 2024. — 调查显示语音克隆工具准确率高达95%,仅需3-5秒音频样本即可生成逼真语音。
  • iProov. "Threat Intelligence Report 2025: Remote Identity Under Attack." 2025. — 记录Native Virtual Camera数字注入攻击增长2,665%,换脸攻击增长300%。
  • Sumsub. "2024 Identity Fraud Report." 2024. — 全球深度伪造事件2022-2023年增长10倍,2023-2024年再增4倍,两年累计增长40倍。
  • Zscaler ThreatLabz. "2025 Threat Report." 2025. — 全球钓鱼总量下降20%,但攻击者转向由生成式AI推动的精密社会工程攻击。
  • Microsoft. "Digital Defense Report 2024." October 2024. — 分析主流邮件网关对AI生成钓鱼邮件检出率不足35%的防御困境。
  • KnowBe4. "Phishing by Industry Benchmarking Report 2024." 2024. — 显示经过12个月培训员工钓鱼点击率可从33.1%降至4.1%。
  • Hoxhunt. "2025 Phishing Trends Report." 2025. — 仅34%用户能成功识别钓鱼模拟,揭示安全意识培训的边际效益递减风险。
  • FBI Internet Crime Complaint Center (IC3). "2024 Internet Crime Report." 2025. — 2024年BEC损失达27.7亿美元,钓鱼/欺骗投诉193,407起为最大类别。
  • CISA. "AA23-320A: Scattered Spider (UNC3944) Advisory." November 2023, updated July 2025. — FBI、CISA等七国机构联合发布,详述帮助台语音钓鱼、SIM交换等TTP。
  • 《中华人民共和国反电信网络诈骗法》. 2022年9月2日通过. — 构建从源头治理到资金拦截的完整法律框架,转账设24小时冻结期。
  • 《互联网信息服务深度合成管理规定》. 国家互联网信息办公室等三部门, 2022年12月. — 要求深度合成服务提供者对AI生成内容采取显著标识等措施。
  • 《生成式人工智能服务管理暂行办法》. 国家互联网信息办公室等七部门, 2023年8月. — 进一步要求对AI生成内容进行显著标识。
  • 公安部新闻发布会. "2025年全国共侦破电信网络诈骗案件25.8万起." 2026年1月8日. — 披露拦截诈骗电话36亿次、短信33亿条,紧急止付涉诈资金2,170.7亿元。
  • 新华社. "AI赋能精准防控,度小满累计拦截电诈金额2.17亿元." 2026年2月9日. — 报道度小满声纹识别系统为45.39万名客户发出精准诈骗预警。
  • 包头市公安局电信网络犯罪侦查局. "AI换脸诈骗案件通报." 2023年5月8日. — 通报福州郭先生AI换脸+拟声10分钟被骗430万元案,警银联动止付336.84万元。
  • 新京报. "10分钟被骗430万,被AI诈骗的不止老年人." 2025年3月14日. — 深度报道冒充类诈骗在AI诈骗中占比高达62%的严峻形势。