子课题 02 · 公共互联网反网络钓鱼工作组

域名仿冒检测研究专题

基于编辑距离、Jaro-Winkler相似度、视觉特征分析与深度学习的域名仿冒检测技术,覆盖同形异义字、组合仿冒、DGA域名等全场景。本专题分三篇系统阐述威胁全景、技术原理与检测框架、典型案例与研究前沿。

0+
Zscaler监测仿冒域名数
2024年2–7月
0+
actively malicious
其中1/3为活跃恶意
0
WIPO域名争议案件
2025年再创历史新高
0%
HDDN检测准确率
Netlab360数据集

域名仿冒攻击技术全景

域名仿冒(Domain Spoofing / Domain Squatting)是网络钓鱼攻击基础设施层的核心手段。攻击者通过注册与知名品牌高度相似的域名,构建钓鱼网站、发送钓鱼邮件、实施品牌欺诈。据APWG监测,2025年全球钓鱼攻击达380万起;Interisle年度研究显示,钓鱼域名滥用规模同步刷新历史纪录,域名仿冒作为首要基础设施支撑手段,其威胁态势持续恶化。

关键数据洞察

Zscaler ThreatLabz在2024年2月至7月期间跟踪了超过30,000个仿冒域名(涉及500余个品牌),发现其中10,000个处于活跃恶意状态——即正在运行实时钓鱼页面、分发恶意软件或收集凭证,占比约三分之一;Google、Microsoft、Amazon是被仿冒最多的品牌,合计占比近75%。世界知识产权组织(WIPO)2025年处理的域名争议案件达6,282起,再创历史新高(2023年6,192起、2024年6,168起),较疫情前增长68%。Interisle Consulting Group发布的《Phishing Landscape 2025》报告显示,2024年5月至2025年4月间用于钓鱼的唯一域名数量达1,542,922个,同比增长38%,为历年最高,其中77%系犯罪者恶意注册、37%通过批量注册服务获得。Microsoft在2024年全年检测到超过91,000个参与仿冒攻击的根域名,而仅2025年3月单月就识别出超过26,000个仿冒企业与政府服务的域名。

数据来源:Zscaler ThreatLabz 2024 / WIPO 2023–2025年度域名争议统计 / Interisle Consulting Group《Phishing Landscape 2025》/ Microsoft Threat Intelligence

攻击生态工业化

域名仿冒已从早期的"域名停放"(Domain Parking)获利模式,演进为完全工业化的攻击向量。2024–2025年的关键特征包括:

  • 自动化批量生成:攻击者使用自动化工具在数秒内生成数千个域名变体,单次针对大型品牌的活动可能在一天内注册200至500个域名,横跨多个注册商和顶级域(TLD)。Interisle报告显示,廉价新通用顶级域已成为恶意注册的主要载体——2025年度51%的恶意注册集中于新gTLD,钓鱼域名数量排名前列的TLD包括.top、.bond、.xyz等单价低至2美元以下的后缀。
  • 短暂生命周期(Ephemeral Domains):恶意仿冒域名常被设计为短周期使用——注册后配置钓鱼基础设施,用于持续数小时至数天的定向邮件活动,随后即被废弃或快速轮换。这种"打了就跑"的战术专门用于超越基于黑名单的防御体系,使以天或周为更新周期的静态黑名单难以奏效。
  • 重定向欺骗:攻击者注册仿冒域名后配置301/302 HTTP重定向至合法网站,使安全团队调查时认为该域名无害;但同时保留MX记录,使其能够发送邮件并通过基础验证检查。这种"双面域名"策略显著增加了检测难度。
  • 批量注册服务滥用:Interisle 2025年度报告发现,37%的钓鱼域名通过批量域名注册服务(Bulk Registration)一次性购入,注册商侧的客户信息核验薄弱是钓鱼基础设施获取成本持续走低的关键原因。
  • AI驱动增强:生成式AI被用于创建既相似又不易被传统算法检测的域名,同时自动优化钓鱼页面的视觉设计以规避检测。Microsoft《Digital Defense Report 2025》将域名仿冒列为增长最快的AI驱动在线威胁之一。

检测技术演进路径

域名仿冒检测技术经历了从人工审核到自动化智能检测的四个主要阶段,每一阶段都对应着攻击手法的升级与防御需求的深化:

  • 规则匹配阶段(2005–2015):基于预定义的品牌关键词库和黑名单进行精确匹配,误报率低但无法发现新型仿冒。代表工具为早期DNS防火墙的静态规则集。
  • 相似度计算阶段(2015–2020):引入Levenshtein编辑距离、Jaro-Winkler相似度、Damerau-Levenshtein距离等字符串度量算法,实现模糊匹配。Moore与Edelman(2010)的经典研究表明,针对热门.com网站、编辑距离为1或2的域名中仿冒域名占比极高——他们估计仅3,264个热门.com网站就存在至少938,000个拼写错误型仿冒域名。Spaulding等(2016)在ARES会议上系统综述了域名仿冒的技术全景与防御对策。
  • 深度学习阶段(2020–2024):基于CNN、LSTM、BiLSTM及注意力机制的假冒域名识别方法,自动提取域名字符串的深层特征。在DGA检测任务中,CNN-BiLSTM-Attention混合架构取得了显著进展。Chen等(2025)在Computers & Security发表的HDDN模型在Netlab360数据集上达到97.70%检测准确率。
  • 多模态融合阶段(2024–至今):结合域名文本特征、WHOIS信息、DNS解析行为、SSL证书透明度(CT)日志、页面视觉内容进行综合判定。大型语言模型(LLM)开始被用于增强域名语义分析与分类。Chiba等(2024/2025)提出的DomainLynx系统利用LLM在真实环境一个月检测出34,359个squatting域名,准确率达94.7%,检测数量为基线方法的2.45倍。

六大仿冒技术体系

域名仿冒技术经历了从简单拼写错误到复杂视觉欺骗的演进。根据Kintis等学者的经典分类框架,结合2024–2025年最新攻击态势,当前主要存在以下六类仿冒手法。此外,学术界还记录到位翻转仿冒(Bitsquatting,利用硬件位翻转导致的域名解析偏差)与语音仿冒(Soundsquatting,利用同音异义词注册域名)等特殊类型,在此一并纳入技术全景参考。

01

拼写错误型(Typosquatting)

利用键盘相邻字符替换、字符遗漏、字符交换、字符重复等手法生成仿冒域名。这是历史最悠久、数量最庞大的仿冒类型。Moore与Edelman(2010)对3,264个热门.com网站进行测量,发现至少938,000个拼写错误型仿冒域名。Spaulding等(2016)的综述研究表明,字符替换是最有效的欺骗方式,用户通常能够识别添加或删除字符的仿冒,但对替换字符的辨识能力显著较弱。

gooogle.com / gogle.com / gogole.com
02

同形异义字型(Homograph / IDN Spoofing)

利用Unicode字符与ASCII字符的视觉相似性实施欺骗。如使用西里尔字母"о"(U+043E)替代拉丁字母"o"(U+006F),或使用希腊字母替代拉丁字母。攻击者通过Punycode编码(RFC 3492)将Unicode域名转换为以"xn--"为前缀的ASCII兼容编码(ACE),在浏览器地址栏中显示为看似合法的Unicode字符。现代浏览器已实施IDN显示策略,当域名包含混合脚本或可疑字符组合时,强制显示Punycode形式。

xn--pple-43d.com → аpple.com
03

组合仿冒型(Combo-squatting)

在品牌域名前后添加功能性词汇,如google-login.com、secure-google.com。Kintis等(2017)在CCS会议上发表的开创性研究系统分析了组合仿冒域名的滥用模式,发现此类域名被广泛用于钓鱼、社会工程攻击、分支滥用、商标滥用和恶意软件分发。组合仿冒的检测难点在于其语义合理性——添加的词汇往往与品牌服务高度相关。

microsoft-secure-login.com
04

顶级域替换型(TLD-swap)

将.com替换为.co、.net、.org、.cc或其他国别域名(ccTLD),如google.co。新型通用顶级域(gTLD)的涌现为攻击者提供了更多选择。Interisle《Phishing Landscape 2025》显示,51%的恶意注册集中于新gTLD,钓鱼域名数量排名前列的后缀包括.top、.bond、.xyz、.xin等廉价TLD;域名注册价格与滥用比例呈显著相关性,滥用率最高的27个TLD注册价格均不高于2美元。用户通常难以准确记忆目标网站的完整域名后缀。

example.top / example.bond
05

子域名仿冒型(Subdomain Spoofing)

利用子域名结构嵌入品牌名称,制造视觉上的品牌关联。如vpn-login.company-support.com。2025年,Octo Tempest(又称Scattered Spider、UNC3944)等威胁组织已大规模转向子域名仿冒策略,配合Evilginx等Adversary-in-the-Middle(AiTM)框架,克隆合法登录页面并实时代理认证请求,捕获会话Cookie以绕过MFA。ReliaQuest评估显示,81%与该组织相关的域名采用仿冒战术,"vpn""helpdesk""okta""sso"等关键词高频出现。

sso-okta.helpdesk-portal.com
06

DGA生成型(Domain Generation Algorithm)

利用域名生成算法批量生成伪随机或字典组合域名,用于僵尸网络C2通信与快速切换钓鱼基础设施。现代DGA已从纯随机字符演进为基于字典的"类自然语言"模式,结合常见英文单词生成看似合法的域名(如dictionary-based DGA),显著增加了检测难度。Conficker、Kraken、Torpig等经典僵尸网络均采用了DGA技术。Yadav等(2010)在IMC会议上首次系统提出通过分析字符分布和bigram模式检测算法生成域名的方法。

happy-cloud-9.net / green-sky-42.org

行业监测数据

Interisle《Phishing Landscape 2025》(统计周期2024年5月–2025年4月):用于钓鱼的唯一域名数量达1,542,922个,同比增长38%,为近五年最高;全球钓鱼攻击近196万起,较2021年增长182%;77%的钓鱼域名为恶意注册,37%经批量注册服务购入;超过半数钓鱼网站托管于美国公司,美国已连续五年成为钓鱼网站首要托管地。Fortra《Domain Impersonation Report》:2023年上半年平均每个品牌每月被约40个仿冒URL攻击,到2024年第二季度这一数字升至73个。Microsoft:2024年全年检测到超过91,000个参与仿冒攻击的根域名,2025年3月单月识别出超过26,000个仿冒企业与政府服务的域名。

数据来源:Interisle Consulting Group《Phishing Landscape 2025》/ Fortra Domain Impersonation Report / Microsoft Threat Intelligence / Zscaler ThreatLabz 2024

域名仿冒检测技术演进史

从静态规则到动态智能,从单一特征到多模态融合,域名仿冒检测技术的每一次跃迁都深刻反映了攻防对抗的升级节奏。

第一代 · 2005–2015 已完成

规则匹配与黑名单阶段

基于预定义的品牌关键词库和静态黑名单进行精确匹配。安全团队手动维护已知恶意域名列表,DNS防火墙和浏览器厂商通过定期更新黑名单实现防护。此阶段的核心局限在于:无法应对零日仿冒域名,维护成本极高,且黑名单更新周期(通常以天或周计)远慢于攻击者的域名轮换速度(以小时计)。

静态规则黑名单人工维护关键词匹配
第二代 · 2015–2020 已完成

字符串相似度计算阶段

引入Levenshtein编辑距离、Jaro-Winkler相似度、Damerau-Levenshtein距离、Hamming距离等字符串度量算法,实现模糊匹配。Moore与Edelman(2010)的经典研究以编辑距离1和2生成热门网站的疑似仿冒变体并验证其滥用状态,奠定了"字符串近似+人工核验"的测量范式。Kintis等(2017)的开创性研究系统分析了组合仿冒域名的滥用模式,发现此类域名被广泛用于钓鱼、社会工程攻击、品牌滥用和恶意软件分发。此阶段工具代表包括dnstwist等开源域名排列引擎。

编辑距离Jaro-Winkler模糊匹配dnstwist
第三代 · 2020–2024 主流应用

深度学习特征提取阶段

基于CNN、LSTM、BiLSTM及注意力机制的假冒域名识别方法,自动提取域名字符串的深层特征。Yadav等(2010)在IMC会议上首次系统提出通过分析字符分布和bigram模式检测算法生成域名的方法,后续研究逐步将CNN、BiLSTM与Attention组合为混合架构,在DGA检测任务中取得突破性进展。针对传统编辑距离对短域名(如双字符域名)误报率过高的问题,研究者提出基于字符视觉相似度加权的编辑距离方法,从字符位置、操作类型与视觉混淆度三个维度改进相似度度量,降低了短域名场景下的误报。

CNNBiLSTM注意力机制DGA检测视觉特征
第四代 · 2024–至今 前沿探索

多模态融合与LLM增强阶段

结合域名文本特征、WHOIS信息、DNS解析行为、SSL证书透明度(CT)日志、页面视觉内容进行综合判定。大型语言模型(LLM)被引入用于增强域名语义分析与分类——Chiba等提出的DomainLynx系统(IEEE CCNC 2025)利用LLM在真实环境一个月检测出34,359个squatting域名,准确率达94.7%,检测数量为基线方法的2.45倍,且85.65%的检出针对的是Tranco排名前1,000之外的中长尾品牌。图神经网络(GNN)被用于分析域名注册关系图谱,识别异常注册模式。证书透明度监控(CT Log)成为主动发现品牌相关异常证书申请的关键数据源。

多模态融合LLM增强GNNCT日志监控主动防御

探索其他子课题