子课题 03 · 公共互联网反网络钓鱼工作组 · 中篇

恶意链接分析研究专题

URL多维特征提取、短链接解包与跳转链追踪、链接信誉评估模型、合法服务滥用检测、机器学习分类器对比与工程化部署。

URL多维特征提取体系

基于Aljofey等(2022,Scientific Reports)、Asiri等(2023,IEEE Access)等已发表学术文献与工程实践,将URL检测特征划分为词法(Lexical)、网络(Network)和内容(Content)三大类,构建可解释、可扩展的特征工程框架。

第一类:词法特征(Lexical Features)

词法特征直接从URL字符串本身提取,无需访问目标页面,具有零延迟、零资源消耗的优势,是实时检测系统的首选特征类别。Aljofey等(2022)在Scientific Reports发表的研究("An effective detection approach for phishing websites using URL and HTML features",Sci. Rep. 12, 8842)证实,融合URL词法特征与HTML内容特征可显著提升钓鱼网站检测的精度与稳健性,且在自建数据集与公开基准数据集上均取得高精度表现。

URL长度

钓鱼URL通常显著长于合法URL,用于混淆视觉判断和隐藏可疑子串。

合法: 42 chars
钓鱼: 187 chars

特殊字符密度

点号、连字符、下划线、@符号、等号的数量与分布模式。

dots: 5 | hyphens: 3
at_sym: 1 | equal: 2

数字字符比例

钓鱼URL常包含异常高比例的数字,尤其是DGA域名和动态生成链接。

digit_ratio: 0.23

子域名深度

多级子域名是钓鱼常见手法,如login.secure.bank.example.com。

subdomain_depth: 4

品牌词嵌入

检测URL中是否包含知名品牌的词法变体(如paypa1、micr0soft)。

brand_match: paypal
typo: paypa1

可疑TLD分布

.TK、.ML、.GA等免费顶级域在钓鱼中的出现频率显著偏高。

suspicious_tld: .tk

IP地址直连

直接使用IP而非域名的URL具有极高的钓鱼嫌疑。

is_ip: true

HTTPS协议标志

钓鱼URL中HTTPS占比逐年上升,但证书特征(颁发机构、有效期)仍有差异。

has_https: true

路径熵值

随机生成路径的高熵特征,如/verify/xK9mP2qR7vL4。

path_entropy: 4.82

第二类:网络/主机特征(Network & Host-Based Features)

网络特征通过DNS查询、WHOIS查询、IP信誉库和证书透明度日志获取,反映域名和基础设施的可信度。此类特征需要外部查询,存在延迟,但提供不可替代的上下文信息。Asiri等(2023)在IEEE Access发表的系统性综述(IEEE Access 11: 6421–6443)梳理了基于URL/HTML的智能钓鱼检测设计演进,确认主机与网络特征为检测体系提供了不可替代的上下文信息。

域名注册时长

钓鱼域名通常极新(<30天)或即将过期,合法域名平均存在数年。

age_days: 7

WHOIS信息完整性

钓鱼域名常使用隐私保护或虚假注册信息,合法域名WHOIS信息完整。

whois_privacy: true

DNS解析历史

频繁更换IP地址(Fast-Flux)是钓鱼基础设施的典型特征。

ip_changes_30d: 12

ASN/地理位置

服务器所在自治系统号和地理区域与品牌注册地的一致性分析。

asn_country: RU

证书透明度

通过CT日志分析证书颁发模式,识别批量证书申请行为。

ct_logs_count: 1

共享基础设施

基于图分析识别与已知恶意域名的同IP、同证书、同注册邮箱关联。

shared_ip_mal: 3

PageRank/流量

钓鱼域名通常具有极低的搜索引擎排名和几乎为零的自然流量。

pagerank: 0.001

名称服务器信誉

部分DNS服务商(如某些免费DNS)被钓鱼攻击者集中滥用。

ns_reputation: low

域名长度分布

DGA生成的域名常呈现异常的字符长度和元音/辅音比例。

dga_score: 0.87

第三类:内容特征(Content-Based Features)

内容特征通过爬取目标页面获取,包括HTML结构、JavaScript行为、视觉元素和表单特征。此类特征信息量最大,但需要沙箱环境支持,存在执行风险和分析延迟。Sahingoz等(2019)在Expert Systems with Applications的研究(ESWA 117: 345–357)系统评估了基于URL的机器学习钓鱼检测方法;Aljofey等(2022)进一步证实融合URL与HTML内容特征是提升检测精度的有效路径。

密码输入框检测

页面是否包含<input type="password">元素是钓鱼页面的强指示器。

has_password_field: true

品牌Logo滥用

通过图像哈希或感知哈希(pHash)检测是否盗用知名品牌Logo。

logo_match: microsoft

表单提交目标

分析表单action属性指向的域名是否与页面域名一致。

form_action: evil.com

JavaScript混淆度

钓鱼页面常使用重度混淆的JS代码隐藏真实行为。

js_obfuscation: high

iframe嵌套

使用iframe加载第三方内容以隐藏真实来源。

iframe_count: 2

外部链接比例

钓鱼页面通常极少包含指向合法域名的外部链接。

ext_link_ratio: 0.05

标题/元数据

<title>和meta标签中是否包含知名品牌的精确名称。

title_brand: "Microsoft"

重定向行为

页面加载后是否立即通过JS或meta refresh跳转。

auto_redirect: true

视觉相似度

通过SSIM或感知哈希计算页面截图与官方页面的视觉相似度。

visual_sim: 0.91
学术共识:已发表研究(Aljofey et al., Scientific Reports, 2022; Sahingoz et al., Expert Systems with Applications, 2019; Asiri et al., IEEE Access, 2023)一致表明:将词法、网络和内容三类特征融合使用,可显著提升钓鱼检测的召回率和精确率;基于手工设计特征的机器学习模型(Random Forest、XGBoost等)在多数公开数据集上可取得与深度学习方法相当量级的性能,且推理开销低、可解释性强,更适合实时网关部署。需要说明的是,模型性能高度依赖数据集构成与特征工程质量,实际部署前应使用自有流量进行充分的验证与校准。

恶意链接实时检测流水线

构建从URL接收到最终判定的五阶段实时检测流水线,实现毫秒级初筛、秒级深度分析与分钟级沙箱验证的分层防御。

1

词法初筛

基于正则规则与词法特征进行毫秒级初筛,拦截明显恶意URL

2

信誉查询

查询本地黑名单、VirusTotal、Google Safe Browsing等信誉库

3

ML分类

Random Forest / XGBoost模型基于多维特征进行概率评分

4

跳转追踪

解包短链接,追踪重定向链,记录完整跳转路径

5

沙箱验证

无头浏览器访问目标页,提取内容特征,捕获最终页面

短链接解包技术

短链接解包是链接分析的基础步骤。Cofense Intelligence 2024—2025年分析识别出六大最常被滥用的短链接服务:t.ly(凭证钓鱼首选)、TinyURL(API无限制)、Rebrand.ly(品牌伪装)、is.gd(恶意软件分发率49%)、Goo.su(伪装Google域名,恶意率89%)、Qrco.de(QR码钓鱼)。

  • HTTP HEAD追踪:发送HEAD请求并跟随Location重定向头,记录完整跳转链。此方法不下载页面主体,避免触发恶意载荷
  • JavaScript跳转捕获:对于使用meta refresh或JS跳转的短链接,需使用无头浏览器(Puppeteer/Playwright)捕获最终地址
  • API预览查询:部分短链接服务提供预览API(如bit.ly的+后缀),可直接获取目标元信息
  • 缓存映射优化:建立短链接→目标URL映射缓存,避免重复解析,降低检测延迟至毫秒级
  • 批量解包策略:针对邮件中大量短链接场景,采用异步并发解包,控制请求频率避免被服务封禁

跳转链风险评分模型

完整的跳转链包含丰富的威胁情报信息。通过对跳转链中每个节点进行多维度风险评分,可综合判定链接威胁等级。跳转深度超过3层即标记为高风险。

评分维度风险指标权重
域名信誉最终域名是否在黑名单、信誉库中35%
跳转深度跳转链长度(>3层为高风险)15%
中间节点跳转链中是否存在已知恶意中间页20%
地理分布目标服务器所在国家/地区风险等级15%
证书状态HTTPS证书有效性、颁发机构可信度15%

复合评分公式:RiskScore = Σ(wᵢ × sᵢ),其中wᵢ为各维度权重,sᵢ为归一化评分。总分>0.7标记为高危,>0.4标记为可疑,≤0.4标记为低风险。
(注:上表权重为本课题提出的建议性框架,实际部署时应结合历史检出数据回归校准。)

QR码钓鱼检测专项流程

针对2026年增速最快的QR码钓鱼(Quishing),传统文本扫描引擎无法读取图像中的URL,必须建立独立的图像级检测通道。Microsoft Defender for Office 365与Mimecast URL Protect均已支持自动提取QR图像中的URL并纳入信誉检查。

1

附件图像提取

解析PDF/DOCX/SVG附件及邮件正文,提取全部嵌入图像

2

QR码解码

识别图像中的QR码并解码出原始URL(如pyzbar/zxing)

3

与文本链同等检测

解码URL进入标准检测流水线:信誉查询、ML分类、跳转追踪

4

移动端风险提示

扫码多发生在无EDR/DNS防护的个人手机,推送客户端警告

检测难点:QR码将恶意URL隐藏在图像中,对基于文本的邮件过滤完全不可见;且扫码后通常在个人移动设备上打开,绕过企业网络层的DNS过滤与代理审计。Cyble对"Scanception" campaign的分析显示,攻击者还会将恶意QR码置于多页PDF末尾,规避只扫描前几页的自动化引擎,且滥用YouTube、Google、Bing、Cisco等合法跳转服务中继,进一步降低信誉检测命中率。因此"附件图像提取—QR解码—URL信誉检查"的独立通道已成为邮件安全网关的必备能力。

URL信誉评估体系架构

构建覆盖域名基础信誉、内容动态信誉、行为信誉和关联信誉的四维评估模型,实现对未知链接的快速风险判定。

75
综合风险分
域名基础信誉
35%
内容动态信誉
25%
行为信誉
20%
关联信誉
20%

评分范围0—100,≥75为高危,50—74为可疑,25—49为低风险,<25为可信。评分基于实时情报源动态更新,TTL为24小时。(注:本模型为本课题建议框架,权重与阈值需按实际威胁数据校准。)

域名基础信誉评估

基于域名注册时长、WHOIS信息完整性、历史解析记录评估基础可信度。新注册域名(<30天)自动获得高风险加权。

  • 注册时长评分:<7天得0分,7—30天得30分,1—6月得60分,>6月得90分
  • WHOIS完整度:检查注册人、邮箱、电话、地址字段完整性,隐私保护服务扣20分
  • 历史解析稳定性:频繁更换IP(Fast-Flux)扣30分,长期稳定解析加10分
  • 域名年龄与Alexa排名:Alexa排名<100,000加15分,无排名或>10M扣20分

合法服务滥用检测

攻击者越来越多地滥用合法云服务托管钓鱼内容。传统基于域名黑名单的方法因URL本身无可疑特征而失效。

  • 路径模式分析:识别合法域名下的异常路径模式,如forms.google.com/ss-o-form(非官方路径)
  • 内容语义检测:即使托管在合法平台,页面内容仍可能包含钓鱼特征(密码收集、品牌仿冒)
  • 账户行为分析:分析创建表单的账户历史行为,识别批量创建、短期使用、快速删除等异常模式
  • 举报数据融合:整合用户举报、安全厂商通报、平台方处置数据,构建合法平台滥用情报库

恶意URL检测机器学习模型对比

基于公开数据集(如PhishTank、URLhaus、Sánchez-Paniagua等构建的多用途数据集)的学术文献综述,对比主流机器学习模型在钓鱼URL检测任务中的性能表现与工程适用性。以下数据为文献中报告的典型值,实际性能因数据集和特征工程差异而有所不同。

模型 典型准确率 推理延迟 可解释性 工程适用性
Random Forest 96—98% <1ms 首选
XGBoost 97—99% <2ms 首选
LightGBM 97—98% <1ms 推荐
SVM (RBF) 94—96% 5—10ms 一般
CNN (字符级) 98—99% 10—50ms 推荐
LSTM/GRU 97—99% 20—100ms 一般
Transformer (BERT) 98—99.5% 50—200ms 极低 离线分析
集成(Stacking) 99—99.5% 15—60ms 高价值场景
工程建议:对于实时网关检测场景,推荐采用Random Forest或XGBoost作为第一层快速分类器(<2ms延迟),对高可疑样本再送入CNN或集成模型进行深度分析。Aljofey等(2022)的研究表明,基于手工设计特征与TF-IDF特征的传统机器学习分类器即可取得高精度的检测效果,且计算复杂度显著低于深度学习方法。对于需要处理海量URL的场景,特征子集选择和模型压缩是降低推理开销的关键优化方向。

探索其他子课题