第一步:将数据记录阶段得到的当前时间窗口的观测与上一时间窗口末尾得到的当前时间窗口的预测s作差运算,得到当前时间窗口的误差。
第二步:对此误差 sketch 绝对值的每一行计算一个均值Et(i)和均方差 Vt(i)。
第三步:判断误差sketch第i行的所有计数器的值是否超过E(i) V(i),如果大于这个阈值,则说这个计数器是异常的,否则是正常的。
第四步:得到异常计数器 Cij对应的链表结构 Listij中存储的 key(目的
IP 地址)集合Uij。
第五步:将同一hash函数对应的Uij求并集,再将得到的并集在不同哈
希函数之间取交集,得到异常 key 集合,即 C异常 ij 。 i 0H 1 ij
2.数据挖掘实现原理
数据挖掘(Data Mining, DM)就是从大量的、不完全的、有噪声的、模糊的、随机的数据中,提取隐含在其中的、人们事先不知道的、但又是潜在的有用信息和知识的过程。数据挖掘发展至今,有了很多的发展分支和研究方向,根据挖掘方式不同,当前数据挖掘主要技术可以分为:关联分析、序列分析、分类分析和聚类分析[6-7]。
(1)聚类分析
聚类分析是数据挖掘领域中一个重要的研究课题。聚类是指对一个已给的数据对象集合,将其中相似的对象划分为一个或多个组(称“簇”)的过程。同一个簇中的元素是彼此相似的,而与其它簇中的元素相异。聚类分析作为独立的工具有着广泛的应用场景,并且可以(作为数据挖掘中

