流数据挖掘相关研究
在数据流上进行聚类,其基本任务就是要在对当前数据进行聚类的同时,随着新数据的不断流入,动态地调整和更新聚类的结果以真实反应数据流的聚类形态。这种在线的增量聚类使得常规的聚类技术难以在数据流上直接应用,算法必须要满足如下要求:①内存限制。由于内存容量有限,不可能将数据量庞大的数据流全部存储于内存,再进行聚类。在内存中只维护一个反映当前数据流特征的概要数据结构(synopsisdata structure,SDS)是目前常用的技术;②实时性。数据流聚类要求具备很短的响应时间,能够响应anytime 的用户聚类请求,要求算法处理速度快;③单遍扫描或者有限次扫描[2]。在对数据流进行聚类时,只能按数据点流入的顺序访问一次或几次。
以上只是基本要求,对一个高效的实时数据流聚类算法来说,还必须考虑:①聚类簇数事先未知。算法不可能预知数据流将会被分为几个聚类簇,不但如此,随着新数据不断地流入,聚类簇数目和状态都在不断地变化;②对孤立点的分析能力。由于数据流的不断流动和进化,当前时间窗口内的孤立点,有可能随着新数据的加入变成一个新聚类簇,也有可能仍然是孤立点而被删除,聚类算法必须能对这一情况及时鉴别和处理;③聚类形状任意。传统的基于欧式距离的相似度准则易于产生球形聚类,真实数据流所隐含的聚类簇一般包含很多非凸形状的聚类,算法必须具备识别任意形状聚类的能力。
概要数据结构的构建技术
由于内存限制,为了有效地对数据流进行在线聚类,只能采用相关技术在内存中维护一个反应数据流特征的概要数据结构SDS,以最大限度的保留对聚类有用的信息。该类技术一般是指在界标模型下,对起止时间戳分别为和的数据流{ ,⋯, }采用直方图、抽样、哈希技术、小波变换等技术创建其对应的SDS,要求便于增量地进行维护和更新。
直方图可高效的表示大数据集合的轮廓,如等宽直方图、V优化直方图等,直方图技术也是构造SDS的首选技术;
抽样技术借鉴统计学的相关理论,提取大数据集的特征;
哈希方法通过映射关系将大值域的数据集映射为小值域数据集,然后再提取相关的特征;
小波变换技术则是利用信息处理中的经典方法,采用变换后得到的少数小波参数来近似模拟原始的海量数据
数据倾斜技术
实时数据流环境下,用户往往对最近一段时间的数据更感兴趣,而不是从数据流开始一直到现在的所有数据,基于这一思想,多种数据倾斜技术被应用于数据流。
滑动窗口:设滑动窗口大小是,在任一时间戳,其需要聚类的数据流片段是{ max 0, +1 ,⋯ },对于时间戳max(0, +1)之后的数据全部忽略,不予考虑。这就要求滑动窗口不但要处理新到达的数据点,而且要考虑旧数据的影响。这种技术支持算法对“近期数据”做细致分析,对历史数据仅提供概要,减小了聚类对内存的需求,但是,需要事先指定窗口的大小。
衰退技术:窗口技术在一定程度上考虑了近期数据的重要性,但其对于在某一时间窗口内的数据点仍然“一视同仁”。为了突出离当前时刻越近的数据对聚类“越有意义”,Aggarwal等人[3]提出衰减因子和衰减函数来解决这一问题,其基本原理是越靠近当前时刻的数据赋给它们更大的权重。
SNMP 数据相对而言规模较小,在轮询频率较低的情况下,可以将数据存入数据库,便于以后进一步分析。而 RMON,NetFlow 和 sFlow 数据如果完全存储,则规模庞大,不便于分析和查询,存储的代价也非常高。在管理集群服务器的互连网络时,sFlow 数据一天就可累积达到数 G Byte。如何在线的处理这些流量数据是实现大规模网络流量实时分析的关键技术。
与传统的数据挖掘技术不同,数据流挖掘不再追求精确的挖掘结果,而是将问题放宽,在非常小的时间复杂度和空间复杂度下,迅速的处理连续到达的数据,输出预先定义好的查询结果。这使大规模数据实时处理成为可能。
流数据模型
根据 S.Muthukrishan 在[14]中的定义,数据流是指输入数据1 2a , a ,...按顺序到达,这些数据描述了一个信号 A。A 是一个一维函数2A :[1... N ]→ R。模型取决于ia 如何描述 A。三种常用的数据流模型是时间序列模型(Time Series Model),收银机模型(Cash Register Model)和转门模型(Turnstile Model)。时间序列模型是指每个 ( , )i ia = j I是 A[ j ]的更新,即 [ ]i iA j = I,并且ia 按照i递增的顺序到达。收银机模型指 ( , )i ia = j I是 A[ j ]的一个增量且 。转门模型与收银机模型类似,但是iI 可以小于 0。
数据流模型也可以根据不同的时序范围可以划分成多种子模型,包括界标模型(landmark model) 、滑动窗口模型 (sliding window model) 和快照模型 (snapshot
model)[31]。令 n 表示当前时间戳,s,e 分别是两个已知的时间戳。界标模型的查询范围从某一个已知的初始时间点到当前时间点为止,即{as,…,an}。滑动窗口模型仅关心数据流中最新的 W(W 也称为滑动窗口大小)个数据,其查询范围是{amax(n W+1,0),…,an},随着数据的不断到达,窗口中的数据也不断平移。快照模型则
浙公网安备 33010602011771号