作者:关文选,花名云魄,阿里云E-MapReduce 高级开发工程师,专注于流式计算,Spark Contributor
1.背景介绍
流式计算一个很常见的场景是基于事件时间进行处理,常用于检测、监控、根据时间进行统计等系统中。比如埋点日志中每条日志记录了埋点处操作的时间,或者业务系统中记录了用户操作时间,用于统计各种操作处理的频率等,或者根据规则匹配,进行异常行为检测或监控系统告警。这样的时间数据都会包含在事件数据中,需要提取时间字段并根据一定的时间范围进行统计或者规则匹配等。
使用Spark Streaming SQL可以很方便的对事件数据中的时间字段进行处理,同时Spark Streaming SQL提供的时间窗口函数可以将事件时间按照一定的时间区间对数据进行统计操作。
本文通过讲解一个统计用户在过去5秒钟内点击网页次数的案例,介绍
继续阅读与本文标签相同的文章
上一篇 :
优酷背后的大数据秘密
下一篇 :
Mysql全量数据同步Oracle步骤详解
-
Python3入门(六)迭代器和生成器
2026-05-24栏目: 教程
-
关于一次领域开发的复盘
2026-05-24栏目: 教程
-
智慧零售转型路上举棋不定?不如看看他们是怎么做的 | CCF-GAIR 2019
2026-05-24栏目: 教程
-
1个月获客100万,这个支付宝小程序如何打造生态运营的增长飞轮
2026-05-24栏目: 教程
-
Startdt AI提出:使用生成对抗网络用于One-Stage目标检测的知识蒸馏方法
2026-05-24栏目: 教程
