TDengine 的 TDgpt 数据分析预处理

在这里插入图片描述

上面是 TDgpt 的下一代重磅级新产品技术介绍发布会, 会上将有重大让你尖叫的技术革新公布,欢迎大家扫码预约直播!

TDgpt 数据分析预处理

分析流程

时序数据分析之前需要有预处理的过程,为减轻分析算法的负担,TDgpt 在将时序数据发给具体分析算法进行分析时,已经对数据做了预处理,整体的流程如下图所示。

在这里插入图片描述

TDgpt 首先对输入数据进行白噪声检查(White Noise Data check), 检查通过以后针对预测分析,还要进行输入(历史)数据的重采样和时间戳对齐处理(异常检测跳过数据重采样和时间戳对齐步骤)。
预处理完成以后,再进行预测或异常检测操作。预处理过程不属于预测或异常检测处理逻辑的一部分。

白噪声检查

在这里插入图片描述

白噪声时序数据可以简单地认为是随机数构成的时间数据序列(如上图所示的正态分布随机数序列),随机数构成的时间序列没有分析的价值,因此会直接返回。白噪声检查采用经典的 Ljung-Box 统计量检验,计算 Ljung-Box 统计量需遍历整个输入时间序列。如果用户能够明确输入序列一定不是白噪声序列,那么可以在参数列表中增加参数 wncheck=0 强制要求分析平台忽略白噪声检查,从而节省计算资源。
TDgpt 暂不提供独立的时间序列白噪声检测功能。

重采样和时间戳对齐

对于进行预测分析的时间序列数据,在进行预测分析前需要进行必要的预处理。预处理主要解决以下两个问题。

  • 真实时间序列数据时间戳未对齐。由于数据生成设备的原因或网关赋值时间戳的时候并不能保证按照严格的时间间隔赋值,时间序列数据并不能保证是严格按照采样频率对齐。例如采样频率为 1Hz 的一个时间序列数据序列,其时间戳序列如下。

    [‘20:12:21.143’, ‘20:12:22.187’, ‘20:12:23.032’, ‘20:12:24.384’, ‘20:12:25.033’]

    预测返回的时间序列时间戳会严格对齐,例如返回后续的两个预测结果的时间戳,其时间一定如下:[‘20:12:26.000’, ‘20:12:27.000’]。因此上述的输入时间戳序列要进行时间戳对齐,变换成为如下时间戳序列。

    [‘20:12:21.000’, ‘20:12:22.000’, ‘20:12:23.000’, ‘20:12:24.000’, ‘20:12:25.000’]

  • 数据时间重采样。用户输入时间序列的采样频率超过了输出结果的频率,例如输入时间序列的采样时间间隔是 5 sec,但是要求输出预测结果的采样时间间隔是 10sec。

    [‘20:12:20.000’, ‘20:12:25.000’, ‘20:12:30.000’, ‘20:12:35.000’, ‘20:12:40.000’]

    重采样为采样间隔为 10sec 的时间戳序列。

    [‘20:12:20.000’, ‘20:12:30.000’, ‘20:12:40.000’]

    然后将其作为预测分析的输入,[‘20:12:25.000’, ‘20:12:35.000’] 数据被丢弃。

需要注意的是,预处理过程不支持缺失数据补齐操作,如果输入时间序列数据 [‘20:12:10.113’, ‘20:12:21.393’, ‘20:12:29.143’, ‘20:12:51.330’],并且要求的采样时间间隔为 10sec,重整对齐后的时间戳序列是 [‘20:12:10.000’, ‘20:12:20.000’, ‘20:12:30.000’, ‘20:12:50.000’],那么对该序列进行预测分析将返回错误。

1.项目代码均经过功能验证ok,确保稳定可靠运行。欢迎下载体验!下载完使用问题请私信沟通。2.主要针对各个计算机相关专业,包括计算机科学、信息安全、数据科学与大数据技术、人工智能、通信、物联网等领域的在校学生、专业教师、企业员工。3.项目具有丰富的拓展空间,不仅可作为入门进阶,也可直接作为毕设、课程设计、大作业、初期项目立项演示等用途。4.当然也鼓励大家基于此进行二次开发。在使用过程中,如有问题或建议,请及时沟通。5.期待你能在项目中找到乐趣和灵感,也欢迎你的分享和反馈!【资源说明】基于Bert实现情感分析和文本分类任务python源码+数据集+项目说明.zip **data**: 用于存放数据的文件夹,包含原始数据、清洗后的数据、处理后的数据等。 **model**: 用于存放机器学习模型的文件夹,包含训练好的模型。 **train**: 用于模型训练的模块,可能包含训练脚本和训练参数的配置文件。 **crawler**: 用于爬取数据的模块。 **GUI**: 用于展示数据和模型结果的图形用户界面模块。 **processing**: 用于数据预处理的模块,包含各种清洗、转换和特征提取的函数或脚本。 **sentiment**: 用于情感分析的模块,包含情感分析器的实现和用于测试和评估情感分析器的脚本。 **topic**: 用于主题建模的模块,可能包含主题建模算法的实现和用于测试和评估主题建模算法的脚本。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

TDengine (老段)

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值