统计学day2

本文深入探讨了统计学中的中心极限定理,解释了无论总体分布如何,样本均值趋于正态分布的现象,并介绍了置信区间的概念及其在估计总体参数中的应用。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

本文介绍中心极限定律和置信区间。

一.中心极限定理

首先是中心极限定理。中心极限定理是统计学中比较重要的一个定理。 只有真正理解了中心极限定理才能更好的理解统计学中其他的知识,比如正态分布。
那么什么是中心极限定理(Central Limit Theorem)

中心极限定理指的是给定一个任意分布的总体。我每次从这些总体中随机抽取 n 个抽样,一共抽 m 次。 然后把这 m 组抽样分别求出平均值。 这些平均值的分布接近正态分布。

我们先举个栗子?

现在我们要统计全国的人的体重,看看我国平均体重是多少。当然,我们把全国所有人的体重都调查一遍是不现实的。所以我们打算一共调查1000组,每组50个人。 然后,我们求出第一组的体重平均值、第二组的体重平均值,一直到最后一组的体重平均值。中心极限定理说:这些平均值是呈现正态分布的。并且,随着组数的增加,效果会越好。 最后,当我们再把1000组算出来的平均值加起来取个平均值,这个平均值会接近全国平均体重。

1.总体本身的分布不要求正态分布

上面的例子中,人的体重是正态分布的。但如果我们的例子是掷一个骰子(平均分布),最后每组的平均值也会组成一个正态分布。

2.样本每组要足够大,但也不需要太大

取样本的时候,一般认为,每组大于等于30个,即可让中心极限定理发挥作用。

二.用实际数据来展示中心极限定理:

import numpy as np 
random_data = np.random.randint(1, 7, 10000)
print random_data.mean() # 打印平均值
print random_data.std()  # 打印标准差

后面再现在我们抽取若干组(比如3000),每组60个。我们把每组的平均值都算出来。然后数据可视化处理后发现,平均值呈现正态分布。

三.数学解释中心极限定理

首先介绍泰勒展式:

对一个连续可导的函数,在一点局部我们认为这个函数可以用线性函数来拟合,从而有
.
这里面 是零阶项,是一阶修正,是高阶小量。

与此对应,我们可以试着对随机变量的进行“局部的泰勒展开”。假设是独立同分布的变量,那么根据大数定律和中心极限定理,我们有
.
其中期望对应 ,标准差对应一阶导,标准正态分布对应线性函数,是概率意义下的高阶小量。

通过这个类比我们可以这样理解大数定律和中心极限定理:
1、大数定律和中心极限定理可以看做随机变量的零阶和一阶“泰勒展开”,其中大数定律是随机变量的“零阶估计”,中心极限定理是在大数定律成立下的“一阶导数”,在极限下高阶小量可忽略。2、大数定律负责给出估计——期望,中心极限定理负责给出大数定律的估计的误差——标准差乘以标准正态分布。3、通过泰勒展开我们可以对中心极限定理的应用范围有一个直观的估计。为了使泰勒展开成立,我们假设了高阶小量在取平均(除以后)是可以忽略的。为了使这一点成立,我们至少需要样本量和方差在同一量级上或者更小

四、什么是置信区间?(Confidence intervals)

置信区间是一种常用的区间估计方法,所谓置信区间就是分别以统计量的置信上限和置信下限为上下界构成的区间 [2] 。对于一组给定的样本数据,其平均值为μ,标准偏差为σ,则其整体数据的平均值的100(1-α)%置信区间为(μ-Ζα/2σ , μ+Ζα/2σ) ,其中α为非置信水平在正态分布内的覆盖面积 ,Ζα/2即为对应的标准分数。

内容概要:本文针对国内加密货币市场预测研究较少的现状,采用BP神经网络构建了CCi30指数预测模型。研究选取2018年3月1日至2019年3月26日共391天的数据作为样本,通过“试凑法”确定最优隐结点数目,建立三层BP神经网络模型对CCi30指数收盘价进行预测。论文详细介绍了数据预处理、模型构建、训练及评估过程,包括数据归化、特征工程、模型架构设计(如输入层、隐藏层、输出层)、模型编译与训练、模型评估(如RMSE、MAE计算)以及结果可视化。研究表明,该模型在短期内能较准确地预测指数变化趋势。此外,文章还讨论了隐层节点数的优化方法及其对预测性能的影响,并提出了若干改进建议,如引入更多技术指标、优化模型架构、尝试其他时序模型等。 适合人群:对加密货币市场预测感兴趣的研究人员、投资者及具备定编程基础的数据分析师。 使用场景及目标:①为加密货币市场投资者提供种新的预测工具和方法;②帮助研究人员理解BP神经网络在时间序列预测中的应用;③为后续研究提供改进方向,如数据增强、模型优化、特征工程等。 其他说明:尽管该模型在短期内表现出良好的预测性能,但仍存在定局限性,如样本量较小、未考虑外部因素影响等。因此,在实际应用中需谨慎对待模型预测结果,并结合其他分析工具共同决策。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值