第3章 统计学与概率基础
本书通篇将使用统计学和概率论中的各种概念,这些概念对于理解和构建预测至关重要。本节将介绍一些基本工具和定义。假设读者已经具备一些基本的概率和统计概念,本章仅作为本书其他部分所用主要概念的复习。本章将回顾分布的基本定义、估计分布的方法,并介绍一些重要概念,如自相关和互相关。如需更详细的基础统计学描述,作者推荐入门教材如[1](另见附录D中列出的拓展阅读材料)。
3.1 单变量分布
现实世界的数据通常具有一定程度的不确定性,其取值分布在某个(可能无限的)值域上。概率预测的主要部分在于尝试准确描述或建模感兴趣值的分布。就本书而言,分布将用于描述概率预测,从而理解决定其产生的估计相关的不确定性。注意,我们将重点关注需求数据,因此方法通常适用于实连续变量(相对于离散/分类变量)。本节仅考虑单变量分布,即描述单个实变量的分布。我们将一个连续变量定义为随机变量,其值取决于随机过程并具有连续分布。注意,在下文中,随机变量用大写字母表示,例如 X ,而小写字母变量(例如 x )将指代该随机变量的特定实现/观测值。
描述随机变量 X 分布的最常见方法之一是通过其概率密度函数(PDF)$f_X(x)$ ,定义在某个(可能无限的)区间 $x\in(a,b)\subseteq\mathbb{R}$ 上。PDF是一个非负函数,描述观察到任何值 $x\in(a,b)$ 的相对可能性,可用于计算变量取值在区间 $(a_1, b_1) \subseteq (a, b)$ 内的概率,如下所示
$$\begin{aligned} P\{a_1 \le X \le b_1\} = \int _{a_1}^{b_1}f_X(x) dx. \end{aligned}\tag{3.1}$$
注意,根据定义,PDF的积分上界为1。
分布的另一种同等重要的表示是累积分布函数(CDF)。再次假设CDF定义在某个(可能无限)区间 $x\in(a,b)\subseteq\mathbb{R}$ 上。CDF表示随机变量X取值小于等于某个指定值x的概率,通常写作函数 $F_{X}(x)=P\{X\leq x\}$ 。它与PDF的关系为
$$\begin{aligned} F_X(x) = \int _{a}^{x}f_X(t) dt. \end{aligned}\tag{3.2}$$
即对 $f_{X}(t)$ 在区间 $(a,x)$ 上关于t积分。注意CDF是单调递增函数,这意味着如果 $x_{1}\leq x_{2}$ 则 $F_{X}(x_{1})\leq$ $F_{X}(x_{2})$ 。此外,它满足极限 lim $\lim_{x\longrightarrow a}F_{X}(x)=0$ 和 $\lim_{x\longrightarrow b}F_{X}(x)=1$ 。
期望值和方差是与PDF/CDF相关的两个重要导出量。期望值定义为
$$\begin{aligned} \mathbb {E}(X) = \int _{a}^{b}t f_X(t) dt, \end{aligned}\tag{3.3}$$
方差定义为
$$\begin{aligned} \mathbb {V}ar(X) = \int _{a}^{b}(t-\mu )^2 f_X(t) dt, \end{aligned}\tag{3.4}$$
其中 $\mu=\mathbb{E}(X)$ 。期望(或称均值)本质上表示随机变量X取值的加权平均,权重为概率密度 $f_X$ 。它作为随机变量的典型值或期望值。
方差是离差平方的期望值。它常用于表示数据围绕均值的分散程度,因此是随机变量不确定性的简单度量。方差的正平方根称为标准差(通常记作 $\sigma = \sqrt{\mathbb {V}ar(X)}$ )。
最常研究且最重要的分布之一是单变量高斯(也称正态)分布,其PDF定义为
$$\begin{aligned} f(x) = \frac{1}{\sqrt{2\pi } \sigma } \exp \left( -\frac{(x-\mu )^2}{\sigma ^2} \right) . \end{aligned}\tag{3.5}$$

因此高斯分布完全由两个参数定义,即均值 $\mu$ 和方差 $\sigma ^2$ 。当 $\mu=0$ 且 $\sigma=1$ 时,方程(3.5)称为标准正态分布。
图3.1展示了不同均值和标准差的高斯分布示例。注意高斯分布始终呈钟形,且关于均值对称。此外,方差越大,分布越宽,这符合预期。在相应的累积分布图中,方差越小,梯度越陡峭。
并非所有变量都服从高斯分布,甚至不一定对称。还存在大量其他参数族分布。对数正态分布适用于具有右偏长尾的正偏态变量,其PDF定义为
$$\begin{aligned} f(x) = \frac{1}{x \sqrt{2 \pi } \sigma } \exp \left( \frac{-(\ln (x)-\mu )^2}{\sigma ^2} \right) , \end{aligned}\tag{3.6}$$
其中参数为 $\mu$ 和 $\sigma$ 。注意这只是变量对数的高斯分布(3.5)。还有更一般的分布,如伽马分布,它可以表示各种不同的分布形状。伽马CDF具有相对复杂的形式
$$\begin{aligned} Gamma(X, \alpha , \beta ) = \frac{1}{\beta ^\alpha \Gamma (\alpha )}\int _{0}^{X} t^{\alpha -1} e^{-t/\beta } dt, \end{aligned}\tag{3.7}$$
对于参数 $\alpha,\beta$,通常分别称为形状参数和尺度参数,而 $\Gamma (x) = \int _0^\infty t^{x-1}e^{-t} dt$ 是所谓的伽马函数。对数正态分布和伽马分布在不同参数值下的概率密度函数如图3.2所示。

高斯分布、伽马分布和对数正态分布是参数分布函数的例子,因为它们完全由输入参数定义。还有非参数分布,它不假设数据来自任何特定的参数函数族。核密度估计是一种流行的非参数估计分布的方法,将在第3.4节中描述。本书主要关注非参数模型,但高斯分布也常用于建模误差分布。
这如何转化为短期负荷预测?
点预测通常是分布期望值的估计,因此是本书背景下的核心概念。预测误差的标准差也可以指示预测的不确定性和潜在值的分散程度。生成点预测的方法将在第9章和第10章中详细描述。
3.2 分位数和百分位数
连续累积分布函数存在反函数 $F_X^{-1}$,它可以取任意 $q\in[0,1]$ 并给出唯一值 $x_{q}=F_{X}^{-1}(q)$。该值是第 $q$ 分位数,或 q 分位数,也称为第 $100q$ 百分位数 [2]。最著名的值是中位数(0.5 分位数或 50 百分位数)以及下四分位数和上四分位数(分别为第 25 百分位数和第 75 百分位数,或 0.25 分位数和 0.75 分位数)。本质上,q 分位数定义了域中的一个值,小于该值的数据比例为 $q$。换句话说,随机变量 X 小于 $x_{q}$ 的比例是 $q.$ .1

图3.3展示了标准正态分布的第 50 和第 90 百分位数的例子。注意,q 分位数就是水平线 $y=q$ 与累积分布函数交点对应的域值,如图3.3所示。通常完整的累积分布函数是未知的,但可以估计有限数量的分位数。当计算出足够多的分位数时,可以形成对整个分布的准确估计。第3.4节给出了根据观测值估计分位数的方法。
分位数是在仅获得总体样本时估计分布的重要工具,可用于创建概率预测,如第11.4节所示。
3.3 多元分布
多元分布是第3.1节中介绍的单变量分布扩展到多个变量的情形。现在考虑 N 个随机变量 $X_1, X_2, \ldots , X_N$。与单变量分布的概率密度函数类似,有联合概率分布
$$\begin{aligned} f_{X_1, X_2, \ldots , X_N}(x_1, x_2, \ldots , x_N) \end{aligned}\tag{3.8}$$
与PDF类似,它描述了观测到值集$(X_1, X_2, \ldots , X_N)$的相对概率。多维分布的CDF定义为
$$\begin{aligned} F_{X_{1},\ldots ,X_{N}}(x_{1},\ldots ,x_{N})=P \{X_{1}\le x_{1},\ldots ,X_{N}\le x_{N} \}, \end{aligned}\tag{3.9}$$
并且可以用联合概率分布表示为
$$\begin{aligned} F_{X_{1},\ldots ,X_{N}}(x_{1},\ldots ,x_{N}) = \int _{-\infty }^{x_N} \ldots \int _{-\infty }^{x_1} f_{X_1, X_2, \ldots , X_N}(t_1, t_2, \ldots , t_N) dt_1 dt_2 \ldots dt_N. \end{aligned}\tag{3.10}$$
如果$N=2$,那么多维分布称为二元分布。最简单的多维分布之一是由下式定义的多维高斯联合分布
$$\begin{aligned} f_{X_{1},\ldots ,X_{N}}(x_{1},\ldots ,x_{N}) = \frac{1}{(2\pi )^{N/2}det(\boldsymbol{\Sigma })^{1/2}}exp \left( (\textbf{x}- \boldsymbol{\mu })^T\boldsymbol{\Sigma }^{-1}(\textbf{x}- \boldsymbol{\mu }) \right) , \end{aligned}\tag{3.11}$$
其中$\mathbf{x}=(x_{1},\ldots,x_{N})^{T}\in\mathbb{R}^{N},\mu=(\mu_{1},\ldots,\mu_{N})^{T}\in\mathbb{R}^{N}$,这里$\mu_{k}$是随机变量$X_{k}$的期望值,$\boldsymbol{\Sigma}\in\mathbb{R}^{N\times N}$是协方差矩阵,描述了变量之间的协方差。该矩阵的对角线元素描述了随机变量的方差,即$(\boldsymbol{\Sigma})_{k,k}=\mathbb{V}ar(X_{k})$,非对角线元素描述了一个随机变量相对于另一个随机变量的变化。考虑两个随机变量$X_{k}$和$X_{m}$,那么这两个变量之间的协方差可以用期望表示为
$$\begin{aligned} Cov(X_k,X_m)=\mathbb {E}[(X_k-\mathbb {E}[X_k])(X_m- \mathbb {E}[X_m])]. \end{aligned}\tag{3.12}$$
注意,协方差矩阵是对称且半正定的。^(2)(皮尔逊)相关系数定义为
$$\begin{aligned} Corr(X_k,X_m)=Cov(X_k,X_m)/\sigma _k\sigma _m, \end{aligned}\tag{3.13}$$
并且介于-1和1之间,是衡量两个变量之间线性相关程度的指标。换句话说,两个变量之间的相关性是协方差除以变量的标准差。如果两个变量是独立的(即一个变量的变化不影响另一个变量的变化),那么它们不相关,协方差为零。对于两个变量的特殊情况,二元协方差矩阵可以写为
$$Cov=\left[\begin{array}{cc}\sigma_{1}^{2}&\sigma_{1}\sigma_{2}\rho\\\sigma_{1}\sigma_{2}\rho&\sigma_{2}^{2}\end{array}\right]$$
(a)
(b)

其中 $\rho\in[-1$,1 是相关系数 $Corr(X_{1},X_{2})$,而 $\sigma_{1},\sigma_{2}$ 是随机变量 $X_{1}$ 和 $X_{2}.An$ 的标准差。$\rho=0.6,\sigma_{1}^{2}=0.6$ 和 $\sigma_{2}^{2}=1$ 的二元高斯分布示例如图 3.4 所示。这里 (a) 是联合概率密度,(b) 是联合累积分布函数。相关系数 $\rho$ 相对较大,因此这些变量相互之间有一定相关性。
为简化对多维分布的讨论,本章剩余部分将重点讨论二元分布,但结果可推广至更一般的多维分布。
多维分布最重要的子结构之一是边缘分布。给定一个联合二元分布$f_{X_{1},X_{2}}(x_{1},x_{2})$,随机变量$X_{1}$的边缘分布描述了在未知$X_{1}$的条件下$X_{2}$的分布,通过对$X_{2}$积分得到。
$$\begin{aligned} f_{X_1}(x_1)= \int _{-\infty }^{\infty } f_{X_1, X_2}(x_1, x_2) dx_2. \end{aligned}\tag{3.14}$$
类似地,$X_{2}$的边际分布可以定义为
$$\begin{aligned} f_{X_2}(x_2)= \int _{-\infty }^{\infty } f_{X_1, X_2}(x_1, x_2) dx_1. \end{aligned}\tag{3.15}$$
图3.5展示了二元高斯分布的联合分布与边际分布(与图3.4中的联合分布相同)。注意,如果随机变量$X_{1}$和$X_{2}$相互独立,则联合密度就是每个变量边际密度的乘积$f_{X_{1},X_{2}}(x_{1},x_{2})=f_{X_{1}}(x_{1})f_{X_{2}}(x_{2})$。边际分布通常更容易估计,因为它们只需估计每个单独的变量,而不需要对变量间的相互依赖关系进行建模。

如果其中一个值(比如$X_{2}$)被观测到,因此其值$x_{2}$是确定的,那么在给定该特定值条件下$X_{1}$的分布称为条件密度,记为$f_{X_{1}|X_{2}}(x_{1}|x_{2})$。
联合分布、边际分布和条件分布由以下公式关联:
$$\begin{aligned} f_{X_{1}| X_{2}}(x_{1}|x_2) = \frac{f_{X_{1}, X_{2}}(x_{1}, x_2)}{f_{X_{2}}(x_2)}. \end{aligned}\tag{3.16}$$
作为一个简单的说明性例子,考虑从一个装有十个外观相同球(每个球上写有从1到10的唯一数字)的袋子中随机抽样。由于每个球被抽中的机会相等,因此抽中任何一个球的概率都是$1/10$。然而,在已知球上数字为奇数的条件下,抽中数字3的条件概率是$1/5$。
这如何转化为短期负荷预测?
联合密度、边际密度和条件密度在考虑概率预测时都非常有用。本书将重点关注日前(通常为每小时)的需求预测。这意味着目标是估计一个24维的联合分布$f_{X_{1},X_{2},\dots,X_{24}}(x_{1},x_{2},\dots,x_{24})$,其中$X_{k}$是次日的第k小时的需求。通常更容易估计每个$X_{k}$的单变量分布。这些是完整联合分布的边际分布。现在考虑一个带每小时更新的日前预测,即随着新观测值的获得而更新概率预测。换句话说,在当天的第k小时之后,目标是估计条件密度$f_{X_{k+1},\ldots X_{24}|X_{1},\ldots,X_{k}}(x_{k+1},\ldots x_{24}|x_{1},\ldots,x_{k})$,其中$0\leq k<23$。生成概率预测的方法将在第11章详细描述。特别地,本章将介绍Copula——一种非常流行的联合密度预测方法,它严重依赖于将边际密度估计与一个用于建模随机变量间相互依赖关系的Copula函数相结合(第11.7节)。
3.4 非参数分布估计
本节介绍从现有观测值估计和理解分布的基本非参数方法。其中一些方法,如核密度估计方法,将作为第11章中一些概率预测的基础构件。当已知数据并非来自特定的参数分布族(如高斯分布或Gamma分布,见第3.1节)时,这类方法非常有用。
估计概率密度函数最常用的方法之一是直方图。直方图只是对变量某些预定义离散分区(称为箱)内观测值数量的计数。箱通过将空间划分为离散组来定义。对于单变量随机变量,这些就是区间[a, b];对于多变量数据,这些是由区间定义的区域,例如$[a_{1},b_{1}]\times[a_{2},b_{2}],\times\cdot\cdot\cdot\times[a_{N},b_{N}]$。由于高维可视化困难,直方图通常仅限于单变量和双变量数据。每个箱通常大小相等,但并非必须如此。图3.6a展示了一个使用20个等距箱的直方图示例。
直方图方法的一个局限性是依赖于箱的位置和大小,对它们的微小调整会显著改变图的形状。此外,直方图是连续变量的离散表示,这意味着在分箱过程中会丢失一些信息。一个更可取但稍微复杂的估计器是核密度估计(KDE)。KDE是在每个观测值$x_{k}$(随机变量X的观测值)周围定义的小光滑函数K(称为核)的求和,以贡献于整体概率密度函数,可以写成:

$$\begin{aligned} g(X) = \frac{1}{Nh} \sum _{k=1}^{N} K \left( \frac{X-x_k}{h} \right) , \end{aligned}\tag{3.17}$$
其中 h 是带宽超参数。有多种核函数,但最常用的是高斯核,定义为
$$\begin{aligned} K(x) = \frac{1}{\sqrt{2\pi }} \exp \left( -\frac{1}{2}x\right) . \end{aligned}\tag{3.18}$$
最重要的参数是带宽 h,它决定了最终分布的平滑程度。h 越大,最终估计越平滑。该参数的最优值通常通过交叉验证方法(见第8.2节)找到,尽管有时在假设分布底层形状的情况下也会使用经验法则。图3.6b展示了两种不同带宽下的KDE表示(数据与图3.6a相同)。注意,如果带宽太小,KDE会过拟合单个观测值(见第8.1.3节)。相反,带宽太大意味着由于欠拟合观测值而丢失特征。KDE扩展到生成概率预测将在第11.5节中探讨。
现在考虑使用样本 $x_{1},x_{2},\ldots,x_{N}$ 估计单变量分布的CDF。CDF可以通过经验累积分布函数(ECDF)轻松估计,定义为
$$\begin{aligned} \hat{G}_X(x) = \frac{\text {number observations less than } x}{N}=\frac{1}{N}\sum _{k=1}^N \textbf{1}_{x_k<x}, \end{aligned}\tag{3.19}$$
其中 $\mathbf{1}_{S}$ 是指示函数,如果语句 S 为真则取值为1,否则为0。在这种情况下,语句是观测值是否小于 x。换句话说,经验CDF简单地计算小于特定值的观测值的比例。图3.7展示了标准正态分布的CDF及其对应的经验CDF(基于20个随机采样点)。注意,经验CDF在每观测到一个点时会跳跃,并且观测值越多,近似越接近真实CDF。
分位数(第3.2节)也可以从有限样本点中估计。假设观测值已排序,即样本 $x_{1},x_{2},\ldots,x_{N}$ 满足对于 $k=1,\ldots,N-1$ 有 $x_{k}<x_{k+1}$(这些也称为顺序统计量)。那么对于 $q\in(0,1)$,q-样本分位数定义为最接近的 $x_{k}$,其中 $k$ 四舍五入到 $qN$。
当然,由KDE创建的PDF估计也可以容易地转换为CDF估计,利用CDF本身的定义(第3.1节)。然而,由于核函数本身通常是分布(如高斯分布),这意味着CDF就是每个核的CDF之和。
有时不需要可视化整个点的分布,通过几个点就可以对分布有良好的整体印象。箱线图提供了分布的一些汇总统计量的可视化。图3.8展示了两个数据集的箱线图示例,其中第一个数据集与图3.6中相同,而第二个数据集是均值和标准差均为0.5的简单高斯分布。箱线图包含的内容可能有所不同,但通常都显示以下内容:


一个中心值,由主框内的线表示。在图3.8的箱线图中,这是中位数,由红线表示。
• 第一和第三四分位数,由箱子的底部和顶部给出。
须显示数据点到最小值和最大值的跨度(通常不包括被视为异常值的点)。这些是图3.8中的虚线。
异常值定义为那些距离盒子顶部或底部超过1.5倍四分位距的点。在图中用红色叉号表示。
箱线图虽然相对简单,但可用于生成对数据的一些洞察。首先,它提供了数据分布非常基本的表示,包括中间50%的数据所在位置。两个数据集的箱线图比较还可以指示数据之间是否存在显著重叠。最后,如果中位数线不在盒子的中心,则表明数据存在偏态。
这如何转化为短期负荷预测?
非参数方法提供了一种数据驱动的方式,在很少假设的情况下开发不确定性估计。尽管存在超参数(例如核密度估计的带宽),但与参数模型不同,非参数模型很少需要建模者的输入,因此可以实现更多的自动化和扩展。非参数预测模型将在第11章中更详细地讨论。
3.5 样本统计量与相关性
期望值和方差是与分布相关的重要值,通常分别用作“典型”值和不确定性的估计。然而,在实践中,分布是未知的,分布的重要特征只能从可用观测值中估计。假设 $x_{1},\ldots,x_{N}$ 是单变量连续随机变量 X 的观测样本,且每个样本独立(即没有样本相互依赖)。均值的总体估计是样本均值,定义为
$$\begin{aligned} \hat{\mu } = \frac{1}{N} \sum _{k=1}^N x_k. \end{aligned}\tag{3.20}$$
类似地,有样本方差
$$\begin{aligned} \hat{\sigma ^2} = \frac{1}{N-1} \sum _{k=1}^{N}( x_k-\hat{\mu })^2, \end{aligned}\tag{3.21}$$
它除以 N-1 而不是 N,这是为了确保估计量无偏。³ 如第3.1节所述,样本标准差是方差的平方根。其他重要的集中趋势度量包括中位数(0.5分位数)和四分位距(0.75分位数与0.25分位数之差)。这些值通常比均值和方差更稳健(即对异常值更不敏感)。
在第3.3节中,针对分布已知的连续随机变量,引入了随机变量之间的协方差和相关性概念。考虑双变量随机变量 $(X_{1},X_{2})$ 的观测值 $(x_{k,1},x_{k,2}),k=1,...,N$,则样本皮尔逊相关系数可定义为
$$\begin{aligned} \rho =\frac{\sum _{k=1}^N (x_{k, 1} -\bar{x}_1)(x_{k, 2} -\bar{x}_2)}{\sqrt{\sum _{k=1}^N (x_{k, 1} -\bar{x}_1)^2}\sqrt{\sum _{k=1}^N (x_{k, 2} -\bar{x}_2)^2}}, \end{aligned}\tag{3.22}$$
其中 ${\bar{x}}_{1},{\bar{x}}_{2}$ 分别是随机变量 $X_{1}$ 和 $X_{2}$ 的样本均值。
除皮尔逊相关系数外,另一种常见的相关性度量是斯皮尔曼秩相关系数。它定义为两个随机变量中值的秩的皮尔逊相关。换句话说,取随机变量 $X_{1}$ 的观测值 $x_{1,1},x_{2,1},\dotsc,-,-,-$,并基于它们的秩进行分配,即最大值赋值为1,第二大值赋值为2,依此类推。对第二个随机变量 $X_{2}$ 同样处理。然后使用公式(3.22)计算这些秩的皮尔逊相关。
相关性的概念可以推广到单变量时间序列(第5.1节),即 $(L_{1},L_{2},\ldots,L_{N})^{T}$,其中 $L_{t}$ 是时间 t 的单个值,且数据点按时间顺序连续排列。首先考虑自协方差和自相关——即时间序列值与其滞后值之间的(皮尔逊)相关性。滞后 k 的样本自协方差函数定义为
$$\begin{aligned} R(k) = \frac{1}{N} \sum _{t=1}^{N-k} (L_t-\hat{\mu })(L_{t+k} - \hat{\mu }), \end{aligned}\tag{3.23}$$
其中 $\hat{\mu}$ 是时间序列 $(L_{1}, L_2, \ldots , L_{N})^T$ 的样本均值。类似地,滞后 k 的 μ 自相关函数(ACF)定义为
$$\begin{aligned} \rho (k) = \frac{1}{N\hat{\sigma }^2} \sum _{t=1}^{N-k} (L_i - \hat{\mu })(L_{t+k} - \hat{\mu }) = \frac{R(k)}{R(0)}= \frac{R(k)}{\hat{\sigma }^2}, \end{aligned}\tag{3.24}$$
其中 $\hat{\sigma }^2$ 是样本方差。
σ绘制几个连续滞后 $\rho(0),\rho(1),\ldots$ 的自相关图 ρ ρ 是识别时间序列与其滞后值之间相互依赖关系以及识别重要特征(如季节性)的常见方法。它们常用于识别 ARIMA 模型的正确阶数(见第9.4节)。自相关有界 $-1\le\rho(k)\le 1$,对于 $k \in \mathbb {N}$,其中 $\rho=1$ 表示完全正相关,$\rho=-1$ ρ ρ 表示完全负相关。$\rho=0$ 表示完全没有相关性。
ρ滞后 k 的偏自相关函数(PACF)描述了序列 $L_t$ 与滞后序列 $L_{t+k}$ 之间在条件于中间值 $L_{t+1},\ldots,L_{t+k-1}$ 下的自相关。换句话说,它描述了剔除较短滞后影响后的自相关。
图3.9 显示了30个滞后的自相关和偏自相关图示例。通常这些图还包含两条水平线,指示显著相关存在的水平。这两条线所定义区域之外的值表示显著的相关值(尽管有时某些值可能偶然落在这些线外)。
ACF 图显示在滞后 6、12、18、24 处存在强自相关,但也在其他滞后处存在。PACF 图同样显示了周期为 6 的强滞后,然而,与 ACF 图相比,PACF 图中许多其他相关性要小得多(例如滞后 3、4 和 5 处),这表明其他滞后的影响可能暗示了比时间序列中实际存在的更强的自相关。
互相关是自相关的扩展,但用于两个不同的时间序列。为了说明这一点,考虑第二个时间序列 $M_1, M_2, \ldots , M_N$,定义在与 $(L_{1}, L_2, \ldots , L_{N})^T$ 相同的时间步长上。L 和 M 在滞后 $k\ge 0$ 处的互相关可以定义为

$$\begin{aligned} \text {XR}(k) = \frac{1}{N} \sum _{t=1}^{N-k} (L_t - \hat{\mu }_1)(M_{t+k} - \hat{\mu }_2), \end{aligned}\tag{3.25}$$
对于 $k \le 0$ 为
$$\begin{aligned} \text {XR}(k) = \frac{1}{N} \sum _{t=1}^{N-k} (M_t - \hat{\mu }_2)(L_{t+k} - \hat{\mu }_1), \end{aligned}\tag{3.26}$$
其中 $\hat{\mu }_1$ 和 $\hat{\mu }_2$ 分别是 $L_t$ 和 $M_t$ 的时间序列样本均值。μ$k=0$ 处的值表示两个序列之间无滞后的相关性。该函数不仅识别哪些滞后最重要,还识别时间方向。例如,温度可能是用电需求的强指标,但如果最近的气象站在邻近城镇,那么记录的值可能与目标城镇的温度相关,但存在延迟。在这种情况下,用电需求与观测到的邻近城镇滞后温度之间将存在强互相关。
这如何转化为短期负荷预测?
样本统计量对于负荷预测至关重要,因为时间序列并非连续测量,而是以固定间隔(通常为半小时或每小时)进行。因此,推导和估计负荷预测的特征需要使用样本统计量。
此外,自相关和互相关是识别模型中重要解释变量以及作为模型输入的变量滞后项的有用工具。应注意,尽管相关并不意味着因果,但相关仍然可以是预测模型中有用指标的重要指示。这些统计度量将在全书中使用,特别是在数据分析(第6.2节)和第九章中的统计点预测模型中。
3.6 习题
- 从你选择均值和标准差的正态分布中生成不同大小的样本。将这些值与不同大小的样本图进行对比。这些值是否开始收敛到真实值?收敛开始于多少个样本?这展示了中心极限定理。对于小样本,均值变化有多大?现在绘制中位数?小样本时中位数变化有多大?其中一个是否比另一个对新增数据更稳健?
- 对于标准正态分布,有多少数据落在(a)一个标准差,(b)两个标准差,(c)三个标准差内(从中心算起)?
- 对于标准正态分布,哪些分位数最接近距中心一个标准差的值?
- 如果分布不对称,均值和中位数之差告诉你关于分布偏度的什么信息?
- 从你选择的单变量分布中抽样,并绘制直方图(使用默认的组距)。改变组距和样本数量,并与原始分布进行比较。对于你的一个采样集,什么样的组距看起来合适(假设样本量足够大)?
- 从与上一个问题相同的单变量分布中抽样。使用不同的带宽和不同的样本量绘制核密度估计。观察效果,对于你的一个样本集,什么样的带宽选择较好(确保样本量足够大)?
- 为三个数据集绘制箱线图,每个数据集由来自三个不同单变量分布的1000个样本生成(或许使用本章描述的伽马分布、对数正态分布和高斯分布)。调整每个模型的参数,以便所有箱线图在图上清晰可见。比较
这些图与原始分布:箱线图的中心值如何变化?须线和箱子大小呢?
- 绘制两个变量都具有单位方差的二元高斯分布。改变图之间的相关性,并观察它们如何变化。当改变相关性时,每个变量的边际分布如何变化?
- 对于与前一个问题相同的二元分布。考虑其中一个变量的条件分布,方法是将另一个变量的小区间内的数据样本分箱。绘制这些点的直方图。随着区间位置的变化,直方图如何变化?
- 下载一些能源时间序列数据(参见第D.4节)。绘制其中几个时间序列的自相关和偏自相关图(仅考虑最多几周的滞后)。主要的相关值在哪里?自相关图和偏自相关图之间的差异是什么?将这些值与时间序列图进行比较。是否存在明显的季节性模式,它们如何与自相关图相关联?
- 下载GEFCOM 2014数据,或者下载任何其他也包含温度数据的需求时间序列数据(数据集列表参见第D.4节)。绘制其中一个需求序列与温度数据的散点图。这种关系看起来如何?温度是否对数据有明显的影响?计算需求与温度数据的互相关图。主要的相关性在哪里?在滞后值处是否存在强相关性?
参考文献
- F.M. Dekking, C. Kraaikamp, H.P. Lopuhaä, L.E. Meester, 概率与统计的现代导论:理解为何与如何 (Springer, London, 2005)
- D. Ruppert, D.S. Matteson, Statistics and Data Analysis for Financial Engineering: with R Examples. Springer Texts in Statistics (2015)
除非在材料的致谢行中另有说明,本章中的图像或其他第三方材料均包含在本章的知识共享许可中。如果材料未包含在本章的知识共享许可中,且您的预期使用不被法定法规允许或超出允许使用范围,您将需要直接获得版权持有人的许可。