第7章 负荷预测模型的验证与评估
什么构成了好的预测?本节旨在介绍一些评估时间序列预测质量的主要工具。值得注意的是,这仍然是一个非常活跃的研究领域,尤其是在概率性负荷预测的发展领域。显然,误差度量只能在实际观测值可用后计算,尽管在实践中,预测是通过将历史数据分为训练期和测试期(参见第8.1.3节)来评估的。
当然,当需要为特定应用进行预测时,为什么不更合适地根据该应用的性能来评估预测呢?原因之一是,应用的性能(参见第15章中的应用示例)通常不是以简单方式定义的,并且可能在计算上不可行,特别是当需要多次评估时。相反,使用更简单、更容易计算的度量,例如本章介绍的这些度量。然而,这并不意味着任何度量都可以使用,最好选择一种与应用尽可能一致的度量。
本节将首先介绍用于评估预测准确性的误差度量,同时也用于比较和选择各种模型(第8.2节)。在查看具体的误差指标和度量之前,值得注意的是,根据我们考虑的是点预测还是概率性预测(第5.2节),度量必须有所不同,后者有几种不同的形式,可能需要不同的度量。下一节考虑点预测度量,然后在第7.2节中讨论概率性误差度量。这些度量可用于定义技能得分,这是一种重要的预测技能评估方法,并在第7.4节中考虑。本章最后通过基于残差检查和其他预测修正方法来改进预测的方式进行说明。
7.1 点预测误差度量
为了定义误差度量,考虑两个h步前的点预测
$$\hat{\textbf{L}}^{(1)} =(\hat{L}^{(1)}_{n+1}, \hat{L}^{(1)}_{n+2}, \ldots , \hat{L}^{(1)}_{n+h})$$
和
$$\hat{\textbf{L}}^{(2)} =(\hat{L}^{(2)}_{n+1}, \hat{L}^{(2)}_{n+2}, \ldots , \hat{L}^{(2)}_{n+h})$$
对于一个由$\textbf{L}=(L_{n+1}, L_{n+2}, \ldots , L_{n+h})$给出实际值的时间序列。预测之间的误差定义为
$$\begin{aligned} \textbf{e}^{(k)}=\textbf{L}-\hat{\textbf{L}}^{(k)} = (L_{n+1}-\hat{L}^{(k)}_{n+1}, L_{n+2}-\hat{L}^{(k)}_{n+2}, \ldots , L_{n+h}-\hat{L}^{(k)}_{n+h}) = (e^{(k)}_1, e^{(k)}_2, \ldots , e^{(k)}_h), \end{aligned}\tag{7.42}$$
其中k为1或2。如何给这些预测打分并总结这些误差,以便比较哪一个‘更接近’实际值,从而哪个更准确?答案并不显而易见,因为有多种方法可以选择如何衡量这一点(当然,除非$\textbf{e}^{(k)} = \textbf{0}$,这种情况下你已经实现了完美的预测!)。
作为初始选择,考虑范数函数,这是一种衡量向量间距离的常用方法。给定任意实值向量$\textbf{x}=(x_1, x_2, \ldots , x_N)$,x的p-范数定义为
$$\begin{aligned} ||\textbf{x}||_p = \left( \sum _{k=1}^N x^p_k\right) ^{1/p}=(x^p_1+ x_2^p+\cdots + x^p_N)^{1/p}, \end{aligned}\tag{7.43}$$
其中$p\geq 1$。最常见的范数是1-范数(即绝对和),
$$\begin{aligned} ||\textbf{x}||_1 = |x|_1+ |x|_2+\cdots + |x|_N, \end{aligned}\tag{7.44}$$
2-范数(称为标准欧几里得范数),
$$\begin{aligned} ||\textbf{x}||_2 = \sqrt{x^2_1+ x_2^2+\cdots + x^2_N}, \end{aligned}\tag{7.45}$$
以及∞-范数,定义为$\vert\vert\mathbf{x}\vert\vert_{\infty}=\max_{k\in\{1,...,N\}}\vert x_{k}\vert$。p-范数是度量函数,具有以下有用性质,使其对于衡量两个向量之间的差异具有良好的定义和直观性:
- 正定性:$||\mathbf{x}||_{p}\geq 0$且$||\mathbf{x}||_{p}=0$当且仅当$\mathbf{x}=\mathbf{0}=(0,0,\ldots,0)$。换句话说,大小总是正的,仅当向量的所有元素都没有大小时才为零。
- 三角不等式:对于两个向量x, $\mathbf{y}\in\mathbb{R}^{N}$,则有$||\mathbf{x}+\mathbf{y}||_{p}\leq||\mathbf{x}||_{p}+||\mathbf{y}||_{p}.$。这有直观的解释:从A到B再到C的距离总是比直接从A到C的距离长。
表7.1 对主文中描述的两个向量应用不同p-范数值的比较(数值四舍五入到小数点后2位)
| p-范数 | $\mathbf{e}^{(1)}$ | $\mathbf{e}^{(2)}$ |
| 1 | 1.2 | 1.2 |
| 2 | 1.01 | 0.69 |
| ∞ | 1 | 0.4 |
$p$的选择决定了p-范数对不同误差分量的侧重,$p$值越大意味着范数越强调较大的误差分量。为了说明这一点,考虑两个误差向量$\mathbf{e}^{(1)}=(1,0.1,0.1)$和$\mathbf{e}^{(2)}=(0.4,0.4,0.4)$,它们由两个不同的三步超前预测模型产生。第一个模型有相对较大的峰值误差,而第二个模型没有这样的大误差,每个时间步的误差恒定。每个预测在三个不同$p$值的p-范数下的误差分数如表7.1所示。首先,注意到两个预测的绝对误差之和相等,因此k=1,2时$||\mathbf{e}^{(k)}||_{1}=1.2$。因此1-范数评估两个预测具有相同的误差。相反,∞-范数只关注最大值,因此对预测模型1和2分别给出1和0.4,但没有考虑其他误差的任何信息。选择介于这两个极端之间的$p$值将产生一个误差值,它包含所有误差值的贡献,但较大的值贡献更强,因为$p$值更大。在这个例子中,可以看到2-范数对$\mathbf{e}^{(1)}$产生的值与∞-范数相似,但对$\mathbf{e}^{(2)}$的值介于1-范数和∞-范数之间。因此2-范数包含了所有误差分量的贡献,但较大误差的贡献略大于1-范数。这个例子的要点是,误差度量的选择是所考虑应用的一个重要方面。
尽管误差测度的选择可能存在主观性,但在时间序列,特别是负荷预测中,仍有一些常用方法。单独的范数通常不适合作为误差测度,因为它们不会随问题规模缩放。误差的大小会随着序列长度增长,这妨碍了不同预测时域的比较。因此,它们通常与归一化结合使用。最常见的误差测度之一是平均绝对误差(MAE),使用1-范数定义为
$$\begin{aligned} \text {MAE}(\textbf{L}, \hat{\textbf{L}})=\frac{1}{h}||\textbf{L}-\hat{\textbf{L}}||_1 =\frac{1}{h}\sum _{k=1}^h |L_{n+k}-\hat{L}_{n+k}|. \end{aligned}\tag{7.46}$$
MAE给出了预测时域内所有时间点的平均绝对误差,$n+1,\ldots,n+h.\operatorname{A}$绝对误差测度的一个有用性质是,误差的单位通常与所考虑的数据相同,这简化了解释。
由于本节考虑的许多示例中数据将以能量单位(例如kWh)表示,误差也将采用相同的单位。
另一种也保留单位的常见误差测度是均方根误差(RMSE),它以2-范数定义为
$$\begin{aligned} \text {RMSE}(\textbf{L}, \hat{\textbf{L}})= \frac{1}{\sqrt{h}}||\textbf{L}-\hat{\textbf{L}}||_2= \sqrt{\frac{\sum _{k=1}^h (L_{n+k}-\hat{L}_{n+k})^2}{h}}. \end{aligned}\tag{7.47}$$
正如本节前面所见,误差测度上的幂次对于该测度关注何种类型的误差起着重要作用。幂次越高,测度对较大误差的关注度越高。因此,对于RMSE,较大的误差对总体评分的贡献相对大于MAE。如果你对评估哪种预测在准确估计极值(如需求峰值)方面更合适感兴趣,这一点可能很重要。
MAE和RMSE这类绝对型误差测度的一个缺点在于,当时间序列具有不同量级时,难以进行精度比较。例如,当日需求仅为2 kWh时,日前预测中1 kWh的误差相当显著,但对于日需求通常达到100 kWh或更高的变电站馈线来说,则可忽略不计。更准确地比较这些误差的方法可能是呈现相对于时间序列值大小的百分比误差。在这种情况下,1 kWh的误差对于日需求为2 kWh的变电站来说是总需求的50%,而对于日需求为100 kWh的变电站馈线则仅为1%。
评估点预测相对精度最常用的评分之一为平均绝对百分比误差(MAPE),定义为
$$\begin{aligned} \text {MAPE}(\textbf{L}, \hat{\textbf{L}})= \frac{100}{h}\sum _{k=1}^h\frac{|L_{n+k} - \hat{L}_{n+k}|}{|L_{n+k}|}. \end{aligned}\tag{7.48}$$
每个时间步的个体误差 $|L_{n+k}-\hat{L}_{n+k}|$ 除以绝对需求 $|L_{n+k}|$ 并取平均,得到相对评分。评分通常乘以100以提供百分比分数。MAPE不适用于具有零值或非常小值的序列,例如家庭级电力需求或具有大量本地发电的馈线。小的 $L_{k}$ 值会放大时间 $t_{k}$ 处的误差大小,掩盖预测的真实精度。当真值为零时 $L_{k}=0$,MAPE甚至没有定义。本书采用的一种替代方案是改用平均值 $\frac{1}{N}\sum L_{k}$ 作为分母。这被称为加权绝对百分比误差(WAPE)。同样的缩放也可以应用于RMSE和MAE以创建相对误差测度。以上是负荷预测中最常用的一些误差测度,但当然还有其他几种测度可以使用,包括那些避免除以零问题的测度。
直接比较预测之间的误差测度有助于评估预测精度,但如果底层时间序列具有不同水平的可预测性,则可能变得复杂。在第7.4节中讨论了技能评分,这对于通过利用共同基准来帮助解释来比较预测模型非常有用。
仔细选择适合预测应用或目的的误差测度非常重要。一个特例将在第13.3节中展示,该节介绍家庭级负荷预测。许多标准误差测度(包括这里介绍的那些)可能不适合提供客观评分来评估预测精度。相反,考虑了一种新颖的方法,表明没有必要将你的评估方法限制在最流行或最常见的测度(如RMSE或MAPE)上。
7.2 概率预测误差测度
上述评分仅适用于点预测,不适用于评估概率预测。由于概率预测的复杂性增加以及其可能采取的各种形式(分位数、密度、集合等,如第5.2节所述),这些预测的评估不太直接。本节将重点讨论单变量¹概率预测的评分。多元评分函数仅在行文中简要提及,但进一步阅读的建议可在附录D.2中找到。
概率预测的目标是准确表示变量的分布。由于每个时间步通常只有一个观测值,评估概率预测通常意味着将单个观测值与分布估计进行比较。这使得情况比点预测复杂得多,点预测可以将单个观测值与单个点估计值进行比较。理想的目标是使用一种评分函数,其最小值仅由真实分布实现,这类函数称为适当评分函数。
更为流行的适当评分函数之一是弹球损失分数或分位数分数,用于衡量分位数预测的准确性(第5.2节)。回想一下,分位数$\tau\in[0$,即CDF F的1,是满足$F(z_{\tau})=\tau$的值$z_{\tau}$,换句话说,对于单变量分布,随机变量小于$z_{\tau}$的概率为$\tau$(关于分位数的更多详细信息,另见第3.2节)。给定一个$\tau$分位数的估计值$z_{\tau}$以及来自被估计分布的实际观测值$L$,弹球损失函数定义为
$$L_{\tau}(L,z_{\tau})=\left\{\begin{array}{ll}\tau(L-z_{\tau})&L\geq z_{\tau}\\(1-\tau)(z_{\tau}-L)&L<z_{\tau}\end{array}\right.$$

弹球函数是一个非对称函数,它取观测值与分位数之差,并根据差值为正或负赋予不同的权重。这种不对称性很重要,因为准确估计的分位数平均将有比例为$\tau,$的观测值低于$z_{\tau}$。弹球函数及其权重如图7.1所示。通常,对预测时域内的每个时间步$k=1,\ldots,N$估计一系列分位数$z_{T_{k}}$,这些分位数将分布范围分割为均匀间隔的点$\tau_{1},\dots,\tau_{N}$(例如,常用的值是十分位数$0.1,0.2,\ldots,0.9,$或二十分位数$0.05,0.1,\hdots,0.9,0.95)$)。弹球损失分数(PLS)就是每个分位数上各个损失的平均值。
$$\begin{aligned} \text {PLS} = \frac{1}{N}\sum _{k=1}^N L_{\tau _k}(L,z_{\tau _k}). \end{aligned}\tag{7.49}$$
另一种常见的适当评分函数是连续等级概率评分(CRPS)。考虑一个累积分布$\hat{F}(z)$,它是某个有观测值的时间点的分布估计,定义为$L$。CRPS定义为
$$\begin{aligned} \text {CRPS}(L, \hat{F})= \int _{-\infty }^\infty (\hat{F}(z) -\textbf{1}(z-L))^2 dz = \mathbb {E}(|Z-L|)-\frac{1}{2}\mathbb {E}(|Z-\tilde{Z}|), \end{aligned}\tag{7.50}$$
其中1是Heaviside阶跃函数
$$\begin{aligned} \textbf{1}(x) = {\left\{ \begin{array}{ll} 0 &{} \text { for }x <0\\ 1 &{} \text { for }x \ge 0 \end{array}\right. }. \end{aligned}\tag{7.51}$$

第一种积分形式衡量估计分布$\hat{F}(z)$与单个观测值的经验累积分布函数(由$\textbf{1}(z-L)$给出)之间的差异。图7.2展示了单个观测值的CRPS与估计的CDF,它等于CDF与该观测值的经验分布(见第3.4节)之间的阴影区域。目标是使该阴影区域最小化,而通过准确估计真实分布可以实现这一目标。
注意,CRPS第二种形式中的两项描述了误差的两个组成部分。第一项E $(|Z-L|)$是观测值与预测值之间的(期望)绝对差值。第二项$\mathbb{E}(|Z-\tilde{Z}|)$是概率预测的离散程度(即锐度)的度量。对于点预测,CRPS仅简化为第一项,即平均绝对误差。方程(7.50)中CRPS的第二种等价形式$\mathbb{E}(|Z-L|)-\frac{1}{\gamma}\mathbb{E}(|Z-\tilde{Z}|)$提供了另一种估计CRPS的方法,即通过从估计分布$\hat{F}$生成随机抽取$\tilde{Z}$和$Z,$来计算样本均值。对于多个观测值,最终的CRPS就是各个CRPS值的平均值。
CRPS和弹球分数仅适用于单变量密度。对于集合/情景预测,方程(7.50)中给出的CRPS第二种形式可以调整以处理估计多元分布的集合预测。考虑一个为N维随机变量$\mathbf{X}=(X_{1},X_{2},\ldots,X_{N})^{T}$定义的多元概率分布$\mathbf{F}_{\mathbf{Z}}$。给定单个观测向量$\mathbf{L}=(L_{1},L_{2},\ldots,L_{N})^{T}$,则能量分数定义为
$$\begin{aligned} \text {ES}(\textbf{L}, \textbf{F}) = \mathbb {E}(||\textbf{Z}-\textbf{L}||_2)-\frac{1}{2}\mathbb {E}(||\textbf{Z}-\tilde{\textbf{Z}}||_2), \end{aligned}\tag{7.52}$$
其中$\mathbf{Z}$和$\tilde{\mathbf{Z}}$是来自多元分布的随机抽取/样本的独立副本。实际计算时,从生成的预测集合中取样本Z和$\tilde{\mathbf{Z}},$,并使用样本均值估计期望值。对于弹球分数、CRPS和能量分数,值越小表示概率预测越准确。

概率预测也可以进行目视评估。考虑一个连续随机变量 X 的 CDF,F,那么数据的概率积分变换(PIT)定义为将 CDF 应用于观测值 $p_{t}=F(X_{t})$。如果选择了正确的 CDF,PIT 的直方图应呈均匀分布。为了理解这一点,考虑一个分位数预测,它估计了半分位数,即连续累积密度函数 $F(x)$ 的 $q$ 分位数,其中 $q=0.05,0.1,0.15,\ldots,0.9,0.95$。如果预测校准正确,则应有 5% 的观测值落在任意连续分位数 $F^{-1}(q)$ 之间,且 $F^{-1}(q+$ 0.05)。换句话说,由该分位数估计定义的 PIT 直方图应为均匀的,每个区间内包含 5% 的观测值。
图 7.3 展示了三个不同的高斯 CDF(具有不同标准差)应用于来自其中一个分布的随机样本时的 PIT 直方图示例。当使用真实 CDF 时(图左侧),直方图如预期呈均匀分布。当使用标准差大于真实数据的高斯 CDF 时,PIT 直方图中心观测值过多,这种分布称为过度分散(中间图)。相反,如果使用展宽较小(标准差较小)的高斯 CDF 进行 PIT,则直方图边缘观测值过多,这种分布称为欠分散。PIT 的其他形状可能表明概率估计中存在其他偏差或不准确性。
一种等效的可视化概率预测质量的方法是可靠性图(或可靠性图)。具体而言,将概率预测的分位数与观测相对频率进行绘制。换句话说,取 τ 分位数 $F^{-1}(\tau)$,对于具有 CDF $F$ 的概率预测,假设有观测值 $y_{1},y_{2},\ldots,y_{N}$。这些点可用于定义经验分布函数 $F_{E}(y)$,它是一个阶梯函数,定义为:

$$\begin{aligned} \hat{F}_E(y) = \frac{\text {number observations less than } X}{N}=\frac{1}{N}\sum _{k=1}^N \textbf{1}_{y_k<y}, \end{aligned}\tag{7.53}$$
其中 $\mathbf{1}_{S}$ 是指示函数,如果陈述 S 为真则取值为 1,否则为 0(另参见第 3.4 节)。可靠性图就是将估计分布 F 的分位数与经验分布 $F_{E}$ 进行比较。如果估计 F 能准确表示观测值的分布(由经验 CDF $F_{E})$ 估计),则分位数应相似(对于相同的概率值 $\tau)$)。图 7.4 显示了与图 7.3 相同分布的可靠性图。该图基于来自真实正态分布(均值为 2,标准差为 0.25)的 1000 个观测值。注意,在可靠性图中,如果观测值来自真实分布,它们应接近对角线 $y=x$。相比之下,过度分散分布的线在代表性不足的尾部量化线上梯度小,而在中间过度代表的量化线上梯度大。欠分散分布则相反,其尾部量化线具有高梯度,而中间量化线梯度较低。
值得注意的是,均匀的 PIT(或等价的落在 $y=x$ 线上的可靠性图)只是分布是数据真实潜在分布的必要条件,而非充分条件。换句话说,即使估计的分布不是潜在分布的真实表示,仍可能出现均匀的 PIT。
7.3 预测误差的原因
无论模型多么复杂,预测中总会存在一些误差。然而,值得简要提及一些常见的预测误差原因,以避免过早下结论,并有助于解释模型及其误差。
即使生成了具有低偏差和低方差的准确模型,预测误差也可能随着预测期长度的增加而增大,如图 7.5 所示。这是因为时间上接近的值之间通常存在相互依赖性。这在能源需求行为中尤为明显,例如电器使用数小时(如加热器),或类似动作同时进行(如早上淋浴后烧水泡茶)。因此,如果比较预测明天、后天等的误差,预测误差/评分预计会呈上升趋势。
然而,事情可能并非如此简单。在第 14 章的案例研究中,预测误差在一天内变化(尤其见图 14.7)。这是因为在一天中的某些时间段,需求变化更大(因此平均误差也更大),而其他时间段则较小。然而,即使在这种情况下,日平均误差似乎也在增加。这凸显了预测误差的另一个来源,即特定时段的波动性。
预测误差的另一个来源可能是它们对输入变量的依赖性。许多负荷预测与天气密切相关(例如,参见第 6.7 节),因此天气预测被用于负荷预测模型中。然而,如果这些输入不准确(例如由于测量、预测甚至校准误差),那么负荷预测也会不准确。换句话说,对于数据中令人惊讶或异常的误差,也应考虑输入变量作为可能的原因。

基准模型在确定预测误差原因方面也很有用。由于它们可能包含与主模型不同的输入,因此可以确认哪些变量可能是大误差的来源。即使底层数据发生变化,基准模型也有助于比较模型并理解随时间改进的情况。下一节将对此进行探讨。
7.4 技能评分
即使误差度量适用于应用,比较或评估预测也可能并不容易,尤其是在多个数据集上比较时。例如,考虑两个预测模型,一个模型对某个数据集产生估计值,另一个模型对另一个数据集产生估计值。如果这些数据集具有不同的波动性(例如,可能是不同季节的数据,比如取暖设备可能使冬季需求行为波动更大),那么如何比较这些预测的准确性就不清楚了。类似地,如何跟踪同一预测随时间推移(将使用更多和/或更新的数据)的改进(或退化)?
在上述及其他情况下,帮助区分预测的一种方法是使用技能评分。技能评分衡量预测相对于某个基准评分的准确性。它们在数值天气预报应用中非常常见,用于显示预测模型随时间的改进。
技能评分可以有多种形式,但常见格式是
$$\begin{aligned} SS(\hat{\textbf{L}}, \textbf{L}_b) = \frac{E_f - E_b}{E_p - E_b}, \end{aligned}\tag{7.54}$$
其中 $E_{f},E_{b},E_{p}$ 分别代表主预测、基准预测和完美预测的误差评分。误差度量可以是前面提到的任何一种,例如点预测的 RMSE 或 MAE,或概率预测的 CRPS。
通常,完美预测的误差应为零,在这种情况下,技能评分简化为
$$\begin{aligned} SS(\hat{\textbf{L}}, \textbf{L}_b) = 1- \frac{E_f}{ E_b}. \end{aligned}\tag{7.55}$$
如果预测完美 $(E_{f}=0)$,技能评分可达到最大值1,但如果仅与基准模型相当,则等于0,当然如果预测比基准模型更差,评分可以负数。
这里的基准通常称为标准预测或参考预测,但重要的是该方法保持不变,以便进行更恰当的比较。由于基准方法保持不变,这样可以跨不同数据集以及同一数据集的不同时期对预测进行比较分析。如果两个数据集具有非常不同的“可预测性”,则可以通过技能评分更好地比较它们上的性能,因为预测误差在较不可预测的数据集上会按共同基准进行缩放,而该基准在该数据集上的表现也会相对较差。因此,数据集上的相对性能可以更容易地比较,而不仅仅取决于测试数据集的特征所带来的坏运气。
那么,创建技能评分时的主要问题是,使用什么合适的基准?以下是一些建议标准:
- 基准应相当简单,不需要太多数据或额外的数据集来生成。这使得该模型在大多数情况下都能使用。
- 基准应易于实现,以便其他预测者可以轻松复制。
- 它应易于解释,以助于模型评估和改进。
- 它不应过于复杂或是最先进的。它仅用于比较,因此无需复杂或“难以超越”的模型。
对于许多应用,第9章描述的简单基准模型就足够了。持续模型很常见。关于选择合适基准的其他考虑见8.1.1节。
7.5 残差检查与预测校正
理想情况下,预测是真实负荷的良好估计,但出于各种原因可能需要一些校正。气候建模中常见的是模型偏差,即预测的均值(或期望值)持续偏离实际值。分析最终预测模型的残差是评估模型并识别未来实现中可能改进的常用方法。
无论为时间序列预测创建何种模型,残差中仍可能存在某些结构,可加以利用以进一步提高预测精度。假设为训练数据时间步 t=1,...,N 上的时间序列 $L_{t}$ 生成了一个预测模型。令 $\hat{L}_{t}$ 表示拟合到训练数据的预测估计值,回顾第5.2节,残差时间序列可定义为 $\boldsymbol{r}_{t}=L_{t}-\boldsymbol{\hat{L}}_{\iota}$_t,其中 $t=1,\dots N$。预测模型的一个理想特性是残差序列本质上是随机噪声,因为任何剩余的模式/关系都可用于改进预测。
首先应绘制残差时间序列图,观察是否还有任何剩余模式或特征。如果模型正确解释了数据,则残差序列应为随机噪声²,换句话说,它们的值是独立同分布的,均值为零。

如果两个随机变量 X 和 Y 独立,则意味着(不足为奇)一个变量的值与另一个变量的值无关。用概率语言来说,这意味着对所有 x, y,事件 $X\leq x$ 和 $Y\le y$ 是独立的。换句话说,X, Y 的联合分布 $F_{X,Y}(x,y)$ 与各自的分布通过以下关系关联:
$$\begin{aligned} F_{X,Y}(x, y) = F_X(x)F_Y(y), \end{aligned}\tag{7.56}$$
其中 $F_{X}$ 和 $F_{Y}$ 分别是 X 和 Y 的累积分布函数(见第3.3节)。对于独立变量,值之间的相关性为零。然而,反过来不一定成立,零相关并不意味着独立。但它可以作为独立的证据,或至少增加它们独立的可能性。
通常很容易判断数据不是白噪声,但验证其是否为白噪声并不简单。时间序列图应能初步指示哪种情况可能成立。图7.6展示了一些残差时间序列的示例。在此例中,所有时间步的值具有相同的方差,因此唯一需要检查的是它们是否均值为零且独立。
在图7.6中,有两个看起来像白噪声,一个明显不是白噪声。上图是白噪声,中图是原始白噪声序列但增加了递增趋势。下图看起来像是白噪声,但实际上是通过重复上图的一段100个数据点形成的。因此,它实际上具有很强的自相关性,尽管并不直接明显。
该序列的自回归特征可以通过查看自相关图来确认(正如在第9.4节创建ARIMA模型时那样)。在这种情况下,周期性时间序列没有独立的成分,如图7.7中滞后100处的尖峰所示。ACF图显示,真正的白噪声序列如预期一样没有自相关,但中间带有趋势的噪声则通过ACF随滞后缓慢衰减而显现出来。

残差中残留的任何自相关可以通过向残差序列添加额外的自回归分量(或者添加到原始模型中)来消除,通过
$$\begin{aligned} r_k = \sum _{k=1}^{p_{\max }} \phi _k r_{t-k} + \epsilon _t \end{aligned}\tag{7.57}$$
基于某种假设的高斯误差$\epsilon_{t}$和最优自回归阶数$p$(通过最小化Akaike信息准则(AIC)或Bayesian信息准则(BIC)在$p\in\{0,\ldots,p_{\max}\}$上求得,最大阶数为$p_{\max}$)。在训练系数$\phi_{1},\ldots,\phi_{\max},\mathrm{a}$后,可以通过$\hat{r}_{k}=\sum_{k=1}^{p_{\max}}\phi_{k}r_{t-k}$生成残差的预测,并通过$\hat{L}_{t}+\hat{r}_{t}$更新原始预测,从而得到负荷序列的新预测。如果更新后的模型中包含了足够的滞后项,新的残差序列$\tilde{r}_{t}=L_{t}-\hat{L}_{t}-\hat{r}_{t}$应该不再具有显著的自相关。此外,希望新模型能提高预测精度。当然,可以对新的预测再次进行残差自相关检验,如果并非所有自回归特征都已被考虑,则重复该过程。
时间序列预测中另一种形式的偏差是残差是否以零为中心。带有趋势的随机噪声就是这样一个例子。最简单的偏差形式是噪声以非零常数为均值。这表明可以通过将残差平移其样本均值来应用简单的偏差校正,从而将平均误差减小到零。即设置$\hat{r}_{t}=r_{t}+b$,其中$b=-\overset{\underset{\sum_{t=1}^{N}r_{t}}{\sum_{t=1}^{N}r_{t}}}{N}\in\mathbb{R}$。或者,可以直接更新预测本身,即
$$\begin{aligned} \hat{\hat{L}}_t = \hat{L}_t + b. \end{aligned}\tag{7.58}$$
因此,根据定义,新的残差序列样本均值为零。具有线性趋势的残差时间序列也可以通过类似方式校正,只是需要通过点的最佳拟合线进行去趋势处理(类似于第6.1.1节中的异常检测)。更一般地,当趋势明显时,可以应用类似的去趋势方法。
特定模型也可能对残差分布有假设。例如,线性回归和ARIMA模型假设高斯分布。如果残差分布不对称,则可能需要对数据进行变换(第6.1.3节)。此外,残差的非恒定方差表明假设固定方差的方法可能不适用。相反,可能需要采用替代方法,如第11.6.2节介绍的GARCH类型模型。
通常,应用预测校正和检查独立性并不简单。如上所述,首先应考虑残差的时间序列图,然后可以通过在残差时间序列的固定区间上计算均值与方差,并将其与全样本的均值与方差进行比较,来检查恒定均值与方差。最后,应绘制自相关函数和偏自相关函数,以检查移动平均和自回归分量,并识别时间序列中各点之间的依赖性。
上述方法主要关注点估计。然而,对于概率预测,也存在可应用的校正方法,但通常比点预测校正更复杂。回忆第7.2节中的一个简单案例,概率预测应具有均匀的概率积分变换,但如果情况并非如此,则PIT也可以提示可能的校正方法。例如,如第7.2节所示,过度分散(或欠分散)的预测产生的PIT分布比期望的更宽(或更窄),这意味着可以通过压缩(或拉伸,对于欠分散估计)分布来改进模型。更一般地,我们可以查看PIT以了解分布的哪些区域被过度或不足表示。还有更复杂的校准方法,如分位数映射,传统上应用于气候和天气建模,这些领域的进一步阅读见附录D。
7.6 习题
对于需要使用真实需求数据的问题,尝试使用附录D.4中列出的一些数据。
- 从真实需求时间序列中取几天数据,通过将负荷曲线平移一整天来创建基本预测。计算MAPE、MAE和RMSE。比较它们。取一百个智能电表时间序列,基于相同的季节持久性预测模型计算误差。绘制误差与需求大小(例如平均半小时或日需求)的散点图。你在图中是否注意到某种模式?如果将负荷曲线的时间序列与预测结果绘制在一起,能否识别出那些精度最好和最差的误差来源?
- 以一个傍晚出现高峰的半小时间歇性家庭负荷曲线为例。获取一天的数据,将曲线向一个方向平移一小时(将超出末尾的平移点加到另一侧)。然后计算两者之间的RMSE误差。接下来,通过取半小时间隔的平均值,并将当天所有半小时间隔设置为该平均值,生成一条平坦曲线。计算该平坦曲线与原始曲线之间的RMSE。比较两个误差值。哪个更小?尝试其他几种预测。在某些情况下,平坦曲线产生的误差是否比平移曲线更小?这将在第13.3节中进一步探讨。
- 从单变量高斯分布中采样5000个点。选择分位数0.05、0.1、0.15、…、0.95并绘制PIT图。每个分位数范围内应包含多少个点?现在从分布中间五个分位数中删除5–10个点。再次绘制PIT图,形状如何变化?是欠分散还是过分散?重复实验,但从分布的尾部移除值。重新绘制PIT图,检查形状是欠分散还是过分散。现在为所有三个样本绘制可靠性图(这需要计算每个样本的经验分位数)。
- 从你选择的单变量分布中采样1000个点。通过删除相同数量的点(例如10%),从这些样本中创建三个经验分布:(a) 随机删除,(b) 从分布中心删除,(c) 从样本尾部删除。使用这些样本计算分位数,这些分位数将定义你的概率估计。计算这三个分布在原始样本上的弹球损失得分。对CRPS重复计算。哪个得分最好(最低)?
- 考虑随预测期变化的预测误差。获取一些半小时间隔或每小时的负荷数据。通过将一天的日负荷曲线重复未来十四天,生成未来两周的简单预测。计算每天的RMSE误差。它如何随预测期变化?用其他时间序列重复此操作,并观察随预测期的变化。它是随着提前天数平滑变化,还是取决于星期几?
7.6 习题
- 采用上一题中使用的预测。生成残差时间序列。绘制自相关图和偏自相关图。哪些滞后期产生的系数值最大?因此,在对此模型进行自回归更新时,你预计需要修正多少个滞后期?如果你知道如何应用线性回归,尝试将这些项添加到你的模型中,并再次进行预测。误差如何变化?如果你不知道如何应用,可以等到读完第9章后再回来回答这部分问题!
除非在材料的致谢行中另有说明,本章中的图像或其他第三方材料均包含在本章的知识共享许可中。如果材料未包含在本章的知识共享许可中,且您的预期使用不被法定法规允许或超出允许使用范围,您将需要直接获得版权持有人的许可。