金融风险管理

realhuhu 247 0

金融数据性质

单变量

定义

  1. 收益序列
    • 金融数据实证分析通常研究收益而不是价格水平。设价格、指数或汇率序列为 S_0,S_1,\ldots,S_n,单期对数收益定义为
      X_t = \ln\left(\frac{S_t}{S_{t-1}}\right), \qquad t=1,\ldots,n.
    • 对数收益的好处是可以加总。h 期对数收益为
      X_t^{(h)} = \ln\left(\frac{S_t}{S_{t-h}}\right) = \sum_{j=0}^{h-1}X_{t-j}.
    • 因此日收益、周收益、月收益可以放在同一套记号下讨论。
  2. 数据频率
    • 本章讨论的典型事实主要适用于日、周、月等风险管理常用频率。
    • 日收益样本量较多,最常用于识别波动率聚集、厚尾和极端事件成簇。
    • 收益间隔变长后,分布可能更接近正态,但样本量减少,检验能力也会下降。
    • 极高频数据会受到买卖价差、非同步交易、价格离散等市场微观结构噪声影响,不能直接套用日收益结论。
  3. 分析目的
    • 典型事实是金融收益数据反复表现出的经验规律,用来约束后续建模。
    • 如果模型不能解释收益弱相关、波动率聚集、厚尾、极端事件成簇和多资产共同极端,就很难用于可靠风险管理。

典型事实

  1. 事实一:收益不是 iid,但原始收益线性相关弱
    • 现象
      X_1,\ldots,X_n 是 iid,则每期收益来自同一分布,并且不同时间点之间独立。真实金融收益通常不满足 iid,但原始收益 X_t 的线性自相关往往较弱。
      这表示收益方向通常不容易由过去收益线性预测。
    • 检验
      先看原始收益的样本自相关函数
      \hat\rho(h) = \frac{\hat\gamma(h)}{\hat\gamma(0)}.
      如果原始收益线性相关弱,则非零滞后的 \hat\rho(h) 应接近 0
      也可以用 Ljung-Box 检验联合检验前 m 阶自相关:
      Q(m) = n(n+2) \sum_{k=1}^{m} \frac{\hat\rho_k^2}{n-k}.
    • 含义
      原始收益线性相关弱,只说明均值方程可能较简单,不说明收益序列 iid。
      因为 iid 还要求绝对收益、平方收益和极端事件都没有时间依赖。
  2. 事实二:绝对收益和平方收益存在显著序列相关
    • 现象
      金融收益的方向可能难预测,但收益幅度通常有持续性。常见情况是
      \operatorname{corr}(X_t,X_{t-h})\approx0,

      \operatorname{corr}(|X_t|,|X_{t-h}|)\gt0

      \operatorname{corr}(X_t^2,X_{t-h}^2)\gt0.
    • 检验
      |X_t|X_t^2 画相关图,看收益幅度是否有持续性。
      |X_t|X_t^2 做 Ljung-Box 检验,如果 p 值很小,则说明收益幅度存在显著序列相关。
    • 含义
      这一事实说明常方差模型不合适。更合理的写法是允许条件方差随过去信息变化:
      \operatorname{var}(X_t\mid\mathcal F_{t-1}) = \sigma_t^2.
      这正是 ARCH/GARCH 模型的经验基础。
  3. 事实三:条件期望收益接近于零
    • 现象
      对日度等短期收益,均值相对于波动率通常很小,常近似认为
      E(X_t\mid\mathcal F_{t-1})\approx0.
      这不是说长期风险溢价不存在,而是说短期均值信号弱,容易被噪声掩盖。
    • 检验
      可以检验样本均值是否显著偏离零。
      也可以拟合低阶 ARMA 均值方程,检查自回归项和移动平均项是否显著。
      原始收益的相关图和 Ljung-Box 检验也可以作为均值动态是否明显的证据。
    • 含义
      短期收益建模常写为
      X_t=\mu_t+\varepsilon_t,
      其中 \mu_t 可以很简单,重点放在残差冲击
      \varepsilon_t=X_t-\mu_t
      的波动率和尾部上。
  4. 事实四:波动率随时间变化并且聚集
    • 现象
      波动率聚集指大波动之后更容易继续出现大波动,小波动之后更容易继续出现小波动。
      大涨或大跌都会提高后续短期内的波动水平,但不决定下一期收益符号。
    • 检验
      图形上可以直接看收益序列是否有连续高波动区间。
      统计上可以检查 |X_t|X_t^2 的自相关。
      也可以做条件异方差检验,核心是看过去平方冲击是否能解释当前波动强度。
    • 含义
      波动率聚集说明无条件分布不能代表每个时点的风险。
      风险度量应基于条件分布
      F_{X_{t+1}\mid\mathcal F_t}.
      因此同一资产在不同市场状态下应有不同的 VaR 和 ES。
  5. 事实五:极端收益会成簇出现
    • 现象
      极端收益不是均匀分散在样本期内,而是常集中在高波动或市场压力阶段。
      一个大损失之后,短期内继续出现大损失的概率往往升高。
    • 检验
      选取最大损失或最大绝对收益,记录它们发生的时间位置。
      令相邻极端事件之间的时间差为等待时间。如果极端事件近似独立到达,可用泊松过程近似,等待时间应接近指数分布。
      若出现过多短等待时间,说明极端事件密集发生;若同时有过多长等待时间,说明也存在长时间平静期。
    • 含义
      厚尾分布可以解释极端值大小,但不能自动解释极端值成簇。
      iid Student-t 分布可以生成大值,但仍缺少真实金融数据中的高波动持续阶段。
      所以风险模型需要同时处理厚尾和条件波动率变化。
  6. 事实六:收益分布尖峰厚尾而非正态
    • 现象
      金融收益相对于正态分布,通常中心附近概率更高,两端尾部概率也更高。
      这种形态称为尖峰厚尾。厚尾意味着极端损失概率高于正态模型预测。
    • 检验:Q-Q 图
      Q-Q 图比较样本经验分位数和参考分布理论分位数。
      若标准化收益来自正态分布,点应大致落在直线附近。
      若左尾点明显低于参考线、右尾点明显高于参考线,则说明尾部比正态更厚。
    • 检验:偏度和峰度
      样本偏度为
      b = \frac{ \frac{1}{n}\sum_{i=1}^{n}(X_i-\bar X)^3 } { \left( \frac{1}{n}\sum_{i=1}^{n}(X_i-\bar X)^2 \right)^{\frac{3}{2}} }.
      样本峰度为
      k = \frac{ \frac{1}{n}\sum_{i=1}^{n}(X_i-\bar X)^4 } { \left( \frac{1}{n}\sum_{i=1}^{n}(X_i-\bar X)^2 \right)^2 }.
      正态分布满足
      \beta=0, \qquad \kappa=3.
      金融收益常见问题是样本峰度明显大于 3
    • 检验:Jarque-Bera 检验
      Jarque-Bera 统计量为
      T = \frac{n}{6} \left[ b^2+\frac{1}{4}(k-3)^2 \right].
      在正态性原假设下,大样本中
      T\overset{a}{\sim}\chi^2(2).
    • 含义
      用正态分布估计 VaR 和 ES 往往会低估尾部风险。
      更合理的选择包括 Student-t 分布、偏态厚尾分布、广义误差分布,或极值理论方法。
  7. 补充:长间隔收益的处理会影响推断
    • 构造
      h 期对数收益为
      X_t^{(h)} = \sum_{j=0}^{h-1}X_{t-j}.
    • 非重叠收益
      非重叠样本为
      \{X_t^{(h)}:t=h,2h,\ldots,\lfloor n/h\rfloor h\}.
      其中
      \lfloor x\rfloor = \max\{k\in\mathbb Z:k\le x\}.
      它减少机械重叠,但样本量下降到约 \lfloor n/h\rfloor
    • 重叠收益
      给定步长 k,其中 1\le k\lt h,重叠样本为
      \{X_t^{(h)}:t=h,h+k,\ldots,h+\lfloor(n-h)/k\rfloor k\}.
      样本数量为
      1+\lfloor(n-h)/k\rfloor.
      相邻两个 h 期收益共享 h-k 个短期收益,因此不能当作独立样本。

多变量

定义

  1. 记号
    • 设第 td 维收益向量为
      \boldsymbol{X}_t = (X_{t,1},\ldots,X_{t,d})^{\top}.
    • 样本为
      \boldsymbol{X}_1,\ldots,\boldsymbol{X}_n.
    • 多变量典型事实关注不同风险因子之间的相依结构,而不只是每个变量自身的边缘分布。

典型事实

  1. M1:收益之间主要存在同期相关
    • 现象
      多个资产同一天收益可能明显相关,因为它们受到共同市场因子影响。
      但跨期线性相关通常较弱,例如
      \operatorname{corr}(X_{t,i},X_{t-h,j})
      往往不如同期相关显著。
    • 检验
      可以估计同期样本相关矩阵
      \hat{\boldsymbol{R}} = (\hat\rho_{ij})_{d\times d}.
      也可以检查跨相关函数,比较不同滞后 h 下的相关性。
    • 含义
      多资产收益建模不能忽略同期相关,但静态相关矩阵不能解释动态相关和尾部共同损失。
  2. M2:绝对收益存在跨序列相关
    • 现象
      不同资产收益方向之间的滞后相关可能弱,但收益幅度会共同持续。
      也就是说,不同资产会共同进入高波动或低波动状态。
    • 检验
      可以考察
      \operatorname{corr}(|X_{t,i}|,|X_{t-h,j}|)

      \operatorname{corr}(X_{t,i}^2,X_{t-h,j}^2).
      若这些相关在多个滞后阶数上显著,说明波动状态在资产之间共同持续。
    • 含义
      组合风险在高波动时期会被同时放大。
      单独给每个资产建 GARCH 不够,还要描述不同资产波动率之间的联动。
  3. M3:相关性会随时间变化
    • 现象
      不同资产之间的同期相关不是固定常数。平静时期相关可能较低,市场压力时期相关可能升高。
    • 检验:滚动相关
      给定窗口长度 m,两个收益序列 X_tY_t 的滚动相关为
      \hat\rho_t = \frac{ \sum_{i=t-m+1}^{t}(X_i-\bar X_t)(Y_i-\bar Y_t) } { \sqrt{\sum_{i=t-m+1}^{t}(X_i-\bar X_t)^2} \sqrt{\sum_{i=t-m+1}^{t}(Y_i-\bar Y_t)^2} }.
      滚动相关只是探索性工具,因为即使真实相关固定,有限窗口估计也会波动。
    • 检验:Fisher 变换与模型比较
      对相关估计 r,Fisher 变换为
      z = \frac{1}{2} \ln\left(\frac{1+r}{1-r}\right).
      该变换便于做回归或近似正态推断。
      但相关估计和波动估计显著相关,不一定证明真实相关随波动上升,因为估计误差本身也可能产生这种关系。
      更正式的做法是比较固定相关模型、状态切换相关模型和动态条件相关模型。
    • 含义
      若相关确实随时间变化,组合分散化效果也会随市场状态变化。
      风险模型需要允许相关矩阵动态更新,或者至少区分平静状态和压力状态。
  4. M4:极端收益会共同发生
    • 现象
      多个资产的大幅损失往往会在同一时期共同出现。
      在市场压力下,资产之间的共同下跌概率明显升高。
    • 检验
      对损失变量,可以设高分位阈值 u_i,u_j,考察共同超越概率
      P(X_i\gt u_i,\ X_j\gt u_j).
      也可以考察条件尾部概率
      P(X_j\gt u_j\mid X_i\gt u_i).
      若使用收益变量,极端亏损通常在左尾,需要用低分位阈值,或先取负转成损失变量。
    • 含义
      压力时期相关变高和尾部依赖不是同一件事。
      少数极端点不能证明条件相关等于一,但能提示共同尾部损失很重要。
      对组合风险而言,尾部依赖会削弱分散化效果,使 VaR 和 ES 在危机时期显著上升。
  5. 多变量建模要求
    • 边缘层面要处理厚尾、偏态和单变量波动率变化。
    • 时间层面要处理波动率聚集和极端事件成簇。
    • 相依层面要处理同期相关、共同高波动、动态相关和共同极端损失。
    • 因此只匹配均值、方差和普通相关系数是不够的,后续需要时间序列模型、多元模型、Copula 和尾部依赖工具。

金融时间序列

时间序列基础

随机过程定义

  1. 时间序列
    • 单一风险因子、收益率或损失序列可以写成
      (X_t)_{t\in\mathbb Z}.
      这里 t 表示离散时间,X_t 表示时刻 t 的随机变量,整个序列定义在同一概率空间
      (\Omega,\mathcal F,P).
    • 时间序列建模不是只关心单个 X_t 的分布,而是关心不同时间点之间的联合行为。因此核心问题包括:
      均值是否随时间变化;
      方差是否随时间变化;
      不同时间点是否相关;
      极端波动是否会在时间上聚集。
  2. 时间序列的描述
    • 均值函数
      \mu(t)=E(X_t),\qquad t\in\mathbb Z.
      样本均值为
      \bar X = \frac{1}{n}\sum_{t=1}^{n}X_t.
    • 自协方差函数
      \gamma(t,s) = E\left[(X_t-\mu(t))(X_s-\mu(s))\right], \qquad t,s\in\mathbb Z.
      自协方差基本性质
      \gamma(t,s)=\gamma(s,t), \qquad \gamma(t,t)=\operatorname{var}(X_t).
      \gamma(t,s) 越大,说明 X_tX_s 的线性共同变化越强。
      样本自协方差为
      \hat\gamma(h) = \frac{1}{n} \sum_{t=1}^{n-h} (X_{t+h}-\bar X)(X_t-\bar X), \qquad 0\le h\lt n.
    • 自相关函数
      \rho(h) = \frac{\gamma(h)}{\gamma(0)}, \qquad h\in\mathbb Z.
      其中 \gamma(0)=\operatorname{var}(X_t),所以 \rho(h) 描述的是相隔 h 期的线性相关强度。
      研究 \rho(h) 和样本自相关图属于时间域分析。它主要回答:过去的收益或损失能否线性解释现在的收益或损失。
      样本自相关函数为
      \hat\rho(h) = \frac{\hat\gamma(h)}{\hat\gamma(0)}.
  3. 平稳性
    • 严平稳
      要求整个联合分布在时间平移下不变。若对任意 n、任意时间点 t_1,\ldots,t_n 和任意整数平移 k,都有
      (X_{t_1},\ldots,X_{t_n}) \stackrel{d}{=} (X_{t_1+k},\ldots,X_{t_n+k}),
      则称 (X_t) 是严格平稳的。
      严格平稳控制的是所有有限维联合分布,因此它不仅要求均值和方差稳定,也要求更高阶分布特征稳定
    • 宽平稳
      协方差平稳也称弱平稳或二阶平稳,只要求前两阶矩稳定,要求
      \mu(t)=\mu,\qquad t\in\mathbb Z,
      并且
      \gamma(t,s)=\gamma(t+k,s+k), \qquad t,s,k\in\mathbb Z.
      这意味着均值不随时间变化,协方差只取决于两个时间点之间的间隔。因此可以把自协方差写成一元函数
      \gamma(h):=\gamma(t,t-h), \qquad h\in\mathbb Z.
      其中 h 称为滞后阶数

特殊随机过程

  1. 白噪声
    • 表示没有线性序列相关的平稳过程,若 (X_t) 协方差平稳,且
      \rho(h)= \begin{cases} 1, & h=0,\\ 0, & h\ne0, \end{cases}
      则称 (X_t) 为白噪声过程。
    • 均值为 0、方差为 \sigma^2 的白噪声记为
      WN(0,\sigma^2).
    • 白噪声只排除了线性相关,不排除非线性相依。
      因此收益序列本身可能像白噪声,但平方收益或绝对收益仍可能存在明显相关。
  2. 严格白噪声
    • 独立同分布的白噪声称为严格白噪声,均值为 0、方差为 \sigma^2 的严格白噪声记为
      SWN(0,\sigma^2).
    • 白噪声只要求不同期不相关,严格白噪声还要求独立。
  3. 鞅差分序列
    • 鞅差分序列是对鞅的一阶差分,若 E|X_t|\lt\inftyX_t\mathcal F_t 可测,并且
      E(X_t\mid\mathcal F_{t-1})=0, \qquad t\in\mathbb Z,
      则称 (X_t) 是相对于 (\mathcal F_t) 的鞅差分序列,由条件期望迭代律可得无条件均值也为零:
      E(X_t) = E\{E(X_t\mid\mathcal F_{t-1})\} = 0.
      若进一步方差不随 t 变化,则它也是白噪声。
    • 鞅可以代表价格,鞅差分可以代表收益。鞅差分解释了金融收益中“均值难预测、波动可预测”的现象
      E(X_t^2)\lt\infty,鞅差分在不同时间点之间不相关
      \operatorname{cov}(X_t,X_s)=0, \qquad t\ne s.
      但鞅差分并不要求独立,也不要求条件方差为常数。此时收益均值不可预测
      E(X_t\mid\mathcal F_{t-1})=0
      方差随时间变化,风险大小可预测
      \operatorname{var}(X_t\mid\mathcal F_{t-1})=\sigma_t^2
      这正是 ARCH/GARCH 模型的入口。

时间序列分析

  1. ARMA 模型
    • (\varepsilon_t) 为白噪声WN(0,\sigma_\varepsilon^2),零均值 ARMA(p,q) 过程满足
      X_t-\phi_1X_{t-1}-\cdots-\phi_pX_{t-p} = \varepsilon_t+\theta_1\varepsilon_{t-1}+\cdots+\theta_q\varepsilon_{t-q}.
    • 若过程均值为 \mu,则中心化序列 X_t-\mu 满足零均值 ARMA 结构,常写成
      X_t = \mu_t+\varepsilon_t,
      其中\mu_t 是给定过去信息后的条件均值,\varepsilon_t 是新的创新项
      \mu_t = \mu+\sum_{i=1}^{p}\phi_i(X_{t-i}-\mu) + \sum_{j=1}^{q}\theta_j\varepsilon_{t-j}.
  2. 因果性
    • 因果 ARMA 过程可以写成
      X_t-\mu = \sum_{i=0}^{\infty}\psi_i\varepsilon_{t-i}.
      系数通常要求绝对可和
      \sum_{i=0}^{\infty}|\psi_i|\lt\infty.
      这个条件保证远期冲击影响逐渐衰减,也保证过程有良好的二阶性质。
    • 若定义自回归多项式
      \phi(z)=1-\phi_1z-\cdots-\phi_pz^p,
      则常用的因果性条件是 \phi(z) 在单位圆内没有根
    • 此时,自相关系数为
      \gamma(h) = \sigma_\varepsilon^2 \sum_{i=0}^{\infty}\psi_i\psi_{i+|h|}.
      方差为
      \operatorname{var}(X_t) = \sigma_\varepsilon^2 \sum_{i=0}^{\infty}\psi_i^2.
      自相关函数
      \rho(h) = \frac{\sum_{i=0}^{\infty}\psi_i\psi_{i+|h|}} {\sum_{i=0}^{\infty}\psi_i^2}.
      这说明 ARMA 的相关结构由 \psi_i 的衰减方式决定
  3. 可逆性
    • 可逆性要求移动平均部分不是把不同创新序列映射成同一个观测序列。直观上,它保证
      \varepsilon_t
      可以由当前和过去的 X_s 表示。
    • 对 ARMA(1,1),若
      |\theta_1|\lt 1,
      则可以得到 AR(\infty) 表示
      X_t = \varepsilon_t + (\phi_1+\theta_1) \sum_{i=1}^{\infty}(-\theta_1)^{i-1}X_{t-i}.
    • 对一般 ARMA(p,q),通常要求移动平均多项式在单位圆内没有根。
      拟合 ARMA 模型时,因果性和可逆性通常都要检查。
  4. ARIMA模型
    • ARMA用于描述平稳序列,对于非平稳序列需要进行差分。差分算子定义为
      \nabla Y_t=Y_t-Y_{t-1}.
      重复差分记为 \nabla^dY_t

    • X_t=\nabla^dY_t
      是 ARMA(p,q) 过程,则称 (Y_t) 为 ARIMA(p,d,q) 过程。
    • d=0 时,ARIMA 退化为 ARMA;d\gt0 时,原序列 Y_t 通常非平稳,但差分后的 X_t 可以平稳。
  5. 模型识别
    • 样本自相关检验
      (X_t) 是严格白噪声,则对固定 h
      \sqrt n \begin{pmatrix} \hat\rho(1)\\ \vdots\\ \hat\rho(h) \end{pmatrix} \overset d\longrightarrow N_h(\boldsymbol{0},\boldsymbol{I}_h).
      单个样本自相关大致应落在
      \left( -\frac{1.96}{\sqrt n}, \frac{1.96}{\sqrt n} \right)
      因此,自相关图中,若明显多于少数滞后阶数越过该区间,则说明序列可能不是白噪声
    • 混成检验
      把多个滞后的自相关合并成一个统计量
      Box-Pierce 统计量为
      Q_{\mathrm{BP}} = n\sum_{j=1}^{h}\hat\rho(j)^2.
      Ljung-Box 统计量为
      Q_{\mathrm{LB}} = n(n+2) \sum_{j=1}^{h} \frac{\hat\rho(j)^2}{n-j}.
      在严格白噪声原假设下,它们渐近服从
      \chi^2(h).
      如果检验残差而不是原始序列,实际使用时常会根据已估计的 ARMA 参数个数调整自由度
  6. 建模过程
    • 时间序列建模通常按“图形检查、阶数识别、残差诊断”的顺序推进
    • 初步分析包括
      绘制序列图,观察趋势、结构突变和波动聚集;
      判断单一平稳模型是否合理;
      必要时做单位根检验,例如 ADF 检验;
      查看 ACF 和 PACF。
    • 传统识别规则是
      AR 模型的 PACF 常有截尾特征;
      MA 模型的 ACF 常有截尾特征;
      ARMA 模型的 ACF 和 PACF 往往都拖尾。
    • 现代做法通常直接拟合多个候选模型,再用 AIC、BIC 和残差诊断共同选择。
    • 金融收益建模还需要检查波动代理量
      若绝对收益或平方收益仍表现出显著自相关,则说明存在条件异方差或波动聚集。
      存在条件异方差时,需要使用ARCH/GARCH对方差进行建模

时间序列预测

  1. 基于平方误差的最优预测是条件期望
    • 给定截至 t 的信息 \mathcal F_t,预测 X_{t+h} 的常用目标是
      P_tX_{t+h} = E(X_{t+h}\mid\mathcal F_t).
    • 条件期望在所有 \mathcal F_t 可测预测量中最小化均方预测误差:
      E\left[(X_{t+h}-P_tX_{t+h})^2\right].
    • 这也是 Box-Jenkins 方法中用 ARMA/ARIMA 做预测的理论基础。
  2. ARMA递推预测
    • 预测原理
      由可测性
      \begin{aligned} &E(X_s\mid\mathcal F_t)=X_s,\qquad s\le t. \\ &E(\varepsilon_s\mid\mathcal F_t)=\varepsilon_s,\qquad s\le t. \end{aligned}
      且创新项是鞅差分
      E(\varepsilon_{t+h}\mid\mathcal F_t)=0, \qquad h\ge1.
      从而递推求解E(X_{t+h}\mid\mathcal F_t)
    • 对 ARMA(1,1)
      X_t = \mu+\phi_1(X_{t-1}-\mu)+\varepsilon_t+\theta_1\varepsilon_{t-1}.
      一步预测为
      E(X_{t+1}\mid\mathcal F_t) = \mu+\phi_1(X_t-\mu)+\theta_1\varepsilon_t.
      两步预测为
      E(X_{t+2}\mid\mathcal F_t) = \mu+\phi_1\left(E(X_{t+1}\mid\mathcal F_t)-\mu\right).
      一般 h 步预测为
      E(X_{t+h}\mid\mathcal F_t) = \mu+\phi_1^h(X_t-\mu) + \phi_1^{h-1}\theta_1\varepsilon_t.
      |\phi_1|\lt1,则当 h\to\infty 时预测收敛到无条件均值 \mu
    • 创新项的估计
      对已拟合的 ARMA 模型,可用递推残差替代 \varepsilon_t
      \hat\varepsilon_t = X_t-\hat\mu_t
      残差递推需要起始值,常见近似是早期残差取零、早期观测用样本均值代替
  3. ARMA指数平滑预测
    • 对数据 Y_{t-n+1},\ldots,Y_t,指数加权预测可写为
      E(Y_{t+1}\mid\mathcal F_t) = \sum_{i=0}^{n-1} \lambda(1-\lambda)^iY_{t-i}, \qquad 0\lt\lambda\lt1.
      权重随滞后期数指数递减,越新的观测权重越大
    • 指数平滑也可写成递推形式:
      E(Y_{t+1}\mid\mathcal F_t) = \lambda Y_t+(1-\lambda)E(Y_{t}\mid\mathcal F_{t-1})
      \lambda 越大,预测越重视最新观测;\lambda 越小,预测越平滑。
    • 指数平滑对收益均值未必合适,但对波动率预测很常用
      金融收益率常频繁变号,因此直接平滑收益水平的意义有限。
      波动率本身具有持续性,平方收益或平方偏离更适合用指数平滑。
      后续 EWMA 波动率预测就是指数平滑思想在条件方差上的应用

条件异方差模型

ARCH

  1. 金融收益特征
    • 日度收益本身的 ACF 可能接近零,说明收益方向难以线性预测。
      但绝对收益或平方收益常有显著正相关,说明大波动后更容易接着出现大波动。这种现象称为波动率聚集
    • ARCH/GARCH 的目标就是建模
      \operatorname{var}(\varepsilon_t\mid\mathcal F_{t-1})
      如何随过去信息变化。
  2. ARCH模型定义
    • ARCH把当前波动率写成过去平方冲击的函数,令 (Z_t) 为严格白噪声SWN(0,1),ARCH(p) 过程满足
      \begin{aligned} &\sigma_t^2 = \alpha_0+\sum_{i=1}^{p}\alpha_i\varepsilon_{t-i}^2 \\ &\varepsilon_t=\sigma_tZ_t \end{aligned}
      其中\alpha_0\gt0,\alpha_i\ge0,非负约束保证条件方差不为负。
    • 过去的 \varepsilon_{t-i}^2 越大,当前 \sigma_t^2 越大,这直接产生波动率聚集。
  3. ARCH模型性质
    • 可料性
      因为 \sigma_t^2 只依赖 \varepsilon_{t-1}^2,\ldots,\varepsilon_{t-p}^2,所以 \sigma_t\mathcal F_{t-1} 可测
      这表示在时刻 t-1,条件波动率 \sigma_t 已由历史信息决定
    • 鞅差分
      由于 Z_t 独立于过去信息且 E(Z_t)=0
      E(\varepsilon_t\mid\mathcal F_{t-1}) = E(\sigma_tZ_t\mid\mathcal F_{t-1}) = \sigma_tE(Z_t) = 0.
      条件方差为
      \operatorname{var}(\varepsilon_t\mid\mathcal F_{t-1}) = E(\sigma_t^2Z_t^2\mid\mathcal F_{t-1}) = \sigma_t^2.
      因此 ARCH 残差序列可以没有线性自相关,但仍通过条件方差体现非线性相依。

GARCH

  1. GARCH模型定义
    • GARCH 在 ARCH 的基础上加入过去条件方差,GARCH(p,q) 过程满足
      \begin{aligned} &\sigma_t^2 = \alpha_0 + \sum_{i=1}^{p}\alpha_i\varepsilon_{t-i}^2 + \sum_{j=1}^{q}\beta_j\sigma_{t-j}^2 \\ &\varepsilon_t=\sigma_tZ_t \end{aligned}
      其中\alpha_0\gt0,\alpha_i\ge0,\beta_j\ge0
    • GARCH(1,1) 是最常用的低阶模型,其条件方差递推为
      \sigma_t^2 = \alpha_0+\alpha_1\varepsilon_{t-1}^2+\beta_1\sigma_{t-1}^2.
      \alpha_1 衡量上一期冲击平方对当前波动率的直接影响;
      \beta_1 衡量上一期条件方差的持续影响;
      \alpha_1+\beta_1 衡量波动率持续性。
    • 对 GARCH(1,1),四阶矩存在需要满足
      E\left[(\alpha_1Z_t^2+\beta_1)^2\right]\lt1.
      即使标准化创新 Z_t 的分布不是极端厚尾,随机变化的 \sigma_t 也会使 \varepsilon_t=\sigma_tZ_t 的尾部更厚。
      因此 GARCH 可以同时解释两件事:益本身线性相关弱;收益分布呈现厚尾和波动聚集。
    • 与 ARCH 相比,GARCH 用过去的 \sigma_{t-j}^2 保留波动率状态,因此能用较少参数刻画长时间的波动持续性。
  2. 协方差平稳判定
    • 对 GARCH(1,1),若
      \alpha_1+\beta_1\lt1,
      则无条件方差存在,并且
      \operatorname{var}(\varepsilon_t) = \frac{\alpha_0}{1-\alpha_1-\beta_1}.
    • 对一般 GARCH(p,q),常见充分条件是
      \sum_{i=1}^{p}\alpha_i+\sum_{j=1}^{q}\beta_j\lt1.
    • 如果系数和接近 1,说明波动率冲击衰减很慢。
  3. GARCH变体
    • IGARCH
      表示波动率冲击具有极强持续性,满足
      \sum_{i=1}^{p}\alpha_i+\sum_{j=1}^{q}\beta_j=1,
      在 IGARCH 中,条件方差冲击不会像平稳 GARCH 那样回到固定长期方差。
      若系数和不小于 1,通常不能得到有限无条件方差,因此不属于协方差平稳过程。
    • 杠杆 GARCH
      坏消息或价格下跌对未来波动率的提升更强,称为杠杆效应。加入符号非对称参数进行描述,例如
      \sigma_t^2 = \alpha_0 + \alpha_1(\varepsilon_{t-1}+\delta |\varepsilon_{t-1}|)^2 + \beta_1\sigma_{t-1}^2.
      \delta\lt0,则负冲击对应的系数 (1-\delta)^2 更大,坏消息对波动率的影响更强
    • TGARCH
      用指示函数直接刻画负冲击的额外影响,例如
      \sigma_t^2 = \alpha_0 + \tilde\alpha_1\varepsilon_{t-1}^2 + \tilde\delta\, \mathbf 1_{\{\varepsilon_{t-1}\lt0\}}\varepsilon_{t-1}^2 + \beta_1\sigma_{t-1}^2.
      \varepsilon_{t-1}\ge0 时,冲击平方的系数为 \tilde\alpha_1;当 \varepsilon_{t-1}\lt0 时,冲击平方的系数变为 \tilde\alpha_1+\tilde\delta
      \tilde\delta\gt0,则负冲击会额外提高下一期波动率。

ARMA-GARCH

  1. ARMA-GARCH 模型
    • 使用 ARMA 描述条件均值,用 GARCH 描述条件方差。ARMA(p_1,q_1)-GARCH(p_2,q_2) 可写为
      \begin{aligned} &X_t=\mu_t+\sigma_tZ_t \\ &\mu_t = \mu + \sum_{i=1}^{p_1}\phi_i(X_{t-i}-\mu) + \sum_{j=1}^{q_1}\theta_j(X_{t-j}-\mu_{t-j}) \\ &\sigma_t^2 = \alpha_0 + \sum_{i=1}^{p_2}\alpha_i\varepsilon_{t-i}^2 + \sum_{j=1}^{q_2}\beta_j\sigma_{t-j}^2 \end{aligned}
    • 因为 \varepsilon_{t-j}=X_{t-j}-\mu_{t-j},所以上式就是用过去残差平方驱动条件方差。
  2. 模型预测
    • 可逆性保证条件均值可由过去观测计算
      ARMA可逆,则过去创新项可以由过去观测递推得到。因此 \mu_t\mathcal F_{t-1} 可测。
      又因为 \sigma_t^2 只依赖过去误差和过去波动率,所以 \sigma_t^2 也对 \mathcal F_{t-1} 可测。
    • \mu_t\sigma_t^2 分别就是条件均值和条件方差。条件均值为
      E(X_t\mid\mathcal F_{t-1}) = \mu_t.
      条件方差为
      \operatorname{var}(X_t\mid\mathcal F_{t-1}) = \sigma_t^2.
      因此模型把预测分成两层:预测下一期中心位置 \mu_t;预测下一期风险大小 \sigma_t
  3. 最大似然估计
    • GARCH 拟合通常通过条件密度构造似然,给定
      X_t=\mu_t+\sigma_tZ_t,
      Z_t 的密度为 f_Z,则条件密度为
      f_{X_t\mid\mathcal F_{t-1}}(x_t\mid\mathcal F_{t-1}) = \frac{1}{\sigma_t} f_Z\left(\frac{x_t-\mu_t}{\sigma_t}\right).
    • 其中 \mu_t\sigma_t 都由过去信息和参数递推得到,联合密度可以分解为
      f_{X_0,\ldots,X_n}(x_0,\ldots,x_n) = f_{X_0}(x_0) \prod_{t=1}^{n} f_{X_t\mid X_{t-1},\ldots,X_0} (x_t\mid x_{t-1},\ldots,x_0).
      由于 f_{X_0} 通常没有简单闭式表达,实践中常固定初值并使用条件似然。对一般 ARMA-GARCH,条件似然可写为
      L(\boldsymbol{\theta};X) = \prod_{t=1}^{n} \frac{1}{\sigma_t} f_Z\left(\frac{X_t-\mu_t}{\sigma_t}\right).
      初始 \sigma_0^2、早期残差或早期观测通常用样本方差、零或递推近似处理。
    • 定义第 t 期对数似然贡献为 l_t(\boldsymbol{\theta}),则
      \ln L(\boldsymbol{\theta};X) = \sum_{t=1}^{n}l_t(\boldsymbol{\theta}).
      最大似然估计量为
      \hat{\boldsymbol{\theta}} = \arg\max_{\boldsymbol{\theta}}\ln L(\boldsymbol{\theta};X).
      内部极大点存在,则满足得分方程
      \frac{\partial}{\partial\boldsymbol{\theta}} \ln L(\boldsymbol{\theta};X) = \sum_{t=1}^{n} \frac{\partial l_t(\boldsymbol{\theta})} {\partial\boldsymbol{\theta}} = \boldsymbol{0}.
    • 创新分布的选择会影响似然和尾部拟合,f_Z 常见选择包括
      标准正态分布;
      标准化 Student-t 分布;
      其他厚尾或偏态分布。
      金融收益厚尾明显时,Student-t 创新往往比高斯创新更合理。
  4. 准最大似然估计QML
    • 若动态形式和创新分布都正确,例如高斯 GARCH 模型确实为真,则
      \sqrt n (\hat{\boldsymbol{\theta}}_n-\boldsymbol{\theta}_0) \overset d\longrightarrow N\left( \boldsymbol{0}, \boldsymbol{I}(\boldsymbol{\theta}_0)^{-1} \right).
      其中 \boldsymbol{I}(\boldsymbol{\theta}_0) 是 Fisher 信息矩阵。
    • 但是创新分布可能设错,若动态方程仍正确,可以改用QML估计,渐近协方差变成夹心形式
      \sqrt n (\hat{\boldsymbol{\theta}}_n-\boldsymbol{\theta}_0) \overset d\longrightarrow N\left( \boldsymbol{0}, \boldsymbol{J}^{-1} \boldsymbol{I} \boldsymbol{J}^{-1} \right).
      其中
      \boldsymbol{I}(\boldsymbol{\theta}) = E\left[ \frac{\partial l_t(\boldsymbol{\theta})}{\partial\boldsymbol{\theta}} \frac{\partial l_t(\boldsymbol{\theta})}{\partial\boldsymbol{\theta}^{\top}} \right],\qquad\boldsymbol{J}(\boldsymbol{\theta}) = -E\left[ \frac{\partial^2l_t(\boldsymbol{\theta})} {\partial\boldsymbol{\theta}\partial\boldsymbol{\theta}^{\top}} \right].
      表明可以在估计时先用方便的高斯似然,标准误再用稳健的夹心形式修正。
  5. 残差诊断与两阶段建模
    • 对一般 ARMA-GARCH 模型X_t-\mu_t=\varepsilon_t=\sigma_tZ_t,标准化残差为
      \hat Z_t = \frac{\hat\varepsilon_t}{\hat\sigma_t}.
      它用于重构模型中的创新序列
    • 标准化残差应接近严格白噪声
      若模型动态部分设定合理,则 \hat Z_t 不应再有显著自相关,同时 |\hat Z_t|\hat Z_t^2 也不应再有显著自相关。
      因此常见诊断包括:对 \hat Z_t 画 ACF 并做 Ljung-Box 检验;对 |\hat Z_t|\hat Z_t^2 画 ACF 并做 Ljung-Box 检验;用 Q-Q 图检查创新分布是否合理。
    • 两阶段建模
      第一阶段估计 ARMA-GARCH,得到 \hat\mu_t\hat\sigma_t\hat Z_t,称为预白化。
      第二阶段对 \hat Z_t 的边缘分布建模,可以选用厚尾、偏态或极值模型。
      这种做法的优点是结构清楚,便于在高维风险因子中分别处理每个序列自身的动态、标准化创新的分布、多个创新之间的相依结构。
      缺点是第一阶段估计误差会传递到第二阶段,整体不确定性较难完整量化。
  6. 条件 VaR 与 ES
    • 条件 VaR
      q_\alpha(Z)Z\alpha 分位数,则
      \operatorname{VaR}_{\alpha}^{t} = \mu_{t+1} + \sigma_{t+1}q_{\alpha}(Z).
      实际估计时使用
      \widehat{\operatorname{VaR}}_{\alpha}^{t} = \hat\mu_{t+1} + \hat\sigma_{t+1}\hat q_{\alpha}(Z).
    • 条件 ES
      记创新的尾部期望为 \operatorname{ES}_{\alpha}(Z),则
      \operatorname{ES}_{\alpha}^{t} = \mu_{t+1} + \sigma_{t+1}\operatorname{ES}_{\alpha}(Z).
      实际估计时使用
      \widehat{\operatorname{ES}}_{\alpha}^{t} = \hat\mu_{t+1} + \hat\sigma_{t+1} \widehat{\operatorname{ES}}_{\alpha}(Z).
    • 因此时间序列模型对 VaR 和 ES 的作用是把风险度量变成随市场状态变化的条件风险,而不是固定的无条件分位数。
    • 若创新尾部估计过轻,即使 GARCH 波动率预测正确,VaR 和 ES 也会低估极端损失

波动率预测

  1. 定义
    • 波动率预测本质上是条件方差预测,设底层过程为
      X_t=\mu_t+\sigma_tZ_t,
      其中 \mu_t\sigma_t\mathcal F_{t-1} 可测,Z_t 均值为 0、方差为 1,并独立于过去信息。
    • 对未来 h 期,波动率预测关注
      E(\sigma_{t+h}^2\mid\mathcal F_t).
      由于
      E(\sigma_{t+h}^2\mid\mathcal F_t) = E(\varepsilon_{t+h}^2\mid\mathcal F_t), \qquad \varepsilon_{t+h}=X_{t+h}-\mu_{t+h},
      所以条件方差预测也等价于平方偏离预测。
  2. GARCH(1,1)
    • 一步预测
      对残差方程的 GARCH(1,1),有
      \sigma_{t+1}^2 = \alpha_0+\alpha_1\varepsilon_t^2+\beta_1\sigma_t^2.
      因为右侧在时刻 t 已知,所以
      E(\varepsilon_{t+1}^2\mid\mathcal F_t) = \sigma_{t+1}^2.
      实际预测使用估计参数:
      \hat\sigma_{t+1}^2 = \hat\alpha_0+\hat\alpha_1\hat\varepsilon_t^2 + \hat\beta_1\hat\sigma_t^2.
      若均值为零,则 \hat\varepsilon_t=X_t,这时公式退化为零均值 GARCH 的写法。
    • 多步预测

      g_h = E(\varepsilon_{t+h}^2\mid\mathcal F_t).
      h\gt1,递推为
      g_h = \alpha_0+(\alpha_1+\beta_1)g_{h-1}.
      展开后得到
      E(\varepsilon_{t+h}^2\mid\mathcal F_t) = \alpha_0\sum_{i=0}^{h-1}(\alpha_1+\beta_1)^i + (\alpha_1+\beta_1)^{h-1} (\alpha_1\varepsilon_t^2+\beta_1\sigma_t^2).
      \alpha_1+\beta_1\lt1,则当 h\to\infty 时,
      E(\varepsilon_{t+h}^2\mid\mathcal F_t) \to \frac{\alpha_0}{1-\alpha_1-\beta_1}.
      即长期预测回到无条件方差。
  3. ARMA-GARCH
    • ARMA 部分给出
      E(X_{t+h}\mid\mathcal F_t).
    • GARCH 部分给出
      \operatorname{var}(X_{t+h}\mid\mathcal F_t).
    • 因此风险预测不是只预测收益水平,而是同时预测未来分布的位置和尺度。
  4. EWMA
    • 是一种非参数波动率递推方法,对平方偏离做指数平滑:
      E((X_{t+1}-\mu_{t+1})^2\mid\mathcal F_t) = \alpha(X_t-\mu_t)^2 + (1-\alpha)E((X_t-\mu_t)^2\mid\mathcal F_{t-1})
    • 用估计均值和估计波动率替代不可观测量,得到
      \hat\sigma_{t+1}^2 = \alpha(X_t-\hat\mu_t)^2 + (1-\alpha)\hat\sigma_t^2.
    • EWMA 不需要完整设定 GARCH 参数结构,但本质上仍是在用近期平方偏离递推预测未来方差。

极值理论

最大值方法

从样本最大值到GEV

  1. 最大值方法先把风险问题转化为右尾最大损失的问题。
    • X_1,X_2,\ldots 表示一列损失变量,数值越大表示损失越严重,前 n 个观测中的最大损失为:
      M_n=\max(X_1,\ldots,X_n)
      因此,最大值方法不是研究普通波动,而是研究一段时期中最严重的损失
    • 最小值问题可以通过取负号并入最大值框架
      \min(X_1,\ldots,X_n) = -\max(-X_1,\ldots,-X_n)
      因此,左尾极端风险可以转化为 -X_i 的右尾最大值问题。
      金融收益的极端亏损通常就是这样转化为损失尾部建模的。
  2. 在独立同分布假设下,最大值分布由原分布的右尾决定
    • X_1,X_2,\ldots 独立同分布,公共分布函数为 F,则:
      P(M_n\le x) = P(X_1\le x,\ldots,X_n\le x) = F(x)^n
    • 这个式子说明,最大值不超过 x 等价于所有观测都不超过 x
    • n 增大时,M_n 会向分布右尾移动,所以最大值分布主要由尾部决定。
  3. 因为 M_n 本身会随样本量移动,所以必须标准化
    • 若分布有有限右端点,M_n 会逼近右端点;若分布右端点为无穷,M_n 可能趋向无穷。
    • 为了得到稳定极限,需要寻找 c_n\gt 0d_n,研究
      \frac{M_n-d_n}{c_n}
      d_n 负责平移位置,c_n 负责调整尺度。
    • 这一步对应中心极限定理中对和 S_n 做标准化的思想。
  4. 最大值理论的核心结论是:非退化极限只能是 GEV
    • 若存在 c_n\gt 0,d_n,使得
      P\left(\frac{M_n-d_n}{c_n}\le z\right) = F^n(c_nz+d_n) \to H(z),
      H 非退化,则 H 必须属于广义极值分布族。
    • 类比地,中心极限定理说明“和”的标准化极限常为正态分布;极值理论说明“最大值”的标准化极限为 GEV。
  5. GEV的参数
    • 标准 GEV 为
      H_\xi(z)= \begin{cases} e^{-\left(1+\xi z\right)^{-\frac{1}{\xi}}},& \xi\ne0,\\[2mm] e^{-e^{-z}},& \xi=0, \end{cases} \qquad 1+\xi z\gt 0.
      H_\xi(z)表示标准化后的最大损失不超过z的概率,在原始尺度上等价于最大损失不超过x=\mu+\sigma z。此外有三参数形式
      H_{\xi,\mu,\sigma}(x) = H_\xi\left(\frac{x-\mu}{\sigma}\right), \qquad \mu\in\mathbb R,\ \sigma\gt 0.
      H_{\xi,\mu,\sigma}(x)表示最大损失小于x的概率
    • \mu 是位置参数,对应d_n,随分块大小n改变,控制最大值分布的水平。
      \sigma 是尺度参数,对应c_n,随分块大小n改变控制最大值分布的分散程度。
      \xi形状参数,与块大小无关,控制尾部类型,是极值分析中最关键的参数
      由于分块数n为固定值,因此不在公式中单独列出
    • 因此H(x)可能是二者之一,需要根据情形区分,后文约定
      \begin{aligned} &H_\xi(z)=H_{\xi,\mu,\sigma}(x) \\ &x=\mu+z\sigma \end{aligned}
      出于简化目的,后文默认使用H(z)=H_\xi(z)。如果出现原始损失水平x,则默认先通过z=\frac{x-\mu}{\sigma}转成标准化尺度。

形状参数与最大吸引域

  1. 形状参数
    • 分布 F 的右端点定义为:
      x_F=\sup\{x\in\mathbb R:F(x)\lt 1\}.
      x_F=\infty,说明分布理论上可以取任意大的值。
      x_F\lt \infty,说明分布存在有限上界。
    • \xi\gt 0 时,GEV是 Fréchet 型
      右尾较重。
      右端点为无穷。
      极端大损失出现概率相对较高。
    • \xi=0 时,GEV是 Gumbel 型
      尾部比 Fréchet 型轻。
      通常没有有限右端点。
    • \xi\lt 0 时,GEV是 Weibull 型
      分布有有限右端点
      最大值不能超过理论上界。
  2. 最大吸引域
    • 最大值分布标准化以后,会收敛到哪一种极值分布
    • 若存在 c_n\gt 0,d_n,使得:
      F^n(c_nz+d_n)\to H(z),
      则称:
      F\in\operatorname{MDA}(H).
    • H 最终只会是Fréchet吸引域、Gumbel吸引域、Weibull吸引域的三类之一
  3. 三种吸引域的特征
    • Fréchet: \xi\gt 0,尾函数满足正则变化
      定义尾函数为
      \bar F(x)=1-F(x)
      当属于Fréchet吸引域时,\bar F满足
      \lim_{x\to\infty}\frac{\bar{F}(tx)}{\bar{F}(x)}=t^{-\frac{1}{\xi}},\qquad t\gt 0
      等价于写成
      \bar F(x)=x^{-\frac{1}{\xi}}L(x).
      上式为Fréchet吸引域的典型判别,其中 L慢变函数,满足
      \lim_{x\to\infty}\frac{L(tx)}{L(x)}=1,\qquad t\gt 0
      这表示尾部主要按幂律 x^{-\frac{1}{\xi}} 衰减,\xi 越大,\frac{1}{\xi} 越小,尾部衰减越慢,极端损失越危险
    • Weibull: \xi\lt 0,逼近端点时满足正则变化
      \bar F(x) = (x_F-x)^{-\frac{1}{\xi}}L\left(\frac{1}{x_F-x}\right), \qquad x\uparrow x_F,\ \xi\lt 0
      t=\frac{1}{x_F-x},得到Weibull吸引域的典型判别
      \bar F\left(x_F-\frac{1}{t}\right)=t^{\frac{1}{\xi}}L(t), \qquad t\to\infty,\ \xi\lt 0.
      因为 \frac{1}{\xi}\lt 0,所以当 t\to\infty 时,右端点附近的剩余尾部概率趋于 0。
    • Gumbel: 最大吸引域是非幂律重尾、非有限端点的中间情形
      它不具有 Fréchet 型的正则变化重尾
      它也不像 Weibull 型那样有有限右端点
      可以理解为尾部较轻但仍可能没有理论上界的一类分布

GEV的估计与运用

  1. 块最大值方法
    • 实际数据中通常用块最大值方法把 GEV 理论落到样本上。
      设总样本量为 N=mn,将样本分为 m 个长度为 n 的块,第 j 个块最大值为
      M_{n,j} = \max\{X_{(j-1)n+1},\ldots,X_{jn}\}, \qquad j=1,\ldots,m.
      原始样本由 X_1,\ldots,X_N 变成块最大值样本 M_{n,1},\ldots,M_{n,m},当 n 足够大时,块最大值近似服从 GEV
      P(M_{n,j}\le x)\approx H\left(\frac{x-\mu}{\sigma}\right).
    • 块大小选择决定偏差与方差的平衡
      块太小:模型偏差较大
      块太大:块数 m 少,参数估计方差较大
    • 相依时间序列
      金融损失序列常有波动聚集和极端事件成簇,若 (X_i) 严格平稳但不独立,在适当条件下可能有
      \lim_{n\rightarrow \infty} P\left(\frac{M_n-d_n}{c_n}\le z\right)\to H(z)^\theta, \qquad \theta\in(0,1].
      \theta极值指数\theta=1 表示极端事件近似独立;\theta\lt 1 表示极端事件聚集,有效独立样本量降低
      对于相依数据,通常需要比独立情形更大的块,以减弱块内相依对极值近似的影响
    • 用这些块最大值拟合 GEV,得到参数估计 \hat\xi,\hat\mu,\hat\sigma,从而计算极端分位数、回报水平和回报期等
  2. 极大似然估计
    • h_{\xi,\mu,\sigma} 为 GEV 密度,块最大值样本的对数似然为
      \ell(\xi,\mu,\sigma) = \sum_{j=1}^{m}\ln h_{\xi,\mu,\sigma}(M_{n,j}).
    • 估计时选择使 \ell(\xi,\mu,\sigma) 最大的参数,同时必须满足支持集约束
      1+\xi\frac{M_{n,j}-\mu}{\sigma}\gt 0, \qquad j=1,\ldots,m.
    • 从而得到标准化尺度上的块最大值分布
      \hat H(z)=H_{\hat\xi}(z), \qquad z=\frac{x-\hat\mu}{\hat\sigma}
      原始损失尺度上的分布则为
      P(M_n\le x)\approx \hat H\left(\frac{x-\hat\mu}{\hat\sigma}\right)
  3. 回报水平x_k
    • 如果平均每 (k) 个块才超过一次,那么这个损失水平是多少。例如x_{10}表示当期损失超过这个值的概率为10\%
      H 是标准化后的块最大值分布,先定义标准化回报水平z_k
      H(z_k)=1-\frac{1}{k}.
      原始损失尺度上的回报水平为
      x_k=\mu+\sigma z_k.
    • GEV的回报水平
      \xi\ne0 时,标准化回报水平为
      z_k = \frac{\left[-\ln\left(1-\frac{1}{k}\right)\right]^{-\xi}-1}{\xi}.
      \xi=0
      z_k = -\ln\left[-\ln\left(1-\frac{1}{k}\right)\right].
  4. 回报期k_x
    • 表示平均多少个块会出现一次超过 x 的最大损失。例如k_{10}表示平均需要这个值的块数出现大于10的损失
    • 给定原始损失阈值 x,先标准化为
      z=\frac{x-\mu}{\sigma}.
      超过概率为
      \bar H(z)=1-H(z)
      回报期为
      k_{x} = \frac{1}{\bar H(z)} = \frac{1}{1-H(z)}.

阈值超越方法

从阈值超越到GPD

  1. 阈值超越
    • 阈值超越方法解决的是块最大值方法的信息浪费问题。
      块最大值方法每个块只保留一个最大值。
      但在实际数据中,一个块内可能有多个很大的损失,除了最大值以外,其余高损失也包含尾部信息。
      阈值超越方法不再按块只取一个最大值,而是选择一个高阈值 u,保留所有满足 X_i\gt u 的观测。
    • 阈值超越方法的研究对象是超额损失
      设原始损失样本为 X_1,\ldots,X_N,给定高阈值 u,超过阈值的样本个数为
      N_u=\sum_{i=1}^{N}\mathbf 1_{\{X_i\gt u\}}
      对超过阈值的样本,只建模其超出阈值的部分
      Y_i=X_i-u,\qquad X_i\gt u.
      因此,阈值超越方法研究的是条件分布
      X-u\mid X\gt u
    • 阈值超额分布定义为
      F_u(x) = P(X-u\le x\mid X\gt u) = \frac{F(u+x)-F(u)}{1-F(u)}, \qquad 0\le x\lt x_F-u.
      表示已经超过阈值 u 的条件下,超额量 X-u 不超过 x 的概率。阈值越高,F_u 越能代表真正尾部的局部形态。
  2. 广义帕累托分布
    • 广义帕累托分布GPD的分布函数为
      G_{\xi,\beta}(y) = \begin{cases} 1-\left(1+\xi\frac{y}{\beta}\right)^{-\frac{1}{\xi}}, &\xi\ne0,\\[2mm] 1-e^{-\frac{y}{\beta}}, &\xi=0, \end{cases} \qquad \beta\gt 0.
      支持集要求
      y\ge0,\qquad 1+\xi\frac{y}{\beta}\gt 0.
      \xi 是形状参数,与 GEV 中的形状参数一致,用来控制尾部类型。
      \beta 是尺度参数,控制超额损失的大小尺度。
    • GPD的尾部类型与 GEV 对应。
      \xi\gt 0 时,GPD 为重尾型,尾部与 Pareto 型幂律衰减有关。
      \xi=0 时,GPD 退化为指数分布:
      G_{0,\beta}(y)=1-e^{-\frac{y}{\beta}}.
      \xi\lt 0 时,GPD 具有有限右端点。
    • GPD的均值由形状参数决定
      \xi\lt 1,则 GPD 均值存在
      E[Y]=\frac{\beta}{1-\xi}
      \xi\ge1,均值不存在,表明此时尾部风险度量会非常不稳定
  3. 阈值超越与GPD
    • Pickands--Balkema--de Haan 定理: 对广泛的分布类,当阈值 u 趋近右端点 x_F 时,超额分布可由 GPD 近似:
      \lim_{u\uparrow x_F} \sup_{0\le y\lt x_F-u} \left|F_u(y)-G_{\xi,\beta(u)}(y)\right| = 0
      这说明只要阈值足够高,就可以近似认为
      F_u(y)\approx G_{\xi,\beta}(y)
      这也是从最大值方法转向阈值超越方法的关键:GEV 刻画块最大值,GPD 刻画高阈值以上的超额损失
    • GPD的阈值稳定性
      如果阈值 u 以上的超额服从 GPD,那么提高阈值到 v\gt u 后,超额分布仍为 GPD
      F_v(y)=G_{\xi,\beta+\xi(v-u)}(y)
      阈值从u提升到v,形状参数不变,距离参数提升\xi(v-u)

阈值选取与参数估计

  1. 阈值选取
    • 阈值 u 的选择是阈值超越方法的核心
      阈值太低:尾部近似不充分,GPD 模型偏差较大。
      阈值太高:超过阈值的样本太少,参数估计方差较大。
      因此,阈值选择同样存在偏差与方差的权衡。
    • 平均超额函数
      平均超额函数定义为
      e(u)=E[X-u\mid X\gt u].
      如果在阈值 u 以上的超额分布近似为 G_{\xi,\beta},并且 \xi\lt 1,则当前阈值处的平均超额为
      e(u)=\frac{\beta}{1-\xi}.
      如果把阈值从 u 提高到 v\gt u,由 GPD 的阈值稳定性有
      \beta(v)=\beta+\xi(v-u),
      因而
      e(v)=\frac{\beta+\xi(v-u)}{1-\xi}.
      这表明,在合适的高阈值区域内,平均超额函数应当近似为阈值的线性函数
    • 样本平均超额函数
      根据定义使用样本数据计算平均超额
      e_N(u) = \frac{ \sum_{i=1}^{N}(X_i-u)\mathbf 1_{\{X_i\gt u\}} }{ \sum_{i=1}^{N}\mathbf 1_{\{X_i\gt u\}} }.
    • 画出 e_N(u)u 的变化,可以辅助选择阈值。
      若某一阈值以上图形近似线性,则说明该区域用 GPD 描述较合理。
      若线性区间不明显,说明阈值选择和尾部模型都有较大不确定性。
  2. 参数估计
    • 给定阈值 u 后,只对超额样本拟合 GPD
      超额样本为
      \{X_i-u:X_i\gt u\}.
      建模假设为
      X_i-u\mid X_i\gt u\approx G_{\xi,\beta}.
      需要估计的参数是 \xi\beta
    • 极大似然估计
      \xi\ne0 时,超额样本的对数似然为
      \ell(\xi,\beta) = -N_u\ln\beta - \left(1+\frac{1}{\xi}\right) \sum_{i:X_i\gt u} \ln\left(1+\xi\frac{X_i-u}{\beta}\right).
      支持集约束为
      1+\xi\frac{X_i-u}{\beta}\gt 0, \qquad X_i\gt u.
      \xi=0 时,对应指数分布,对数似然为
      \ell(0,\beta) = -N_u\ln\beta - \frac{1}{\beta} \sum_{i:X_i\gt u}(X_i-u).
      极大化似然后得到 \hat\xi,\hat\beta

GPD的运用

  1. 尾部概率
    • GPD 可用于从阈值 u 向更高损失水平外推尾部概率
      x\gt u,有
      \bar F(x) = P(X\gt x) = P(X\gt u)P(X\gt x|X\gt u) = \bar F(u) \left(1+\xi\frac{x-u}{\beta}\right)^{-\frac{1}{\xi}}.
    • 根据样本估计
      用样本超过比例估计阈值超过概率:
      \widehat{\bar F}(u)=\frac{N_u}{N}.
    • Smith型尾部估计器
      \widehat{\bar F}(x) = \frac{N_u}{N} \left(1+\hat\xi\frac{x-u}{\hat\beta}\right)^{-\frac{1}{\hat\xi}}, \qquad x\gt u.
  2. VaR
    • q_\alpha 为置信水平为 \alpha 的 VaR,则
      P(X\gt q_\alpha)=1-\alpha.
      \xi\ne0 时,
      q_\alpha = u+\frac{\beta}{\xi} \left[ \left(\frac{\bar F(u)}{1-\alpha}\right)^\xi -1 \right].
      \xi=0 时,
      q_\alpha = u+\beta\ln\left(\frac{\bar F(u)}{1-\alpha}\right).
    • 从样本估计
      \bar F(u),\xi,\beta 都替换为估计值,对于 \xi\ne0
      \hat q_\alpha = u+\frac{\hat\beta}{\hat\xi} \left[ \left(\frac{N_u}{N(1-\alpha)}\right)^{\hat\xi} -1 \right].
      对于 \xi=0
      \hat q_\alpha = u+\hat\beta\ln \left(\frac{N_u}{N(1-\alpha)}\right)
  3. ES
    • 期望短缺 ES 衡量超过 VaR 后的平均损失
      \xi\lt 1 条件下,GPD 给出
      ES_\alpha = E[X\mid X\gt q_\alpha] = \frac{q_\alpha+\beta-\xi u}{1-\xi}.
    • 从样本估计
      \widehat{ES}_\alpha = \frac{\hat q_\alpha+\hat\beta-\hat\xi u}{1-\hat\xi}.
      \xi\ge1,ES 不存在,说明尾部极重
    • ES 与 VaR 的相对大小\xi 控制
      \alpha\to1
      \frac{ES_\alpha}{q_\alpha} \to \frac{1}{1-\xi}.
      \xi 越大,ES 相对 VaR 越大。
      因此 \xi 不只是分布类型参数,也是尾部风险度量的核心参数。

Hill 方法与条件 EVT

  1. Hill方法
    • 定义
      Hill方法是 Fréchet 重尾下的尾指数估计方法,它假定尾函数具有幂律形式:
      \bar F(x)=x^{-\alpha}L(x), \qquad \alpha\gt 0.
      尾指数 \alpha 与 EVT 形状参数满足
      \xi=\frac{1}{\alpha}.
      因此 Hill 方法本质上是在估计 \xi
    • 估计量
      Hill 估计量使用最高的 k 个顺序统计量,设正损失样本的降序顺序统计量为
      X_{(1)}\ge X_{(2)}\ge\cdots\ge X_{(N)}
      Hill 估计量为
      \hat\xi_{k}^{H} = \frac{1}{k} \sum_{j=1}^{k} \left(\ln X_{(j)}-\ln X_{(k+1)}\right).
      尾指数估计为
      \hat\alpha_{k} = \frac{1}{\hat\xi_{k}^{H}}.
    • k的选取
      渐近理论通常要求
      k\to\infty, \qquad \frac{k}{N}\to0.
      k 太小,方差大;k 太大,会把非尾部样本纳入估计,偏差大。
      Hill 图用于观察不同 k 下估计值是否出现相对稳定区间,选取稳定时的值
  2. Hill型尾部估计器
    • 取阈值为X_{(k+1)},当阈值足够大时,有
      \bar F(x)=x^{-\alpha}L(x)\rightarrow Cx^{-\alpha}
      根据\bar F(X_{(k+1)})\approx\frac{k}{N}解出C,再估计出\alpha,解得
      \widehat{\bar F}_{H}(x) = \frac{k}{N} \left(\frac{x}{X_{(k+1)}}\right)^{-\hat\alpha_{k}}, \qquad x\gt X_{(k+1)}
      它把阈值超过比例 k/N 和幂律尾部外推结合起来。
    • 与Smith型尾部估计器相比,Hill 方法更依赖 Fréchet 重尾假设。
      若 Hill 图没有稳定区,Hill 估计通常不可靠。

条件极值理论

  1. 金融时间序列常需要条件EVT。
    • 直接对收益或损失序列使用 GPD,可能受到条件异方差和波动聚集影响。
    • 条件 EVT 先用时间序列模型刻画条件均值和条件波动:
      X_t=\mu_t+\sigma_t Z_t.
    • 再对标准化创新项 Z_t 应用 GPD 阈值超越方法。
  2. 条件 VaR 与条件 ES 由创新项风险量缩放得到。
    • 若已估计下一期条件均值和条件波动,则
      \widehat{\operatorname{VaR}}_{t+1}^{\alpha} = \hat\mu_{t+1} + \hat\sigma_{t+1}\hat q_\alpha(Z).
    • 条件 ES 为
      \widehat{ES}_{t+1}^{\alpha} = \hat\mu_{t+1} + \hat\sigma_{t+1}\widehat{ES}_\alpha(Z).
    • 这样可以把波动预测和尾部外推结合起来,得到随时间变化的风险度量。

多元模型

多元建模基础

随机向量、联合分布与边缘分布

  1. 联合分布
    • 多元模型不只是分别研究 X_1,\ldots,X_d 的单变量分布,而是研究整个向量 \boldsymbol{X}联合分布
      \boldsymbol{X}=(X_1,\ldots,X_d)^{\top}
      其中 X_j 表示第 j 个风险因子、收益或损失变量。
    • 联合分布同时包含两类信息:
      每个分量自身如何分布,即边缘分布
      各分量之间如何一起变化,即相依结构
    • 随机向量的联合分布函数定义为
      F_{\boldsymbol{X}}(\boldsymbol{x}) = F_{\boldsymbol{X}}(x_1,\ldots,x_d) = P(\boldsymbol{X}\le \boldsymbol{x}) = P(X_1\le x_1,\ldots,X_d\le x_d).
      这里的 \boldsymbol{X}\le \boldsymbol{x} 是逐分量比较,即所有 X_j\le x_j 同时成立。
      X_j 表示第 j 个损失变量,则 F_{\boldsymbol{X}}(\boldsymbol{x}) 表示所有损失都不超过各自阈值的概率。
    • 因此联合分布描述的是一个多维区域中的概率,而不是某个单一变量的概率。
  2. 边缘分布
    • 一维边缘分布
      F_i(x_i) = P(X_i\le x_i) = F(\infty,\ldots,\infty,x_i,\infty,\ldots,\infty).
      这个式子表示:只限制第 i 个变量,其他变量不加约束。
      F_i 绝对连续,则边缘密度为
      f_i(x) = \frac{d}{dx}F_i(x).
      边缘分布只告诉我们单个风险因子的行为,不能说明多个风险因子是否会同时极端。
    • 多维边缘分布

      \boldsymbol{X}=(\boldsymbol{X}_1^{\top},\boldsymbol{X}_2^{\top})^{\top}, \qquad \boldsymbol{X}_1=(X_1,\ldots,X_k)^{\top},
      \boldsymbol{X}_1 的边缘分布为
      F_{\boldsymbol{X}_1}(\boldsymbol{x}_1) = P(\boldsymbol{X}_1\le \boldsymbol{x}_1) = F(x_1,\ldots,x_k,\infty,\ldots,\infty).
      这说明联合分布是最完整的对象,所有边缘分布都只是联合分布的一部分。
  3. 联合密度
    • 若联合分布可以写成某个非负函数的多重积分,则称该分布绝对连续,该非负函数称为联合密度。
      F(x_1,\ldots,x_d) = \int_{-\infty}^{x_1} \cdots \int_{-\infty}^{x_d} f(u_1,\ldots,u_d)\,du_d\cdots du_1.
      联合密度 f 描述概率质量在多维空间中的分布方式。
    • 若联合密度存在,则可通过积分得到边缘密度。
      但边缘密度都存在,并不保证联合密度一定存在,因为边缘分布没有完全确定相依结构。
  4. 生存函数
    • 多元生存函数描述所有分量同时超过阈值的概率。
      \bar F_{\boldsymbol{X}}(\boldsymbol{x}) = P(\boldsymbol{X}\gt \boldsymbol{x}) = P(X_1\gt x_1,\ldots,X_d\gt x_d).
      这里的 \boldsymbol{X}\gt \boldsymbol{x} 也是逐分量比较。
    • i 个变量的边缘生存函数为
      \bar F_i(x_i) = P(X_i\gt x_i).
    • 风险管理更关心右尾损失,因此 \bar F_{\boldsymbol{X}}(\boldsymbol{x}) 常用来描述多个风险因子同时处于高损失区间的概率。

条件分布、独立性与相依结构

  1. 条件密度
    • 条件分布刻画的是:已知一部分变量后,剩余变量的分布如何变化。
      将随机向量分块为
      \boldsymbol{X}=(\boldsymbol{X}_1^{\top},\boldsymbol{X}_2^{\top})^{\top}.
      \boldsymbol{X} 有联合密度 f,且 \boldsymbol{X}_1 的边缘密度为 f_{\boldsymbol{X}_1},则条件密度为
      f_{\boldsymbol{X}_2\mid \boldsymbol{X}_1}(\boldsymbol{x}_2\mid \boldsymbol{x}_1) = \frac{f(\boldsymbol{x}_1,\boldsymbol{x}_2)}{f_{\boldsymbol{X}_1}(\boldsymbol{x}_1)}.
      分母 f_{\boldsymbol{X}_1}(\boldsymbol{x}_1) 起归一化作用,使条件密度对 \boldsymbol{x}_2 积分后等于 1
    • 条件密度描述在给定 \boldsymbol{X}_1=\boldsymbol{x}_1 后,\boldsymbol{X}_2 附近的概率强度。
  2. 条件分布
    • 条件分布函数由条件密度继续积分得到。
      F_{\boldsymbol{X}_2\mid \boldsymbol{X}_1}(\boldsymbol{x}_2\mid \boldsymbol{x}_1) = \int_{-\infty}^{x_{k+1}} \cdots \int_{-\infty}^{x_d} \frac{f(\boldsymbol{x}_1,u_{k+1},\ldots,u_d)}{f_{\boldsymbol{X}_1}(\boldsymbol{x}_1)} \,du_d\cdots du_{k+1}.
    • 条件分布函数描述在给定 \boldsymbol{X}_1=\boldsymbol{x}_1 后,\boldsymbol{X}_2 落在某个区域内的概率。
    • 多元风险建模中,条件分布用于分析某些市场变量已经处于特定状态时,其余变量的风险。
  3. 独立性
    • 独立性是最强的无相依假设,若 \boldsymbol{X}_1\boldsymbol{X}_2 独立,则
      F(\boldsymbol{x}) = F_{\boldsymbol{X}_1}(\boldsymbol{x}_1)F_{\boldsymbol{X}_2}(\boldsymbol{x}_2), \qquad \forall \boldsymbol{x}.
      若存在联合密度,则等价于
      f(\boldsymbol{x}) = f_{\boldsymbol{X}_1}(\boldsymbol{x}_1)f_{\boldsymbol{X}_2}(\boldsymbol{x}_2).
      这个分解表示:知道 \boldsymbol{X}_1 的取值不会改变 \boldsymbol{X}_2 的分布。
    • 若所有分量相互独立,则联合分布完全分解为边缘分布的乘积。
      F(\boldsymbol{x}) = \prod_{j=1}^d F_j(x_j), \qquad \boldsymbol{x}\in\mathbb R^d.
      若存在联合密度,则
      f(\boldsymbol{x}) = \prod_{j=1}^d f_j(x_j).
      这个分解会把多元问题化成多个单变量问题。
    • 但在金融数据中,独立性通常过强,因为市场压力时期变量往往一起波动。
      因此多元模型的核心不是只拟合边缘分布,而是刻画边缘分布之外的相依结构。

矩、相关矩阵与样本估计

  1. 均值向量
    • 描述随机向量的位置。
      E(\boldsymbol{X}) = \boldsymbol{\mu} = (E(X_1),\ldots,E(X_d))^{\top}.
      \mu_j=E(X_j) 是第 j 个变量的中心水平。
    • 均值向量不描述变量之间的联动关系。
  2. 协方差矩阵
    • 描述二阶线性相依关系。
      \operatorname{cov}(\boldsymbol{X}) = E\left[(\boldsymbol{X}-E(\boldsymbol{X}))(\boldsymbol{X}-E(\boldsymbol{X}))^{\top}\right] = \boldsymbol{\Sigma}.
      其中
      \sigma_{ij} = \operatorname{cov}(X_i,X_j) = E\left[(X_i-E(X_i))(X_j-E(X_j))\right].
      对角线元素 \sigma_{ii}X_i 的方差。
      非对角线元素 \sigma_{ij}X_iX_j 的协方差。
    • 协方差受变量单位影响,因此不同变量之间的协方差不宜直接比较大小。
  3. 相关矩阵
    • 把协方差标准化为无量纲的线性相关系数。
      \rho_{ij} = \frac{\operatorname{cov}(X_i,X_j)} {\sqrt{\operatorname{var}(X_i)\operatorname{var}(X_j)}}.
    • 定义
      \Delta(\boldsymbol{\Sigma}) = \operatorname{diag} \left(\sqrt{\sigma_{11}},\ldots,\sqrt{\sigma_{dd}}\right),

      \mathcal P(\boldsymbol{\Sigma}) = \Delta(\boldsymbol{\Sigma})^{-1}\boldsymbol{\Sigma}\Delta(\boldsymbol{\Sigma})^{-1}.
      通常记相关矩阵为
      \boldsymbol{P}=\mathcal P(\boldsymbol{\Sigma}).
    • \boldsymbol{P} 的对角线元素为 1,非对角线元素为两两相关系数。
  4. 线性变换
    • \boldsymbol{B} 是矩阵,\boldsymbol{b} 是常向量,则
      E(\boldsymbol{B}\boldsymbol{X}+\boldsymbol{b}) = \boldsymbol{B}E(\boldsymbol{X})+\boldsymbol{b},
      \operatorname{cov}(\boldsymbol{B}\boldsymbol{X}+\boldsymbol{b}) = \boldsymbol{B}\operatorname{cov}(\boldsymbol{X})\boldsymbol{B}^{\top}.
    • 两个变量之和的方差为
      \operatorname{var}(X_1+X_2) = \operatorname{var}(X_1) + \operatorname{var}(X_2) + 2\operatorname{cov}(X_1,X_2).
    • 因此组合风险不仅取决于单个资产自身方差,也取决于资产之间的协方差。
  5. 特征函数
    • 刻画多元分布的另一种等价方式。
      \phi_{\boldsymbol{X}}(\boldsymbol{t}) = E\left(e^{i\boldsymbol{t}^{\top}\boldsymbol{X}}\right), \qquad \boldsymbol{t}\in\mathbb R^d.
      知道 \phi_{\boldsymbol{X}}(\boldsymbol{t}) 就能确定 \boldsymbol{X} 的分布。
    • 后面的正态混合分布、球形分布和椭圆分布都可以用特征函数简洁表示。
  6. 样本估计
    • 样本均值
      \bar{\boldsymbol{X}} = \frac{1}{n}\sum_{i=1}^n \boldsymbol{X}_i,
    • 样本方差
      \boldsymbol{S} = \frac{1}{n} \sum_{i=1}^n (\boldsymbol{X}_i-\bar{\boldsymbol{X}})(\boldsymbol{X}_i-\bar{\boldsymbol{X}})^{\top}.
      使用分母 n 时,
      E(\boldsymbol{S}) = \frac{n-1}{n}\boldsymbol{\Sigma}.
      因此无偏样本协方差矩阵为
      \boldsymbol{S}_u = \frac{n}{n-1}\boldsymbol{S}.
    • 样本相关矩阵
      r_{jk} = \frac{s_{jk}}{\sqrt{s_{jj}s_{kk}}}, \qquad \boldsymbol{R} = \mathcal P(\boldsymbol{S}).
      s_{jk} 是样本协方差矩阵 \boldsymbol{S} 的第 (j,k) 个元素。
      \boldsymbol{R} 用来估计总体相关矩阵 \boldsymbol{P}
      若数据厚尾或含异常值,普通样本协方差和样本相关矩阵可能不稳定。

多元正态分布与正态性检验

  1. 定义
    • 可以由标准正态向量的线性变换定义,若
      \boldsymbol{Z}\sim N_k(0,\boldsymbol{I}_k), \qquad \boldsymbol{X}\stackrel{d}{=}\boldsymbol{\mu}+\boldsymbol{A}\boldsymbol{Z},

      \boldsymbol{X}\sim N_d(\boldsymbol{\mu},\boldsymbol{\Sigma}), \qquad \boldsymbol{\Sigma}=\boldsymbol{A}\boldsymbol{A}^{\top}.
      此时
      E(\boldsymbol{X})=\boldsymbol{\mu}, \qquad \operatorname{cov}(\boldsymbol{X})=\boldsymbol{\Sigma}.
    • \boldsymbol{\mu} 控制位置,\boldsymbol{\Sigma} 控制尺度、方向和相关结构。
  2. 密度函数
    • \boldsymbol{\Sigma} 正定,则密度为
      f_{\boldsymbol{X}}(\boldsymbol{x}) = \frac{1}{(2\pi)^{\frac{d}{2}}|\boldsymbol{\Sigma}|^{\frac{1}{2}}} e^{-\frac{1}{2}(\boldsymbol{x}-\boldsymbol{\mu})^{\top}\boldsymbol{\Sigma}^{-1}(\boldsymbol{x}-\boldsymbol{\mu})}.
      指数中的二次型
      (\boldsymbol{x}-\boldsymbol{\mu})^{\top}\boldsymbol{\Sigma}^{-1}(\boldsymbol{x}-\boldsymbol{\mu})
      是马氏距离的平方。
    • 它衡量 \boldsymbol{x} 在考虑协方差结构后的离中心距离。
  3. 特征函数
    \phi_{\boldsymbol{X}}(\boldsymbol{t}) = e^{i\boldsymbol{t}^{\top}\boldsymbol{\mu}-\frac{1}{2}\boldsymbol{t}^{\top}\boldsymbol{\Sigma}\boldsymbol{t}}.
  4. 线性变换
    • \boldsymbol{X}\sim N_d(\boldsymbol{\mu},\boldsymbol{\Sigma}),则
      \boldsymbol{B}\boldsymbol{X}+\boldsymbol{b} \sim N_k(\boldsymbol{B}\boldsymbol{\mu}+\boldsymbol{b},\boldsymbol{B}\boldsymbol{\Sigma} \boldsymbol{B}^{\top}).
      特别地,对任意向量 \boldsymbol{a}
      \boldsymbol{a}^{\top}\boldsymbol{X} \sim N(\boldsymbol{a}^{\top}\boldsymbol{\mu},\boldsymbol{a}^{\top}\boldsymbol{\Sigma}\boldsymbol{a}).
    • 因此若资产损失服从多元正态,则任意线性组合的组合损失仍为正态
  5. 模拟相关风险因子
    • \boldsymbol{\Sigma}^{\frac{1}{2}}\left(\boldsymbol{\Sigma}^{\frac{1}{2}}\right)^{\top}=\boldsymbol{\Sigma},且 \boldsymbol{Z}\sim N_d(0,\boldsymbol{I}_d),则
      \boldsymbol{X} = \boldsymbol{\mu}+\boldsymbol{\Sigma}^{\frac{1}{2}}\boldsymbol{Z}
      服从 N_d(\boldsymbol{\mu},\boldsymbol{\Sigma})
    • 这一步把独立标准正态变量转换成具有指定协方差结构的多元正态变量。
  6. 多元正态性检验
    • 边缘分布是否正态
      多元正态推出每个边缘分布都是一维正态。
      多元正态也推出任意线性组合 \boldsymbol{a}^{\top}\boldsymbol{X} 都是一维正态。
      但只有边缘正态并不能推出联合分布一定是多元正态,因为相依结构仍可能不是正态型。
    • 马氏距离
      可用于检查样本点是否符合多元正态的距离结构,定义马氏距离
      D_i^2 = (\boldsymbol{X}_i-\bar{\boldsymbol{X}})^{\top}\boldsymbol{S}^{-1}(\boldsymbol{X}_i-\bar{\boldsymbol{X}}).
      若数据近似d维多元正态,样本马氏距离平方应大致符合\chi_d^2分布。
      马氏距离异常大的点是在多元相关结构下仍明显远离中心的点。
    • Mardia 检验
      从多元偏度和多元峰度检查正态性定义
      D_{ij} = (\boldsymbol{X}_i-\bar{\boldsymbol{X}})^{\top}\boldsymbol{S}^{-1}(\boldsymbol{X}_j-\bar{\boldsymbol{X}}).
      多元偏度统计量为
      b_d = \frac{1}{n^2} \sum_{i=1}^n \sum_{j=1}^n D_{ij}^3.
      多元峰度统计量为
      k_d = \frac{1}{n} \sum_{i=1}^n D_i^4.
      若偏度或峰度显著偏离多元正态下的理论行为,则说明正态假设不合适。
  7. 模型主要缺陷
    • 尾部过薄
      单变量边缘尾部过薄,会低估单个风险因子的极端损失。
      联合尾部过薄,会低估多个风险因子同时极端的概率。
    • 对称性较强
      分布对称,难以描述金融数据中常见的偏度和非对称尾部。
      因此需要引入正态混合分布和椭圆分布,作为正态模型的推广。

正态混合分布

正态方差混合分布

  1. 核心思想
    • 在正态分布外加入一个随机尺度 W,且 W\boldsymbol{Z} 独立,设
      \boldsymbol{Z}\sim N_k(0,\boldsymbol{I}_k), \qquad W\ge 0,\\ \boldsymbol{X} \stackrel{d}{=} \boldsymbol{\mu}+\sqrt W \boldsymbol{A}\boldsymbol{Z}
      \boldsymbol{X} 称为正态方差混合分布。
      \boldsymbol{\Sigma}=\boldsymbol{A}\boldsymbol{A}^{\top},则 \boldsymbol{\Sigma} 控制方向、尺度和相关结构。
    • 给定 W=w 后,\boldsymbol{X} 是普通多元正态分布。
      \boldsymbol{X}\mid W=w \sim N_d(\boldsymbol{\mu},w\boldsymbol{\Sigma}).
      W 较大时,整组变量的波动一起放大;W 较小时,整组变量的波动一起收缩。因此 W 是所有分量共享的随机波动水平。
    • 只要 W 有较大概率取到大值,无条件分布就会比正态分布有更厚的尾部
  2. 性质

    • E(W) 存在,则
      E(\boldsymbol{X})=\boldsymbol{\mu}, \qquad \operatorname{cov}(\boldsymbol{X})=E(W)\boldsymbol{\Sigma}.
      \boldsymbol{\Sigma} 不一定直接等于协方差矩阵,改称为分散矩阵,只有在 E(W)=1 时,\boldsymbol{\Sigma} 才等于 \operatorname{cov}(\boldsymbol{X})
    • 独立性
      正态方差混合中,不相关一般不推出独立。即使两个分量线性不相关,也可能因为共享同一个 W 而相依。
      只有当 W 几乎处处为常数时,模型退化为普通正态分布,此时零相关才推出独立。
    • 特征函数
      正态方差混合的特征函数由 W 的拉普拉斯变换给出,设 W 的分布为 H,其拉普拉斯变换为
      \hat H(\theta) = \int_0^\infty e^{-\theta v}\,dH(v).
      特征函数为
      \phi_{\boldsymbol{X}}(\boldsymbol{t}) = e^{i\boldsymbol{t}^{\top}\boldsymbol{\mu}} \hat H\left(\frac{1}{2}\boldsymbol{t}^{\top}\boldsymbol{\Sigma}\boldsymbol{t}\right).
      其中 \boldsymbol{t}^{\top}\boldsymbol{\Sigma}\boldsymbol{t} 来自正态部分,\hat H 决定混合后的尾部形态。
    • 密度函数
      \boldsymbol{\Sigma} 正定,则密度可以写成条件正态密度的加权平均。
      f(\boldsymbol{x}) = \int_0^\infty \frac{w^{-\frac{d}{2}}} {(2\pi)^{\frac{d}{2}}|\boldsymbol{\Sigma}|^{\frac{1}{2}}} e^{-\frac{(\boldsymbol{x}-\boldsymbol{\mu})^{\top}\boldsymbol{\Sigma}^{-1}(\boldsymbol{x}-\boldsymbol{\mu})}{2w}} \,dH(w).
      积分中的每一项都是协方差为 w\boldsymbol{\Sigma} 的正态密度,无条件密度是不同尺度正态密度的混合。
      所以正态混合不是简单改变一个正态参数,而是让正态尺度随机变化。
    • 线性变换
      正态方差混合在线性变换下封闭,若
      \boldsymbol{X}\sim M_d(\boldsymbol{\mu},\boldsymbol{\Sigma},\hat H), \qquad \boldsymbol{Y}=\boldsymbol{B}\boldsymbol{X}+\boldsymbol{b},

      \boldsymbol{Y} \sim M_k(\boldsymbol{B}\boldsymbol{\mu}+\boldsymbol{b},\boldsymbol{B}\boldsymbol{\Sigma} \boldsymbol{B}^{\top},\hat H).
      混合变量 W 的分布不变,位置参数和分散矩阵按照线性变换规则改变
  3. 模拟过程
    • 先成混合变量 W,再生成 \boldsymbol{Z}\sim N_d(0,\boldsymbol{\Sigma}),最后令
      \boldsymbol{X}=\boldsymbol{\mu}+\sqrt W \boldsymbol{Z}.
    • 这种模拟方式能生成多个分量同时放大的联合尾部波动
  4. 多元t分布
    • 多元 t 分布是正态方差混合的典型特例,设定W符合逆伽马分布
      W\sim \operatorname{Ig}\left(\frac{\nu}{2},\frac{\nu}{2}\right),
      此时
      \boldsymbol{X}=\boldsymbol{\mu}+\sqrt W \boldsymbol{A}\boldsymbol{Z},
      服从多元 t 分布,记为X\sim t_d(u,\mu,\Sigma)
      \nu 是自由度,控制尾部厚度,\nu 越小,W 取到大值的概率越高,尾部越厚
    • 协方差矩阵为
      \operatorname{cov}(\boldsymbol{X}) = \frac{\nu}{\nu-2}\boldsymbol{\Sigma}, \qquad \nu\gt 2.
      \nu\le 2 时,协方差不存在,当 \nu 增大时
      \frac{\nu}{\nu-2} \to 1,
      多元 t 分布逐渐接近多元正态分布
    • 多元 t 可以看作多元正态的厚尾推广
      多元 t 的联合尾部来自所有分量共享同一个随机尺度 W
      无条件下,W 的波动会让多个分量同时处于高波动状态,这会产生比普通正态更强的联合极端风险
  5. 广义双曲(GH)分布
    • 设定方差混合变量 W 服从广义逆高斯分布(GIG)
      W\sim N^-(\lambda,\chi,\psi) \\ \boldsymbol{X}\sim GH_d(\lambda,\chi,\psi,\boldsymbol{\mu},\boldsymbol{\Sigma}),
    • 该族提供了刻画金融收益厚尾的灵活模型。多元 (t) 分布通常是广义双曲分布族的边界特例
      \operatorname{Ig}\left(\frac{\nu}{2},\frac{\nu}{2}\right) = N^-\left( -\frac{\nu}{2}, \nu, 0 \right)
  6. 正态方差混合的缺陷
    • 解决了厚尾问题,但仍保持中心对称,因为
      \boldsymbol{X}=\boldsymbol{\mu}+\sqrt W \boldsymbol{A}\boldsymbol{Z},
      \boldsymbol{Z} 关于 0 对称,所以 \boldsymbol{X}-\boldsymbol{\mu} 关于 0 对称。
    • 若数据存在明显偏度,需要使用正态均值-方差混合。

正态均值-方差混合分布

  1. 定义
    • 正态均值-方差混合让条件均值也随 W 改变,一般形式为
      \boldsymbol{X} \stackrel{d}{=} m(W)+\sqrt W \boldsymbol{A}\boldsymbol{Z}.
      给定 W=w 后,
      \boldsymbol{X}\mid W=w \sim N_d(m(w),w\boldsymbol{\Sigma}).
      因此 W 同时影响条件均值和条件方差
    • 常用的线性均值设定为
      m(W) = \boldsymbol{\mu}+W\boldsymbol{\gamma}.
      因而
      \boldsymbol{X} \stackrel{d}{=} \boldsymbol{\mu}+W\boldsymbol{\gamma}+\sqrt W \boldsymbol{A}\boldsymbol{Z}.
      \boldsymbol{\gamma} 是偏度方向参数,当 W 较大时,分布不仅尺度变大,中心还会沿 \boldsymbol{\gamma} 的方向移动,这使模型能够刻画非对称厚尾
      \boldsymbol{\gamma}=0 时,正态均值-方差混合退化为正态方差混合,此时
      \boldsymbol{X}=\boldsymbol{\mu}+\sqrt W \boldsymbol{A}\boldsymbol{Z}.
      分布重新关于 \boldsymbol{\mu} 对称。
      \boldsymbol{\gamma}\ne0 时,分布通常不再是椭圆分布
    • 若一阶矩和二阶矩存在,则
      E(\boldsymbol{X}) = \boldsymbol{\mu}+E(W)\boldsymbol{\gamma},
      \operatorname{cov}(\boldsymbol{X}) = E(W)\boldsymbol{\Sigma} + \operatorname{var}(W)\boldsymbol{\gamma}\boldsymbol{\gamma}^{\top}.
      第一项来自条件正态波动,第二项来自随机均值 W\boldsymbol{\gamma} 的波动。
    • 因此协方差不仅由 \boldsymbol{\Sigma} 决定,也由偏度方向 \boldsymbol{\gamma} 决定。
  2. 广义双曲分布族
    • 广义双曲分布族也可以通过正态均值-方差混合构造,若
      \boldsymbol{X}\sim GH_d(\lambda,\chi,\psi,\boldsymbol{\mu},\boldsymbol{\Sigma},\boldsymbol{\gamma}),

      \boldsymbol{B}\boldsymbol{X}+\boldsymbol{b} \sim GH_k(\lambda,\chi,\psi,\boldsymbol{B}\boldsymbol{\mu}+\boldsymbol{b},\boldsymbol{B}\boldsymbol{\Sigma} \boldsymbol{B}^{\top},\boldsymbol{B}\boldsymbol{\gamma}).
      因此广义双曲族在线性组合下封闭,适合组合风险建模。
    • 其中 \boldsymbol{\gamma} 控制偏度,\boldsymbol{\Sigma} 控制分散结构,混合变量控制尾部厚度。

球形与椭圆分布

从球形分布到椭圆分布

  1. 球形分布
    • 旋转不变性
      球形分布的核心特征是旋转不变性,对任意正交矩阵 \boldsymbol{U},都有
      \boldsymbol{U}\boldsymbol{X} \stackrel{d}{=} \boldsymbol{X}, \qquad \boldsymbol{U}\boldsymbol{U}^{\top}=\boldsymbol{U}^{\top}\boldsymbol{U}=\boldsymbol{I}_d,
      旋转不变表示分布没有特殊方向,因此球形分布的等密度轮廓以原点为中心,并具有球面对称性
    • 特征函数
      球形分布的特征函数只依赖于 \boldsymbol{t}^{\top}\boldsymbol{t}
      \phi_{\boldsymbol{X}}(\boldsymbol{t}) = \psi(\boldsymbol{t}^{\top}\boldsymbol{t}) = \psi(t_1^2+\cdots+t_d^2).
      \psi 称为生成元,\boldsymbol{t}^{\top}\boldsymbol{t} 只表示向量 \boldsymbol{t} 的长度平方,不包含方向信息。
      由此可知标准多元正态是球形分布
      \phi_{\boldsymbol{X}}(\boldsymbol{t}) = e^{-\frac{1}{2}\boldsymbol{t}^{\top}\boldsymbol{t}}. \\ \psi(u) = e^{-\frac{1}{2}u}.
    • 线性组合
      球形分布的任意线性组合只由系数向量长度决定
      \boldsymbol{a}^{\top}\boldsymbol{X} \stackrel{d}{=} \|\boldsymbol{a}\|X_1.
      若两个向量 \boldsymbol{a}\boldsymbol{b} 有相同长度,则 \boldsymbol{a}^{\top}\boldsymbol{X}\boldsymbol{b}^{\top}\boldsymbol{X} 同分布,这说明球形分布中没有方向差异,只有径向距离差异
    • 径向变量
      球形分布可以写成径向变量与随机方向的乘积。
      \boldsymbol{X} \stackrel{d}{=} R\boldsymbol{S}.
      R=\|\boldsymbol{X}\|\ge0 是径向变量,表示离原点多远。\boldsymbol{S} 在单位球面上均匀分布,表示方向。R\boldsymbol{S} 独立。
      因此球形分布可以理解为先随机选择距离,再随机选择方向。
    • 正态方差混合
      球形正态方差混合仍然是球形分布,若
      \boldsymbol{X} \stackrel{d}{=} \sqrt W \boldsymbol{Z}, \qquad \boldsymbol{Z}\sim N_d(0,\boldsymbol{I}_d),

      \phi_{\boldsymbol{X}}(\boldsymbol{t}) = \hat H\left(\frac{1}{2}\boldsymbol{t}^{\top}\boldsymbol{t}\right) \\ \psi(u) = \hat H\left(\frac{1}{2}u\right).
      随机尺度 W 改变径向分布,但不改变方向均匀性
  2. 椭圆分布
    • 定义
      椭圆分布是球形分布经过平移和线性变换得到的分布,若
      \boldsymbol{Y}\sim S_k(\psi), \qquad \boldsymbol{X} \stackrel{d}{=} \boldsymbol{\mu}+\boldsymbol{A}\boldsymbol{Y},
      则称 \boldsymbol{X} 服从椭圆分布,记为
      \boldsymbol{X}\sim E_d(\boldsymbol{\mu},\boldsymbol{\Sigma},\psi), \qquad \boldsymbol{\Sigma}=\boldsymbol{A}\boldsymbol{A}^{\top}.
      \boldsymbol{\mu} 是位置参数,\boldsymbol{\Sigma} 是分散矩阵,控制椭圆的方向和相对尺度,\psi 是生成元,控制径向分布和尾部形态
    • 几何含义
      球形分布的等值面经线性变换后变成椭球面
      矩阵 \boldsymbol{A} 会拉伸、压缩和旋转球形分布。
      位置参数 \boldsymbol{\mu} 把中心从原点移动到 \boldsymbol{\mu}
    • 径向表示
      \boldsymbol{X} \stackrel{d}{=} \boldsymbol{\mu}+R\boldsymbol{A}\boldsymbol{S}.
      R\ge0 控制离中心的距离。\boldsymbol{S} 是单位球面上的随机方向。\boldsymbol{A} 把球形方向变成椭圆方向。
      因此椭圆分布可以拆成中心、半径和方向结构三部分。
    • 多元正态和多元 t 都属于椭圆分布

椭圆分布的基本性质

  1. 线性变换
    • 椭圆分布在线性变换下封闭,若
      \boldsymbol{X}\sim E_d(\boldsymbol{\mu},\boldsymbol{\Sigma},\psi), \qquad \boldsymbol{Y}=\boldsymbol{B}\boldsymbol{X}+\boldsymbol{b},

      \boldsymbol{Y} \sim E_k(\boldsymbol{B}\boldsymbol{\mu}+\boldsymbol{b},\boldsymbol{B}\boldsymbol{\Sigma} \boldsymbol{B}^{\top},\psi).
      特别地,任意线性组合仍是一维椭圆分布:
      \boldsymbol{a}^{\top}\boldsymbol{X} \sim E_1(\boldsymbol{a}^{\top}\boldsymbol{\mu},\boldsymbol{a}^{\top}\boldsymbol{\Sigma}\boldsymbol{a},\psi).
    • 这使椭圆分布适合描述投资组合的线性风险。
  2. 边缘分布
    • 椭圆分布的边缘分布仍然是椭圆分布若
      \boldsymbol{\mu} = \begin{pmatrix} \boldsymbol{\mu}_1\\ \boldsymbol{\mu}_2 \end{pmatrix}, \qquad \boldsymbol{\Sigma} = \begin{pmatrix} \boldsymbol{\Sigma}_{11} & \boldsymbol{\Sigma}_{12}\\ \boldsymbol{\Sigma}_{21} & \boldsymbol{\Sigma}_{22} \end{pmatrix},

      \boldsymbol{X}_1 \sim E_k(\boldsymbol{\mu}_1,\boldsymbol{\Sigma}_{11},\psi),
      \boldsymbol{X}_2 \sim E_{d-k}(\boldsymbol{\mu}_2,\boldsymbol{\Sigma}_{22},\psi).
    • 因此从椭圆随机向量中取出部分分量,不会离开椭圆分布族。
  3. 条件分布
    • 椭圆分布的条件分布通常仍然是椭圆分布,但生成元可能改变
      对多元正态分布,条件分布仍然是正态分布,且形式特别简单。
      对一般椭圆分布,条件分布仍保持椭圆形态,但径向生成元会随条件变化。
    • 因此椭圆族具有封闭性,但不一定像正态族那样完全简单。
  4. 二次型
    • 椭圆分布中的二次型对应径向变量,若 \boldsymbol{\Sigma} 可逆,则
      Q = (\boldsymbol{X}-\boldsymbol{\mu})^{\top}\boldsymbol{\Sigma}^{-1}(\boldsymbol{X}-\boldsymbol{\mu}) \stackrel{d}{=} R^2.
      对多元正态分布,
      R^2\sim \chi_d^2.
      对多元 t 分布,
      \frac{R^2}{d} \sim F(d,\nu).
    • 因此不同椭圆分布的主要差别体现在径向变量 R 的尾部。
  5. 极端区域
    • 椭圆分布在椭圆半径定义的极端区域内保持相关结构
      \rho\left\{\boldsymbol{X}\mid (\boldsymbol{X}-\boldsymbol{\mu})^{\top}\boldsymbol{\Sigma}^{-1}(\boldsymbol{X}-\boldsymbol{\mu})\ge c\right\} = \rho(\boldsymbol{X}).
      该性质来自椭圆分布的方向结构稳定性,这表示按椭圆半径筛选极端观测时,相关矩阵保持不变
    • 但它也说明普通椭圆模型对非对称尾部相依的刻画有限

椭圆分布的稳健估计

  1. 椭圆分布中的 \boldsymbol{\Sigma} 应理解为分散矩阵,不一定直接等于协方差矩阵。
    • 若二阶矩存在,则
      \operatorname{cov}(\boldsymbol{X}) = c\boldsymbol{\Sigma}
      对某个常数 c\gt0 成立。
    • 若二阶矩不存在,协方差矩阵没有定义,但分散矩阵 \boldsymbol{\Sigma} 仍可作为椭圆形状参数。
    • 因此厚尾椭圆模型中,直接用样本协方差估计相依结构可能不稳健。
  2. 椭圆分布可以用基于马氏距离的 M 估计来估计位置和分散矩阵。
    • 在第 k 次迭代中,先计算
      D_i^2 = (\boldsymbol{X}_i-\hat{\boldsymbol{\mu}}^{[k]})^{\top} \left(\hat{\boldsymbol{\Sigma}}^{[k]}\right)^{-1} (\boldsymbol{X}_i-\hat{\boldsymbol{\mu}}^{[k]}).
    • 再更新位置参数:
      \hat{\boldsymbol{\mu}}^{[k+1]} = \frac{\sum_{i=1}^n w_1(D_i)\boldsymbol{X}_i} {\sum_{i=1}^n w_1(D_i)}.
    • 更新分散矩阵:
      \hat{\boldsymbol{\Sigma}}^{[k+1]} = \frac{1}{n} \sum_{i=1}^n w_2(D_i^2) (\boldsymbol{X}_i-\hat{\boldsymbol{\mu}}^{[k]})(\boldsymbol{X}_i-\hat{\boldsymbol{\mu}}^{[k]})^{\top}.
  3. 权重函数决定估计量如何处理远离中心的观测。
    • 对多元 t 型估计,常用权重为
      w_1(x) = \frac{d+\nu}{x+\nu}.
    • 对应地,
      w_2(x^2) = \frac{d+\nu}{x+\nu}.
    • 马氏距离越大的观测权重越小,因此极端观测对估计结果的影响被削弱。
  4. Kendall 秩相关可以用于稳健估计椭圆分布中的线性相关参数。
    • 对二维椭圆分布,有
      \rho_\tau(X_1,X_2) = \frac{2}{\pi}\arcsin(\rho),
      其中
      \rho = \frac{\sigma_{12}}{\sqrt{\sigma_{11}\sigma_{22}}}.
    • 因此可以反解出
      \rho = \sin\left(\frac{\pi}{2}\rho_\tau(X_1,X_2)\right).
    • Kendall 秩相关基于排序信息,比普通样本相关更不容易被极端值破坏。

Copula

Copula介绍

Copula理论

  1. Copula的思想
    • 多元联合分布同时包含两部分信息:
      每个变量自身的分布,即边缘分布 F_1,\ldots,F_d
      变量之间如何共同变化,即相依结构。
    • Copula 用来把边缘分布相依结构分开处理,使得边缘模型和相依模型可以分开建模。
  2. Copula函数
    • 定义
      一个 d 维 Copula 是定义在 [0,1]^d 上、所有边缘分布都是标准均匀分布的联合分布函数。
      C(\boldsymbol{u}) = C(u_1,\ldots,u_d), \qquad C:[0,1]^d\to[0,1].
      如果
      \boldsymbol{U}=(U_1,\ldots,U_d)^{\top}
      的联合分布函数为 C,且每个 U_i\sim U(0,1),则 C 就是 \boldsymbol{U} 的 Copula。
      Copula 的自变量 u_i 是概率尺度上的分位水平,而不是原始损失或收益值
    • 边界性质
      若某个 u_i=0,则
      C(u_1,\ldots,u_d)=0.
      因为至少一个事件 U_i\le0 的概率为 0
      对任意 i
      C(1,\ldots,1,u_i,1,\ldots,1)=u_i.
      这表示每一个边缘分布都是标准均匀分布。
    • 矩形概率非负
      对所有 a_i\le b_i,有
      P(a_1\le U_1\le b_1,\ldots,a_d\le U_d\le b_d)\ge0.
      用 Copula 写成差分形式就是
      \sum_{i_1=1}^{2}\cdots\sum_{i_d=1}^{2} (-1)^{i_1+\cdots+i_d} C(u_{1i_1},\ldots,u_{di_d})\ge0,
      其中
      u_{j1}=a_j, \qquad u_{j2}=b_j.
      这条性质保证 C 真的能作为一个多元分布函数。
    • 边缘分布
      Cd 维 Copula,取其中任意 k 个分量,得到的 k 维边缘分布仍是 Copula。
      这说明 Copula 结构在边缘化时保持一致
  3. Sklar 定理
    • 广义反函数
      分布函数 F 的广义反函数定义为
      F^{\leftarrow}(u) = \inf\{x:F(x)\ge u\}.
      等价关系
      F^{\leftarrow}(u)\lt x\quad\Leftrightarrow\quad u\lt F(x) \\ F^{\leftarrow}(U)\lt x\quad\Leftrightarrow\quad U\lt F(x)
      U\sim U(0,1),则
      P(F^{\leftarrow}(U)\le x) = P(U\le F(x)) = F(x)
      F^{\leftarrow}(U)\sim F
    • Sklar 定理
      任意多元联合分布都可以分解为边缘分布和 Copula,若 F\boldsymbol{X} 的联合分布函数,边缘分布为 F_1,\ldots,F_d,则存在 Copula C,使得
      F(x_1,\ldots,x_d) = C(F_1(x_1),\ldots,F_d(x_d)).
      若所有边缘分布连续,则该 Copula 唯一,对离散分布,Copula 不一定唯一
      这说明连续情形下,相依结构可以由唯一 Copula 表示
    • 从联合分布中抽取Copula
      联合分布已知时,可以得到Copula
      C(u_1,\ldots,u_d) = F\left( F_1^{\leftarrow}(u_1),\ldots,F_d^{\leftarrow}(u_d) \right).
      若令 U_i=F_i(X_i),则
      \boldsymbol{U} = (F_1(X_1),\ldots,F_d(X_d))^{\top}
      的分布函数就是 \boldsymbol{X} 的 Copula
    • 从Copula构建联合分布
      给定 Copula C 和一维边缘分布 F_1,\ldots,F_d,定义
      F(x_1,\ldots,x_d) = C(F_1(x_1),\ldots,F_d(x_d)).
      这样得到的 F 是一个联合分布,边缘分布正是 F_1,\ldots,F_d,这就是 meta 分布的基本构造思想。
      例如,使用高斯 Copula 构造的分布称为 meta-Gaussian 分布。
  4. Copula的性质
    • Copula 在严格递增边缘变换下保持不变。
      \boldsymbol{X} 具有连续边缘和 Copula C,且每个 T_i 严格递增,则
      (T_1(X_1),\ldots,T_d(X_d))^{\top}
      仍具有同一个 Copula C
      严格递增变换只改变边缘尺度,不改变排序和分位水平。
      因此 Copula 描述的是单调变换不变的相依结构
    • Fréchet 界给出任意 Copula 的上下边界。
      \max\left(\sum_{i=1}^d u_i+1-d,0\right) \le C(\boldsymbol{u}) \le \min(u_1,\ldots,u_d).
      上界表示所有事件最大程度同时发生。
      下界来自并集概率不超过 1
      二维时,下界本身也是 Copula;高维时该下界一般不一定是 Copula。
    • 对一般联合分布,也有对应的 Fréchet 界。
      \max\left(\sum_{i=1}^d F_i(x_i)+1-d,0\right) \le F(\boldsymbol{x}) \le \min(F_1(x_1),\ldots,F_d(x_d)).
      这个界说明:只知道边缘分布时,联合分布只能被限制在一个范围内。
      Copula 的选择决定联合分布在这个范围内的具体位置。
  5. 常用Copula
    • 显式与隐式Copula
      显式Copula: 直接写出相依结构的函数形式
      隐式Copula: 先有多元分布,再从它里面抽出相依结构
    • 独立 Copula 描述变量相互独立
      \Pi(u_1,\ldots,u_d) = \prod_{i=1}^d u_i.
      连续随机变量相互独立,当且仅当其 Copula 为 \Pi
      独立 Copula 没有尾部共同极端结构
    • 共单调 Copula 描述完全正相依。
      M(\boldsymbol{u}) = \min(u_1,\ldots,u_d).
      它等于 Fréchet 上界。
      \boldsymbol{U}=(U,\ldots,U)^{\top},其中 U\sim U(0,1),则 \boldsymbol{U} 的 Copula 就是 M
      共单调表示所有变量在分位数尺度上完全同向移动。
    • 二维反单调 Copula 描述完全负相依。
      W(u_1,u_2) = \max(u_1+u_2-1,0).
      它是二维 Fréchet 下界。
      \boldsymbol{U}=(U,1-U)^{\top},则其 Copula 为 W
      反单调只在二维中具有完整的 Copula 下界意义。
    • 高斯 Copula 由多元正态分布抽取。

      \boldsymbol{Y}\sim N_d(\boldsymbol{\mu},\boldsymbol{\Sigma}),
      其 Copula 只依赖相关矩阵
      \boldsymbol{P}=\rho(\boldsymbol{\Sigma}).
      高斯 Copula 定义为
      C_{\boldsymbol{P}}^{\mathrm{Ga}}(\boldsymbol{u}) = \Phi_{\boldsymbol{P}} \left( \Phi^{-1}(u_1),\ldots,\Phi^{-1}(u_d) \right).
      其中 \Phi 是一维标准正态分布函数,\Phi_{\boldsymbol{P}} 是相关矩阵为 \boldsymbol{P} 的多元正态分布函数。
    • t Copula 由多元 t 分布抽取。
      C_{\nu,\boldsymbol{P}}^{t}(\boldsymbol{u}) = t_{\nu,\boldsymbol{P}} \left( t_\nu^{-1}(u_1),\ldots,t_\nu^{-1}(u_d) \right).
      t_\nu 是一维标准 t 分布函数。
      t_{\nu,\boldsymbol{P}}t_d(\nu,\boldsymbol{0},\boldsymbol{P}) 的联合分布函数。
      \nu\lt\infty 时,即使 \boldsymbol{P}=\boldsymbol{I}_dt Copula 通常也不是独立 Copula,因为多元 t 的分量共享随机尺度。
    • Gumbel Copula 是典型显式 Copula。
      C_\theta^{\mathrm{Gu}}(u_1,u_2) = e^{ -\left( (-\ln u_1)^\theta+(-\ln u_2)^\theta \right)^{\frac{1}{\theta}} }, \qquad 1\le\theta\lt\infty.
      \theta=1 时为独立 Copula。
      \theta\to\infty 时趋向共单调 Copula。
      Gumbel Copula 具有上尾相依
    • Clayton Copula 也是典型显式 Copula。
      C_\theta^{\mathrm{Cl}}(u_1,u_2) = (u_1^{-\theta}+u_2^{-\theta}-1)^{-\frac{1}{\theta}}, \qquad 0\le\theta\lt\infty.
      \theta=0 按极限解释为独立 Copula。
      \theta\to\infty 时趋向共单调 Copula。
      Clayton Copula 常用于描述下尾相依
  6. 隐式Copula
    • 步骤
      先生成
      \boldsymbol{X}\sim F
      F 的边缘分布连续,则返回
      \boldsymbol{U} = (F_1(X_1),\ldots,F_d(X_d))^{\top}
      此时 \boldsymbol{U} 的分布就是 F 对应的 Copula
    • 高斯 Copula 的模拟步骤
      生成
      \boldsymbol{Z}\sim N_d(\boldsymbol{0},\boldsymbol{P}).
      返回
      \boldsymbol{U} = (\Phi(Z_1),\ldots,\Phi(Z_d))^{\top}.
      得到的 \boldsymbol{U} 服从 C_{\boldsymbol{P}}^{\mathrm{Ga}}
    • t Copula 的模拟步骤
      生成
      \boldsymbol{X}\sim t_d(\nu,\boldsymbol{0},\boldsymbol{P}).
      返回
      \boldsymbol{U} = (t_\nu(X_1),\ldots,t_\nu(X_d))^{\top}.
      得到的 \boldsymbol{U} 服从 C_{\nu,\boldsymbol{P}}^{t}
  7. Copula 密度
    • 若 Copula 绝对连续,则
      c(\boldsymbol{u}) = \frac{\partial^d C(\boldsymbol{u})} {\partial u_1\cdots\partial u_d}.
    • 若联合密度为 f,边缘密度为 f_i,且边缘连续严格递增,则
      c(\boldsymbol{u}) = \frac{ f(F_1^{-1}(u_1),\ldots,F_d^{-1}(u_d)) } { f_1(F_1^{-1}(u_1))\cdots f_d(F_d^{-1}(u_d)) }.
    • 分母去掉边缘密度的影响,剩下的就是纯粹的相依密度。
  8. 生存Copula
    • 用来刻画联合生存函数
      \boldsymbol{X} 的联合生存函数为 \bar F,边缘生存函数为
      \bar F_i(x_i)=1-F_i(x_i),

      \bar F(x_1,\ldots,x_d) = \hat C(\bar F_1(x_1),\ldots,\bar F_d(x_d)).
      \hat C 称为生存 Copula,用于描述多个变量同时处于上尾区域的概率。
    • 生存 Copula 是 1-\boldsymbol{U} 的分布函数。
      \boldsymbol{U} 的 Copula 为 C,则 1-\boldsymbol{U} 的分布函数就是 C 的生存 Copula,二维时有
      \hat C(1-u_1,1-u_2) = 1-u_1-u_2+C(u_1,u_2).
      生存 Copula 不等于 Copula 的生存函数;Copula 的生存函数通常不是 Copula。
    • 径向对称 Copula 满足生存 Copula 等于原 Copula。

      \boldsymbol{U} \stackrel{d}{=} \boldsymbol{1}-\boldsymbol{U},
      则 Copula 关于 (0.5,\ldots,0.5)^{\top} 径向对称。
      此时生存 Copula 与原 Copula 相同。
      椭圆分布产生的 Copula 常具有这类对称性
    • 可交换性描述变量顺序对 Copula 没有影响。
      若对任意排列 \pi
      C(u_1,\ldots,u_d) = C(u_{\pi(1)},\ldots,u_{\pi(d)}),
      则称 Copula 可交换。
      Gumbel、Clayton 是可交换 Copula。高斯和 t Copula 在等相关矩阵
      \boldsymbol{P} = \rho\boldsymbol{J}_d+(1-\rho)\boldsymbol{I}_d, \qquad \rho\ge -\frac{1}{d-1},
      下也可交换

相依性度量

  1. 完全相依
    • 包括共单调与反单调两种情况
    • 共单调
      表示变量在分位数尺度上完全同向,此时组合不能通过分散化降低尾部风险
      随机变量 X_1,\ldots,X_d 共单调,当且仅当其 Copula 为
      M(\boldsymbol{u}) = \min(u_1,\ldots,u_d).
      共单调变量共享同一个风险驱动因素,可以表示为同一个随机变量的递增函数
      (X_1,\ldots,X_d)^{\top} \stackrel{d}{=} (v_1(Z),\ldots,v_d(Z))^{\top},
      其中 v_1,\ldots,v_d 都是递增函数,二维情形可以写成
      X_2=T(X_1)\quad a.s.
      其中 T 递增
      共单调性带来分位数加性,若 0\lt\alpha\lt1,且 X_1,\ldots,X_d 共单调,则
      F_{X_1+\cdots+X_d}^{\leftarrow}(\alpha) = F_1^{\leftarrow}(\alpha)+\cdots+F_d^{\leftarrow}(\alpha).
      这个性质说明:在完全正相依下,组合损失的分位数等于各损失分位数之和,因此共单调结构常对应风险聚合中的极端保守情形
    • 反单调
      反单调是二维完全负相依。二维随机变量 X_1,X_2 反单调,当且仅当其 Copula 为
      W(u_1,u_2)=\max(u_1+u_2-1,0).
      等价地,存在随机变量 Z,使得
      (X_1,X_2)^{\top} \stackrel{d}{=} (v_1(Z),v_2(Z))^{\top},
      其中一个 v_i 递增,另一个递减。
      若边缘连续,则反单调等价于 X_2 几乎处处是 X_1 的递减函数。
  2. Pearson线性相关系数
    • 定义
      \rho(X_1,X_2) = \frac{\operatorname{cov}(X_1,X_2)} {\sqrt{\operatorname{var}(X_1)\operatorname{var}(X_2)}}.
      只刻画线性相依,独立推出 \rho=0,但 \rho=0 不推出独立
    • 完全线性相关对应仿射关系
      |\rho|=1,则存在 \alpha\in\mathbb R\beta\ne0,使得
      X_2=\alpha+\beta X_1\quad a.s.
      \beta\gt0 对应完全正线性相关。\beta\lt0 对应完全负线性相关。
    • 正比例尺度变换不变
      \beta_1,\beta_2\gt0,则
      \rho(\alpha_1+\beta_1X_1,\alpha_2+\beta_2X_2) = \rho(X_1,X_2).
      它不依赖变量单位,但依赖二阶矩
    • 关于Copula
      只用边缘分布和相关系数不能确定联合分布,可以构造不同的Copula具有相同的相关系数
      给定边缘后,相关系数不一定能取遍整个,最小值由反单调结构达到,最大值由共单调结构达到
      Hoeffding 协方差恒等式说明协方差依赖整个联合分布。
      \operatorname{cov}(X_1,X_2) = \int_{-\infty}^{\infty}\int_{-\infty}^{\infty} \left( F(x_1,x_2)-F_1(x_1)F_2(x_2) \right) \,dx_1\,dx_2.
      因此相关系数依赖联合分布,而不是只由边缘分布决定
  3. 秩相关系数
    • 秩相关只依赖 Copula,不依赖边缘尺度
      它使用排序信息,不使用观测值的具体大小。
      因此秩相关对严格递增变换不变。
      在 Copula 建模中,秩相关常用于参数校准。
    • Kendall tau
      定义为协同概率减去逆同概率
      \rho_\tau(X_1,X_2) = P\left((X_1-\tilde X_1)(X_2-\tilde X_2)\gt0\right) - P\left((X_1-\tilde X_1)(X_2-\tilde X_2)\lt0\right).
      等价的
      \rho_\tau = E\left[ \operatorname{sign} \left( (X_1-\tilde X_1)(X_2-\tilde X_2) \right) \right].
      或者写成 Copula 泛函
      \rho_\tau = 4\int_0^1\int_0^1 C(u_1,u_2)\,dC(u_1,u_2)-1.
      这说明 Kendall tau 只由 Copula 决定
    • Spearman rho
      先把变量变成它们在各自边缘分布中的分位水平,再计算分位数的Pearson线性相关
      \rho_S(X_1,X_2) = \rho(F_1(X_1),F_2(X_2)).
      可以写成 Copula 泛函
      \rho_S = 12\int_0^1\int_0^1 \left(C(u_1,u_2)-u_1u_2\right) \,du_1du_2.
      独立 Copula 下 C(u_1,u_2)=u_1u_2,因此 \rho_S=0。但 \rho_S=0 不推出独立。
    • Kendall tau 和 Spearman rho 的极值对应完全相依。
      二者取值都在 [-1,1] 内。取 1 当且仅当共单调。取 -1 当且仅当反单调。
      对任意连续边缘,可以通过 Fréchet 上下界的凸组合构造任意目标秩相关。
  4. 尾部相依系数
    • 定义
      Pearson 相关和秩相关主要描述整体相依,尾部相依关注的是:一个变量已经极端时,另一个变量是否也容易极端
      它只依赖 Copula,因此是 Copula 层面的相依度量
    • 上尾相依系数
      定义为高分位超过事件的极限条件概率。
      \lambda_u = \lim_{q\to1^-} P\left( X_2\gt F_2^{\leftarrow}(q) \mid X_1\gt F_1^{\leftarrow}(q) \right).
      连续边缘下,上尾相依可以直接用 Copula 表示为
      \lambda_u = \lim_{q\to1^-} \frac{1-2q+C(q,q)}{1-q}
      \lambda_u\in(0,1],称为上尾相依。若 \lambda_u=0,称为上尾渐近独立。
    • 下尾相依系数
      定义为低分位共同落入事件的极限条件概率。
      \lambda_l = \lim_{q\to0^+} P\left( X_2\le F_2^{\leftarrow}(q) \mid X_1\le F_1^{\leftarrow}(q) \right).
      连续边缘下,下尾相依可以直接用 Copula 表示为
      \lambda_l = \lim_{q\to0^+} \frac{C(q,q)}{q}.
      \lambda_l\in(0,1],称为下尾相依。若 \lambda_l=0,称为下尾渐近独立
    • Gumbel Copula 具有上尾相依。
      对 Gumbel Copula,有
      C_{\theta}^{\mathrm{Gu}}(u,u) = u^{2^{\frac{1}{\theta}}}.
      可得上尾相依系数为
      \lambda_u = 2-2^{\frac{1}{\theta}}.
      \theta\gt1 时,\lambda_u\gt0
    • 高斯 Copula 在非完全相关时上下尾都渐近独立。
      若二维高斯 Copula 的相关系数为 \rho\lt1,则
      \lambda = 2\lim_{x\to-\infty} \Phi\left( x\sqrt{\frac{1-\rho}{1+\rho}} \right) = 0.
      即使 \rho 很高,在足够极端的尾部,高斯 Copula 的共同极端概率仍趋向渐近独立。
    • t Copula 具有上下尾相依。
      二维 t Copula 中,若相关参数为 \rho\gt-1,则
      \lambda = 2t_{\nu+1} \left( -\sqrt{ \frac{(\nu+1)(1-\rho)}{1+\rho} } \right).
      自由度 \nu 越小,尾部越厚,尾部相依越强。
      这就是相同相关系数下,t Copula 比高斯 Copula 更容易产生联合极端事件的原因。

改进Copula

正态混合 Copula

  1. 定义
    • 正态混合分布具有厚尾和共同波动尺度,因此对应的 Copula 常能描述联合尾部风险
      \boldsymbol{X} = \boldsymbol{\mu} + \sqrt W\boldsymbol{A}\boldsymbol{Z}.
    • 在市场风险和信用风险建模中,正态混合 Copula 比高斯 Copula 更适合刻画共同极端。
    • t Copula 是最重要的正态方差混合 Copula
  2. 尾部相依
    • t Copula为例,二维 t Copula 的尾部相依系数为
      \lambda = 2t_{\nu+1} \left( -\sqrt{ \frac{(\nu+1)(1-\rho)}{1+\rho} } \right).
      \rho\gt-1 时,\lambda\gt0\nu 越小,尾部越厚,\lambda 越大。
    • 因此正态混合Copula能表达“市场压力时期多个变量同时极端”的现象。
  3. 秩相关
    • 椭圆 Copula 中 Kendall tau 与线性相关参数有简单关系。
      若二维椭圆 Copula 的相关参数为 \rho,则
      \rho_\tau = \frac{2}{\pi}\arcsin(\rho).
      因此可以反解为
      \rho = \sin\left(\frac{\pi}{2}\rho_\tau\right).
      这个关系对高斯 Copula 和 t Copula 都成立。
    • 高斯 Copula 中 Spearman rho 也有闭式关系。
      \rho_S = \frac{6}{\pi} \arcsin\left(\frac{\rho}{2}\right).
      \rho 不太极端时,\rho_S\rho 数值接近。
      因此 Spearman 样本相关常被用作高斯 Copula 相关矩阵的快速估计
    • 正态方差混合 Copula 的 Spearman rho 一般依赖混合变量。

      \boldsymbol{X}\sim M_2(\boldsymbol{0},\boldsymbol{P},\hat H),

      \rho_S = \frac{6}{\pi} E\left[ \arcsin\left( \frac{\rho W} {\sqrt{(W+\tilde W)(W+\bar W)}} \right) \right].
      其中 W,\tilde W,\bar W 相互独立且同分布。
      这说明 Spearman rho 不只取决于 \rho,还取决于混合变量分布。
    • t Copula,Spearman rho 可以用模拟近似。
      \rho_S \approx \frac{6}{m\pi} \sum_{j=1}^{m} \arcsin\left( \frac{\rho W_j} {\sqrt{(W_j+\tilde W_j)(W_j+\bar W_j)}} \right).
      W_j,\tilde W_j,\bar W_j 取自逆 Gamma 混合分布。
      自由度较小时,Spearman 与线性相关参数之间的差异会更明显。

偏斜正态混合 Copula

  1. 偏斜正态混合 Copula 来自非椭圆对称的正态混合分布。
    • 典型形式为
      \boldsymbol{X} = \boldsymbol{\mu} + W\boldsymbol{\gamma} + \sqrt W\boldsymbol{A}\boldsymbol{Z}.
    • \boldsymbol{\gamma} 控制偏斜方向。
    • \boldsymbol{\gamma}\ne\boldsymbol{0} 时,Copula 不再具有椭圆对称性。
  2. 偏斜 t Copula 可以由 GH 分布构造。

    • \boldsymbol{X} \sim GH_d\left( -\frac{\nu}{2},\nu,0, \boldsymbol{\mu},\boldsymbol{\Sigma},\boldsymbol{\gamma} \right),
      则其 Copula 依赖于 \nu\boldsymbol{P}=\rho(\boldsymbol{\Sigma}) 和偏斜参数 \boldsymbol{\gamma}
    • 常记为
      C_{\nu,\boldsymbol{P},\boldsymbol{\gamma}}^{t}.
  3. 偏斜 t Copula 的模拟步骤是:
    • 生成
      \boldsymbol{X} \sim GH_d\left( -\frac{\nu}{2},\nu,0, \boldsymbol{0},\boldsymbol{P},\boldsymbol{\gamma} \right).
    • F_i 为对应一维边缘分布。
    • 返回
      \boldsymbol{U} = (F_1(X_1),\ldots,F_d(X_d))^{\top}.

分组 t Copula

  1. 分组 t Copula 允许不同变量组具有不同自由度。
    • 普通 t 分布使用一个共同混合变量 W
    • 分组 t Copula 将变量划分为不同组,每组使用不同自由度 \nu_k 的混合变量。
    • 不同组可具有不同强度的尾部相依。
  2. 分组 t Copula 的模拟思想是:
    • 生成
      \boldsymbol{Z}\sim N_d(\boldsymbol{0},\boldsymbol{P}), \qquad U\sim U(0,1).
    • 对第 k 组令
      W_k=G_{\nu_k}^{-1}(U),
      其中 G_\nu\operatorname{Ig}(\nu/2,\nu/2) 的分布函数。
    • 组内变量使用对应的 \sqrt{W_k} 缩放,再做边缘概率变换得到 Copula 样本。

阿基米德 Copula

  1. 定义
    • 阿基米德 Copula 用一个单变量生成元构造多元相依结构。
      \psi:[0,\infty)\to[0,1] 递减、连续,且
      \psi(0)=1, \qquad \lim_{t\to\infty}\psi(t)=0.
      二维阿基米德 Copula 写为
      C(u_1,u_2) = \psi\left( \psi^{-1}(u_1)+\psi^{-1}(u_2) \right).
      它是 Copula 当且仅当 \psi 凸。
    • 生成元 \psi 决定整个 Copula 族。
      \psi 把“累积相依尺度”映射回概率尺度。
      \psi^{-1}(u_i) 把每个边缘概率转换到生成元尺度。
      再把这些尺度相加,得到联合概率。
    • 例子1: Gumbel Copula
      \begin{aligned} &C_\theta^{\mathrm{Gu}}(u_1,u_2) = e^{- \left[ (-\ln u_1)^\theta + (-\ln u_2)^\theta \right]^{\frac{1}{\theta}} }, \qquad \theta\ge1 \\ &\psi_\theta(t) = e^{-t^{\frac{1}{\theta}}}, \qquad t\ge0 \end{aligned}
      它不强调下尾共同极端,而强调上尾共同极端
    • 例子2: 广义 Clayton Copula
      \begin{aligned} &C_{\theta,\delta}^{\mathrm{GC}}(u_1,u_2) = \left( \left( (u_1^{-\theta}-1)^\delta + (u_2^{-\theta}-1)^\delta \right)^{\frac{1}{\delta}} +1 \right)^{-\frac{1}{\theta}} \\ &\psi(t) = (1+t^{\frac{1}{\delta}})^{-\frac{1}{\theta}}, \qquad t\ge0 \end{aligned}
      它通过额外参数增强形状灵活性。
      Clayton 型模型常用于描述下尾共同极端。
    • 例子3: Frank Copula
      \begin{aligned} &C_\theta^{\mathrm{Fr}}(u_1,u_2) = -\frac{1}{\theta} \ln\left( 1+ \frac{(e^{-\theta u_1}-1)(e^{-\theta u_2}-1)} {e^{-\theta}-1} \right) \\ &\psi_\theta(t) = -\frac{1}{\theta} \ln\left( 1-(1-e^{-\theta})e^{-t} \right), \qquad \theta\ne0 \end{aligned}
      Frank Copula 没有明显的单侧尾部相依。
      它可用于描述较对称的中部相依。
  2. Kendall tau
    • 阿基米德 Copula 的 Kendall tau 可由生成元计算
      \rho_\tau = 1+ 4\int_0^1 \frac{\psi^{-1}(t)} {\frac{d}{dt}\psi^{-1}(t)} \,dt.
    • 对于Gumbel Copula
      \rho_\tau = 1-\frac{1}{\theta}.
      因此可由样本 Kendall tau r_\tau 得到
      \hat\theta = \frac{1}{1-r_\tau}.
      Gumbel 参数要求 \theta\ge1,所以对应 r_\tau\ge0
    • 对于Clayton Copula
      \rho_\tau = \frac{\theta}{\theta+2}.
      若使用只允许正参数的 Clayton Copula,则只能覆盖正 Kendall tau。
      扩展 Clayton 族可覆盖更大的参数范围
    • 对于Frank Copula
      \rho_\tau = 1-\frac{4}{\theta} + \frac{4}{\theta}D_1(\theta)
      没有初等闭式,一般写成 Debye 函数形式
  3. 尾部相依
    • 阿基米德 Copula 的尾部相依通常可由生成元闭式计算
      \begin{aligned} & \lambda_u = \lim_{t\to0^+} \frac{ 1-2\psi(t)+\psi(2t) }{ 1-\psi(t) } \\ & \lambda_l = \lim_{t\to\infty} \frac{\psi(2t)}{\psi(t)} \end{aligned}
    • Gumbel Copula 有上尾相依
      \lambda_u = 2-2^{\frac{1}{\theta}}, \qquad \lambda_l=0.
    • Clayton Copula 有下尾相依:
      \lambda_l = 2^{-\frac{1}{\theta}}, \qquad \lambda_u=0.
    • Frank Copula 通常上下尾都渐近独立。
  4. 多维阿基米德Copula
    • 定义
      C(\boldsymbol{u}) = \psi\left( \psi^{-1}(u_1)+\cdots+\psi^{-1}(u_d) \right).
      要求 \psi 完全单调
      (-1)^k \frac{d^k}{dt^k}\psi(t)\ge0.
      例如多维 Clayton Copula
      C_\theta^{\mathrm{Cl}}(\boldsymbol{u}) = (u_1^{-\theta}+\cdots+u_d^{-\theta}-d+1)^{-\frac{1}{\theta}}, \qquad \theta\ge0.
      \theta=0 为独立极限,\theta 越大,相依越强
    • 完全单调生成元等价于 Laplace-Stieltjes 变换。
      存在 [0,\infty) 上的分布 G,使得
      \hat G(t) = \int_0^\infty e^{-tx}\,dG(x) = E(e^{-tX}).
      \psi=\hat G,则 \psi 连续、递减且完全单调。这给出了构造多维阿基米德 Copula 的系统方法
    • 建模限制。
      标准阿基米德形式对所有变量使用同一个生成元,因此它天然可交换。
      在异质风险组合中,不同业务或资产组之间相依结构可能不同,标准可交换阿基米德 Copula 可能过于受限
  5. LT-Archimedean Copula
    • 指生成元是 Laplace-Stieltjes 变换的阿基米德 Copula
      \psi=\hat GG(0)=0
      这类模型在信用风险中常用,因为它具有清晰的条件独立结构
    • LT-Archimedean Copula 可以通过共同因子模拟。
      生成
      V\sim G.
      生成独立
      Z_i\sim U(0,1)
      Y_i=-\ln Z_i
      U_i=\psi\left(\frac{Y_i}{V}\right).
      返回
      \boldsymbol{U} = \left( \psi\left(\frac{Y_1}{V}\right), \ldots, \psi\left(\frac{Y_d}{V}\right) \right)^{\top}

Copula数据拟合

拟合目标

  1. 给定独立同分布样本\boldsymbol{X}_1,\ldots,\boldsymbol{X}_n\sim F,连续边缘下有唯一表示
    F(\boldsymbol{x}) = C(F_1(x_1),\ldots,F_d(x_d)).

    • 数据拟合的目标是估计参数 Copula C_\theta 中的参数 \theta
    • 估计 Copula 前,通常需要先处理边缘分布。
  2. Copula 参数估计主要有两类思路。
    • 矩估计:利用样本 Kendall tau 或 Spearman rho 与模型参数的理论关系求解。
    • 极大似然估计:构造 Copula 伪样本后,用 Copula 密度最大化似然。
    • 秩相关矩估计更快、更稳健;极大似然通常更有效,但依赖边缘估计和 Copula 密度。

秩相关矩估计

  1. 样本 Spearman 相关可由秩计算。
    r_{ij}^{S} = \frac{12}{n(n^2-1)} \sum_{t=1}^n \left( \operatorname{rank}(X_{t,i})-\frac{n+1}{2} \right) \left( \operatorname{rank}(X_{t,j})-\frac{n+1}{2} \right).

    • \operatorname{rank}(X_{t,i})X_{t,i} 在第 i 个变量样本中的秩。
    • 若存在并列观测,通常使用平均秩。
    • 样本 Spearman 矩阵 \boldsymbol{R}^{S} 是半正定矩阵。
  2. 样本 Kendall 相关为
    r_{ij}^{\tau} = \binom n2^{-1} \sum_{1\le t\lt s\le n} \operatorname{sign} \left( (X_{t,i}-X_{s,i})(X_{t,j}-X_{s,j}) \right).

    • 它比较所有样本对的协同或逆同。
    • 计算量随样本对数量增长,大样本下比 Spearman 更慢。
    • 样本 Kendall 矩阵也具有半正定性质。
  3. 秩相关矩估计的一般步骤是:
    • 写出理论秩相关与 Copula 参数的函数关系
      \rho_{\mathrm{rank}}=f(\theta).
    • 计算样本秩相关 r_{\mathrm{rank}}
    • 解方程
      r_{\mathrm{rank}}=f(\hat\theta)
      得到参数估计。
  4. Gumbel Copula 可用 Kendall tau 直接估计。
    • 对 Gumbel Copula,
      \rho_\tau = 1-\frac{1}{\theta}.
    • 因此
      \hat\theta = (1-r_\tau)^{-1}, \qquad r_\tau\ge0.
  5. 高斯 Copula 可用 Spearman rho 快速估计相关矩阵。
    • Meta-Gaussian Copula 中
      \rho_S(X_i,X_j) = \frac{6}{\pi} \arcsin\left(\frac{\rho_{ij}}{2}\right).
    • 因此可反解为
      \rho_{ij} = 2\sin\left(\frac{\pi}{6}\rho_S(X_i,X_j)\right).
    • 当相关不极端时,\rho_S\rho_{ij} 接近。
  6. t Copula 更适合用 Kendall tau 估计相关参数。
    • 对椭圆 Copula,
      \rho_\tau = \frac{2}{\pi}\arcsin(\rho_{ij}).
    • 因此
      r_{ij}^{*} = \sin\left( \frac{\pi}{2}r_{ij}^{\tau} \right).
    • 逐元素转换得到的矩阵 \boldsymbol{R}^{*} 不一定正定,因此需要修正。
  7. 相关矩阵的特征值修正方法是:
    • 对伪相关矩阵做谱分解
      \boldsymbol{R}^{*} = \boldsymbol{G}\boldsymbol{\Lambda}\boldsymbol{G}^{\top}.
    • 将负特征值替换为小正数 \delta\gt0,得到 \tilde{\boldsymbol{\Lambda}}

    • \boldsymbol{Q} = \boldsymbol{G}\tilde{\boldsymbol{\Lambda}}\boldsymbol{G}^{\top}.
    • 最后标准化为相关矩阵
      \boldsymbol{R} = \rho(\boldsymbol{Q}).

极大似然估计

  1. 伪样本
    • 给定边缘估计 \hat F_i,伪样本定义为
      \hat{\boldsymbol{U}}_t = (\hat F_1(X_{t,1}),\ldots,\hat F_d(X_{t,d}))^{\top}.
      若边缘估计准确,则伪样本近似服从目标 Copula,伪样本依赖边缘估计质量
    • 非参数边缘估计常用经验分布函数。
      F_{i,n}^{*}(x) = \frac{1}{n+1} \sum_{t=1}^{n} 1(X_{t,i}\le x).
      分母使用 n+1,不是 n,这样伪观测严格落在 (0,1) 内,避免 Copula 密度在边界处出现问题。
    • 无重复观测时,经验伪样本可以写成秩形式。
      \hat U_{t,i} = \frac{\operatorname{rank}(X_{t,i})}{n+1}.
      这正是把每个边缘变量转换为样本分位水平,构造伪样本后,再在 [0,1]^d 上拟合 Copula
    • 此外,边缘估计可分为参数化、非参数和半参数方法。
      参数化方法直接拟合边缘分布族,例如 t、GH、NIG、对数正态、Pareto 等。
      非参数方法使用经验分布。
      尾部风险场景下,可用 EVT 方法拟合尾部,中间部分使用经验分布。
  2. 给定伪样本 \hat{\boldsymbol{U}}_1,\ldots,\hat{\boldsymbol{U}}_n,Copula 对数似然为
    \ell(\theta) = \ln L(\theta;\hat{\boldsymbol{U}}_1,\ldots,\hat{\boldsymbol{U}}_n) = \sum_{t=1}^{n} \ln c_\theta(\hat{\boldsymbol{U}}_t).

    • c_\theta 是参数 Copula 的密度。
    • 极大似然估计为
      \hat\theta = \arg\max_\theta \ell(\theta).
  3. Copula 似然依赖边缘估计。
    • 如果伪样本来自参数化边缘估计,得到的是 IFM 思路下的两阶段估计。
    • 如果伪样本来自经验边缘,再最大化 Copula 似然,称为半参数伪极大似然。
    • 边缘估计越差,Copula 参数估计越容易偏。
  4. 高斯 Copula 的似然可以通过正态分位数转换写出。

    • Y_{t,j} = \Phi^{-1}(\hat U_{t,j}).
    • 高斯 Copula 对数似然为
      \sum_{t=1}^{n}\ln f_{\boldsymbol{P}}(\boldsymbol{Y}_t) - \sum_{t=1}^{n}\sum_{j=1}^{d}\ln \phi(Y_{t,j}),
      其中 f_{\boldsymbol{P}}N_d(\boldsymbol{0},\boldsymbol{P}) 的密度,\phi 为一维标准正态密度。
    • 第二项与 \boldsymbol{P} 无关,因此优化重点在第一项。
  5. 高斯 Copula 的相关矩阵估计可写为
    \hat{\boldsymbol{P}} = \arg\max_{\boldsymbol{\Sigma}\in\mathcal P} \sum_{t=1}^{n}\ln f_{\boldsymbol{\Sigma}}(\boldsymbol{Y}_t).

    • 若暂时放宽为所有协方差矩阵,解析形式为
      \hat{\boldsymbol{\Sigma}} = \frac{1}{n} \sum_{t=1}^{n} \boldsymbol{Y}_t\boldsymbol{Y}_t^{\top}.
    • 实务中常取
      \hat{\boldsymbol{P}} = \rho(\hat{\boldsymbol{\Sigma}}).
  6. t Copula 的对数似然为
    \sum_{t=1}^{n} \ln g_{\nu,\boldsymbol{P}} \left( t_\nu^{-1}(\hat U_{t,1}),\ldots,t_\nu^{-1}(\hat U_{t,d}) \right) - \sum_{t=1}^{n}\sum_{j=1}^{d} \ln g_\nu \left( t_\nu^{-1}(\hat U_{t,j}) \right).

    • g_{\nu,\boldsymbol{P}}t_d(\nu,\boldsymbol{0},\boldsymbol{P}) 的联合密度。
    • g_\nu 是一维 t_\nu 密度。
    • t_\nu^{-1} 是一维 t_\nu 分位数函数。
  7. 高维 t Copula 通常分两步估计。
    • 先用 Kendall tau 估计相关矩阵 \boldsymbol{P}
    • 再在给定 \boldsymbol{P} 的基础上,用极大似然估计自由度 \nu
    • 这样避免在高维情形下同时搜索大量相关矩阵参数和自由度参数。

市场风险

风险因子映射

损失与估计

  1. 损失算子
    • 估值映射
      风险因子向量记为
      \boldsymbol{Z}_t = (z_{t,1},\ldots,z_{t,d})^{\top}.
      组合价值写成估值映射
      V_t = g(\tau_t,\boldsymbol{Z}_t), \qquad g:\mathbb R_+\times\mathbb R^d\to\mathbb R.
      风险因子的选择取决于组合类型和精度要求。例如股票组合可用对数价格,债券组合可用收益率曲线,期权组合还可能需要隐含波动率
    • 损失分布
      定义风险因子变化
      \boldsymbol{X}_t = \boldsymbol{Z}_t-\boldsymbol{Z}_{t-1}.
      一步损失可写为
      L_{t+1} = - \left\{ g(\tau_{t+1},\boldsymbol{Z}_t+\boldsymbol{X}_{t+1}) - g(\tau_t,\boldsymbol{Z}_t) \right\}.
      在时刻 t,当前风险因子水平 \boldsymbol{Z}_t 已知,未来不确定性来自 \boldsymbol{X}_{t+1}
    • 损失算子
      在时刻 t 的损失算子定义为
      l_{[t]}(\boldsymbol{X}) = - \left\{ g(\tau_{t+1},\boldsymbol{Z}_t+\boldsymbol{X}) - g(\tau_t,\boldsymbol{Z}_t) \right\}, \qquad \boldsymbol{X}\in\mathbb R^d.
      因此
      L_{t+1} = l_{[t]}(\boldsymbol{X}_{t+1}).
      市场风险度量的核心任务就是:先估计 \boldsymbol{X}_{t+1} 的分布,再通过 l_{[t]} 得到 L_{t+1} 的分布。
  2. 损失近似
    • Delta 近似
      对估值函数作一阶展开:
      g(\tau_t+\Delta t,\boldsymbol{Z}_t+\boldsymbol{X}) \approx g(\tau_t,\boldsymbol{Z}_t) + g_\tau(\tau_t,\boldsymbol{Z}_t)\Delta t + \sum_{i=1}^{d}g_{z_i}(\tau_t,\boldsymbol{Z}_t)x_i.
      代入损失算子,得到 Delta 损失近似:
      l_{[t]}^\Delta(\boldsymbol{X}) = - \left( g_\tau(\tau_t,\boldsymbol{Z}_t)\Delta t + \sum_{i=1}^{d} g_{z_i}(\tau_t,\boldsymbol{Z}_t)x_i \right)
      其中g_\tau=\frac{\partial g}{\partial \tau},g_{z_i}=\frac{\partial g}{\partial z_{t,i}},定义局部一阶敏感度\boldsymbol{\delta}
      \boldsymbol{\delta}(\tau_t,\boldsymbol{Z}_t) = \big( g_{z_1}(\tau_t,{z}_{t,1}), \ldots, g_{z_d}(\tau_t,{z}_{t,d}) \big)^{\top}.
      则Delta近似为
      l_{[t]}^\Delta(\boldsymbol{X}) =-(g_\tau\Delta t+\boldsymbol{\delta}^{\top}\boldsymbol{X})
    • Delta-Gamma 近似
      定义交叉时间敏感度向量
      \boldsymbol{\omega} = (g_{z_1\tau},\ldots,g_{z_d\tau})^{\top}.
      令 Hessian 矩阵为 \boldsymbol{\Gamma},其中
      \Gamma_{ij} = g_{z_i z_j}.
      二阶泰勒展开为
      g(\tau_t+\Delta t,\boldsymbol{Z}_t+\boldsymbol{X}) \approx{} g(\tau_t,\boldsymbol{Z}_t) + g_\tau\Delta t + \boldsymbol{\delta}^{\top}\boldsymbol{X} + \frac{1}{2} \left\{ g_{\tau\tau}(\Delta t)^2 + 2\boldsymbol{\omega}^{\top}\boldsymbol{X}\Delta t + \boldsymbol{X}^{\top}\boldsymbol{\Gamma}\boldsymbol{X} \right\}
      在短持有期下,通常忽略 (\Delta t)^2\boldsymbol{X}\Delta t 等高阶项,得到
      l_{[t]}^{\Delta\Gamma}(\boldsymbol{X}) = - \left( g_\tau\Delta t + \boldsymbol{\delta}^{\top}\boldsymbol{X} + \frac{1}{2}\boldsymbol{X}^{\top}\boldsymbol{\Gamma}\boldsymbol{X} \right).
      对含期权或其他非线性头寸的组合,二阶项可能明显改善损失近似
    • 是否可以只用 Delta 取决于组合的非线性程度
      对股票现货组合,价值对对数价格变化通常接近线性,Delta 近似较自然。
      对期权组合,即使组合做了 Delta 对冲,一阶敏感度可能接近零,但 Gamma、Vega 和交叉项仍会带来风险。
      因此,Delta 近似适合线性或近似线性头寸;Delta-Gamma 适合存在明显曲率的头寸

债券组合

  1. 债券组合映射
    • 记零息债券价格为
      p(t,T),
      其中 t 是估值时刻,T 是到期日,连续复利收益率定义为
      y(t,T) = - \frac{1}{T-t}\ln p(t,T).
      等价地,
      p(t,T) = e^{-(T-t)y(t,T)}.
      收益率曲线就是 T\mapsto y(t,T)
    • 债券组合价值映射
      设组合包含 d 只零息债券,到期日分别为 T_i,头寸分别为 \lambda_i,取各期限收益率构的风险因子向量
      z_{t,i} = y(\tau_t,T_i)
      组合价值为
      V_t = g(\tau_t,\boldsymbol{Z}_t) = \sum_{i=1}^{d} \lambda_i e^{-(T_i-\tau_t)z_{t,i}}.
      风险因子变化为
      x_{t+1,i} = y(\tau_{t+1},T_i)-y(\tau_t,T_i).
      对收益率风险因子的偏导数为
      \begin{aligned} &g_\tau = \sum_i \lambda_i p(\tau_t,T_i)z_{t,i} \\ &g_{z_i} = - \lambda_i(T_i-\tau_t)e^{-(T_i-\tau_t)z_{t,i}} \end{aligned}
      因此一般线性损失近似为
      l_{[t]}^\Delta(\boldsymbol{X}) = - \sum_i \lambda_i p(\tau_t,T_i) \left( y(\tau_t,T_i)\Delta t - (T_i-\tau_t)x_i \right).
      收益率上升会使债券价格下降,债券多头产生损失。
      二阶偏导为
      g_{z_i z_i} = \lambda_i(T_i-\tau_t)^2e^{-(T_i-\tau_t)z_{t,i}}, \qquad g_{z_i z_j}=0\quad(i\ne j).
      因此一般 Delta-Gamma 损失近似为
      l_{[t]}^{\Delta\Gamma}(\boldsymbol{x}) = - \sum_i \lambda_i p_i \left( y_i\Delta t - (T_i-\tau_t)x_i + \frac{1}{2}(T_i-\tau_t)^2x_i^2 \right).
  2. 久期和凸性
    • 久期
      若收益率曲线平行移动:
      y(\tau_{t+1},T_i) = y(\tau_t,T_i)+x,
      则线性近似可写为
      l_{[t]}^\Delta(x) = -V_t(A_t\Delta t-D_tx),
      其中
      D_t = \sum_i \frac{\lambda_i p_i}{V_t}(T_i-\tau_t), \qquad A_t = \sum_i \frac{\lambda_i p_i}{V_t}y_i.
      D_t 是 Macaulay 久期,若短期内忽略时间项,则
      l_{[t]}^\Delta(x) \approx V_tD_tx.
    • 凸性
      平行移动下的二阶近似为
      l_{[t]}^{\Delta\Gamma}(x) = -V_t \left( A_t\Delta t-D_tx+\frac{1}{2}C_tx^2 \right),
      其中
      C_t = \sum_i \frac{\lambda_i p_i}{V_t}(T_i-\tau_t)^2.
      在久期相同的情况下,凸性更高的债券组合在利率大幅变动时通常更有利。
  3. 债组合券因子模型
    • 固定收益组合通常需要降维
      大型债券组合涉及大量期限点,直接对每个期限收益率建模不现实。
      收益率曲线高度相关,通常可由少数因子解释。
      常见经验解释是三因子:水平、斜率和曲率。
    • Nelson-Siegel 模型用少数因子描述收益率曲线
      瞬时远期利率为
      f(t,T) = - \frac{\partial}{\partial T}\ln p(t,T).
      收益率与远期利率满足
      y(t,T) = \frac{1}{T-t} \int_t^T f(t,u)\,du.
      Nelson-Siegel 收益率曲线可写成
      y(\tau_t,T) = z_{t,1} + k_1(T-\tau_t,\eta_t)z_{t,2} + k_2(T-\tau_t,\eta_t)z_{t,3}.
      其中
      k_1(s,\eta) = \frac{1-e^{-\eta s}}{\eta s}, \qquad k_2(s,\eta) = k_1(s,\eta)-e^{-\eta s}.
      z_{t,1} 可解释为水平因子,z_{t,2} 可解释为斜率因子,z_{t,3} 可解释为曲率因子。
      对第 i 个现金流期限,定义
      \boldsymbol{K}_{t,i} = \left( 1,\, k_1(T_i-\tau_t,\eta_t),\, k_2(T_i-\tau_t,\eta_t) \right)^{\top}.
      债券组合价值可写为
      V_t = g(\tau_t,\boldsymbol{Z}_t) = \sum_i \lambda_i e^{-(T_i-\tau_t)\boldsymbol{K}_{t,i}^{\top}\boldsymbol{Z}_t}.
      这样损失算子就可以写成三维因子变化的函数,而不是所有期限收益率变化的函数。
    • 主成分分析也可用于收益率曲线降维
      设收益率变化向量为 \boldsymbol{R}_{t+1},PCA 因子模型写为
      \boldsymbol{R}_{t+1} = \boldsymbol{\mu} + \boldsymbol{\Gamma}_1\boldsymbol{X}_{t+1} + \boldsymbol{\varepsilon}_{t+1},
      其中 \boldsymbol{X}_{t+1} 是少数主成分因子,\boldsymbol{\Gamma}_1 的列为前几个特征向量。
      若忽略均值和残差项,则
      \boldsymbol{R}_{t+1} \approx \boldsymbol{\Gamma}_1\boldsymbol{X}_{t+1}.
      债券组合线性损失可近似为
      l_{[t]}^\Delta(\boldsymbol{x}) = - \sum_{i=1}^{d} \lambda_i p(\tau_t,T_i) \left( y(\tau_t,T_i)\Delta t - (T_i-\tau_t)(\boldsymbol{\Gamma}_1\boldsymbol{x})_i \right).
      原本关于高维收益率变化的损失函数,可替换成关于少数主成分因子的函数。
      因子模型的价值在于降低维度、减少估计误差,并保留收益率曲线主要变动方向。

市场风险度量

风险估计方法

  1. 条件方法
    • 基于当前信息估计下一期损失分布,条件方法估计
      F_{\boldsymbol{X}_{t+1}\mid\mathcal F_t},
      对应条件损失分布为
      F_{L_{t+1}\mid\mathcal F_t}(l) = P\left( l_{[t]}(\boldsymbol{X}_{t+1})\le l \mid \mathcal F_t \right).
    • 条件方法能反映近期市场状态,但在平静时期可能低估极端压力情景。
  2. 无条件方法
    • 基于较长历史窗口估计平稳分布,无条件方法估计风险因子变化的平稳分布 F_{\boldsymbol{X}}。然后评估
      L=l_{[t]}(\boldsymbol{X})
      的分布。
    • 若风险因子变化 iid,则条件分布和无条件分布相同;但金融数据有波动聚集,通常不能这样简化。
  3. 压力 VaR
    • 压力 VaR 使用历史压力期数据估计风险,强调样本窗口来自压力时期。
    • 它不是一种新的损失算子,而是一种样本窗口选择思想。
    • 核心目的是避免仅用近期平静市场数据低估尾部风险。

方差-协方差方法

  1. 方法定义
    • 假设下一期风险因子变化条件分布为多元正态:
      \boldsymbol{X}_{t+1} \mid \mathcal F_t \sim N_d(\boldsymbol{\mu}_{t+1},\boldsymbol{\Sigma}_{t+1}).
      同时使用线性损失算子
      l_{[t]}^\Delta(\boldsymbol{x}) = -(c_t+\boldsymbol{b}_t^{\top}\boldsymbol{x}).
      则条件损失为一元正态:
      L_{t+1}^\Delta \sim N\left( -c_t-\boldsymbol{b}_t^{\top}\boldsymbol{\mu}_{t+1}, \boldsymbol{b}_t^{\top}\boldsymbol{\Sigma}_{t+1}\boldsymbol{b}_t \right).
    • 得到均值和方差后,可直接套用正态 VaR 和 ES 公式。
  2. 参数估计
    • 协方差矩阵可用多元 EWMA 估计。若条件均值近似为零,则
      \widehat{\boldsymbol{\Sigma}}_{t+1} = \theta \boldsymbol{X}_t\boldsymbol{X}_t^{\top} + (1-\theta) \widehat{\boldsymbol{\Sigma}}_t.
      当样本足够长时,
      \widehat{\boldsymbol{\Sigma}}_{t+1} \approx \theta \sum_{i=0}^{n-1} (1-\theta)^i \boldsymbol{X}_{t-i}\boldsymbol{X}_{t-i}^{\top}.
      这表示最近观测权重最大,越远的观测权重按指数衰减。
    • 若条件均值不近似为零,则使用去均值版本:
      \widehat{\boldsymbol{\Sigma}}_{t+1} = \theta (\boldsymbol{X}_t-\widehat{\boldsymbol{\mu}}_t) (\boldsymbol{X}_t-\widehat{\boldsymbol{\mu}}_t)^{\top} + (1-\theta) \widehat{\boldsymbol{\Sigma}}_t.
  3. 优缺点
    • 优点是计算简单、结果解析、易于解释。
    • 缺点是依赖两个强假设:
      损失算子可以线性近似;
      风险因子变化服从多元正态。
    • 金融风险因子通常厚尾,且衍生品组合可能非线性很强,因此该方法可能低估尾部风险
      用多元 t 等椭圆分布替代正态分布,若
      \boldsymbol{X}_{t+1} \mid \mathcal F_t \sim t_d(\nu,\boldsymbol{\mu},\boldsymbol{\Sigma}),
      且仍使用线性损失算子,则
      L_{t+1}^{\Delta} \sim t\left( \nu, -c_t-\boldsymbol{b}_t^{\top}\boldsymbol{\mu}, \boldsymbol{b}_t^{\top}\boldsymbol{\Sigma}\boldsymbol{b}_t \right).
      这种替代保留了线性组合封闭性,同时允许更厚尾

历史模拟法

  1. 静态历史模拟
    • 历史模拟直接把历史风险因子变化代入当前损失算子,给定历史损失算子 \boldsymbol{X}_{t-n+1},\ldots,\boldsymbol{X}_t,在时刻 t 构造历史模拟损失:
      \widetilde L_s = l_{[t]}(\boldsymbol{X}_s), \qquad s=t-n+1,\ldots,t.
      这些 \widetilde L_s 形成一维损失样本,用来估计损失分布、VaR 和 ES。
    • 历史模拟本质上是无条件方法
      它用历史经验分布近似未来风险因子变化的分布。
      若历史风险因子变化近似平稳,经验分布可以估计损失分布。
      但它不能自然反映当前条件波动率的变化。
    • 优点
      不需要显式估计多元风险因子分布。
      不需要强行指定相关结构。
      可以直接使用完整损失算子,而不必只用线性近似。
    • 缺点
      它依赖足够长、同步、相关的历史数据。
      极端尾部估计需要大量样本,历史窗口有限时 VaR 和 ES 不稳定。
      它只看过去窗口,可能无法及时反映当前波动率上升。
      对大型衍生品组合,每个历史情景都完整重估会很贵。
  2. 动态历史模拟
    • 把历史模拟改造成条件方法
      基础历史模拟直接用过去的 \boldsymbol{X}_s,动态历史模拟先去掉历史数据中的动态波动率,再把标准化冲击带入当前市场状态。
      这样既保留历史模拟的非参数味道,又能反映当前波动水平。
    • 一元动态历史模拟
      从历史模拟损失样本出发
      \{ \widetilde L_s = l_{[t]}(\boldsymbol{X}_s) : s=t-n+1,\ldots,t \}.
      假设
      \widetilde L_s = \mu_s+\sigma_s Z_s.
      则条件 VaR 和 ES 为
      \operatorname{VaR}_\alpha^t = \mu_{t+1} + \sigma_{t+1}q_\alpha(Z),
      \operatorname{ES}_\alpha^t = \mu_{t+1} + \sigma_{t+1}\operatorname{ES}_\alpha(Z).
      需要估计下一期条件均值、条件波动率,以及创新分布的分位数和 ES。若创新为标准正态,则
      q_\alpha(Z) = \Phi^{-1}(\alpha), \qquad ES_\alpha(Z) = \frac{\varphi(\Phi^{-1}(\alpha))}{1-\alpha}.
      若创新为经方差标准化的 t 分布,则分位数和 ES 需要乘以
      \sqrt{\frac{\nu-2}{\nu}}.
      用 GARCH、EWMA 等方法估计 (\mu_s,\sigma_s),得到标准化残差
      \hat Z_s=\frac{\widetilde L_s-\hat\mu_s}{\hat\sigma_s}
      预测下一期的条件均值和波动率:
      \hat\mu_{t+1},\qquad \hat\sigma_{t+1}
      把过去的标准化冲击放到当前市场状态下:
      \widetilde L_{t+1,s} = \hat\mu_{t+1} + \hat\sigma_{t+1}\hat Z_s
      用这些重新缩放后的损失样本估计 VaR 和 ES。
    • 多元动态历史模拟
      假设风险因子满足
      \boldsymbol{X}_s = \boldsymbol{\mu}_s+\boldsymbol{\Delta}_s\boldsymbol{Z}_s,
      其中
      \boldsymbol{\Delta}_s = \operatorname{diag}(\sigma_{s,1},\ldots,\sigma_{s,d}).
      \boldsymbol{\mu}_s\boldsymbol{\Delta}_s 都是 \mathcal F_{s-1} 可测的,创新序列满足
      (\boldsymbol{Z}_s) \sim SWN(\boldsymbol{0},\boldsymbol{P}).
      因此对第 k 个风险因子有
      E(X_{s,k}\mid\mathcal F_{s-1}) = \mu_{s,k},
      \operatorname{var}(X_{s,k}\mid\mathcal F_{s-1}) = \sigma_{s,k}^2.
      构造标准化残差
      \widehat{\boldsymbol{Z}}_s = \widehat{\boldsymbol{\Delta}}_s^{-1} (\boldsymbol{X}_s-\widehat{\boldsymbol{\mu}}_s), \qquad s=t-n+1,\ldots,t.
      再把这些标准化残差放回当前条件均值和波动率:
      \{ \widetilde L_s = l_{[t]} \left( \widehat{\boldsymbol{\mu}}_{t+1} + \widehat{\boldsymbol{\Delta}}_{t+1} \widehat{\boldsymbol{Z}}_s \right) : s=t-n+1,\ldots,t \}.
      这比一元方法更精细,因为它保留了风险因子层面的波动率结构。

蒙特卡洛方法

  1. 步骤
    • 先估计条件分布
      \widehat F_{\boldsymbol{X}_{t+1}\mid\mathcal F_t}.
    • 然后生成模拟风险因子变化
      \widetilde{\boldsymbol{X}}_{t+1}^{(1)},\ldots, \widetilde{\boldsymbol{X}}_{t+1}^{(m)}.
    • 对每个情景应用损失算子:
      \widetilde L_{t+1}^{(i)} = l_{[t]}(\widetilde{\boldsymbol{X}}_{t+1}^{(i)}), \qquad i=1,\ldots,m.
  2. 特点
    • 它不会自动解决模型选择问题。
    • 如果风险因子模型错误,模拟再多也只是在错误分布下提高数值精度。
    • 因此蒙特卡洛质量取决于风险因子时间序列模型、边缘分布和相依结构设定。
  3. 优缺点
    • 优势是模拟次数 m 可以很大,估计 VaR 和 ES 的数值误差可小于历史模拟。
    • 成本是每个模拟情景可能都要重估组合,复杂衍生品组合尤其昂贵。
    • 可用 Delta-Gamma 近似、方差缩减和重要性抽样降低计算负担。

风险度量估计

  1. 目标
    • 设损失样本为
      L_1,\ldots,L_n\sim F_L.
    • 目标是估计
      VaR_\alpha = q_\alpha(F_L) = F_L^{\leftarrow}(\alpha),
      以及
      ES_\alpha = \frac{1}{1-\alpha} \int_\alpha^1 q_\theta(F_L)\,d\theta.
  2. 度量方法
    • 经验 VaR
      来自损失样本的上尾顺序统计量,记上尾顺序统计量为
      L_{1,n}\ge L_{2,n}\ge\cdots\ge L_{n,n}.
      k=\lfloor n(1-\alpha)\rfloor+1,则经验 VaR 可写为
      \widehat{VaR}_\alpha = L_{k,n}.
      尾部分位数常只由少数最大损失决定,因此小样本下方差很大。
    • 经验 ES
      是上尾损失的加权平均,ES 的上尾顺序统计量估计可写为
      \widehat{ES}_\alpha = \frac{1}{n(1-\alpha)} \left( \sum_{k=1}^{\lfloor n(1-\alpha)\rfloor}L_{k,n} + (\lceil n\alpha\rceil-n\alpha) L_{\lfloor n(1-\alpha)\rfloor+1,n} \right).
      它使用超过 VaR 阈值的尾部损失信息,因此比 VaR 更关注尾部严重程度。
    • EVT 方法
      选择高阈值u=L_{k+1,n},并对超过阈值的损失超额拟合 GPD,设 GPD 参数估计为 \hat\xi,\hat\beta,则
      \begin{aligned} &\widehat{VaR}_\alpha = u+ \frac{\hat\beta}{\hat\xi} \left[ \left( \frac{1-\alpha}{k/n} \right)^{-\hat\xi} -1 \right] \\ &\widehat{ES}_\alpha = \frac{\widehat{VaR}_\alpha}{1-\hat\xi} + \frac{\hat\beta-\hat\xi u}{1-\hat\xi} \end{aligned}
      EVT 的关键是阈值和尾部样本数 k 的选择:太小估计不稳,太大又会引入非尾部样本。
  3. 多期损失
    • h 期损失定义为
      L_{t+h}^{(h)} = -(V_{t+h}-V_t).
      若映射可写成 h 期风险因子累计变化的函数,则
      L_{t+h}^{(h)} = l_{[t]}^{(h)} \left( \sum_{i=1}^{h}\boldsymbol{X}_{t+i} \right).
      除特殊情形外,VaR 和 ES 如何随 h 变化没有简单公式
    • 平方根时间缩放
      若线性损失为
      l_{[t]}^\Delta(\boldsymbol{x}) = \boldsymbol{b}_t^{\top}\boldsymbol{x},

      \boldsymbol{X}_{t+i}\sim N_d(\boldsymbol{0},\boldsymbol{\Sigma})
      独立同分布,则
      L_{t+h}^{(h)\Delta} = \sum_{i=1}^{h}\boldsymbol{b}_t^{\top}\boldsymbol{X}_{t+i} \sim N(0,h\boldsymbol{b}_t^{\top}\boldsymbol{\Sigma}\boldsymbol{b}_t).

      \sigma^2 = \boldsymbol{b}_t^{\top}\boldsymbol{\Sigma}\boldsymbol{b}_t.
      因此
      VaR_\alpha^{(h)} = \sqrt h\, VaR_\alpha^{(1)},
      ES_\alpha^{(h)} = \sqrt h\, ES_\alpha^{(1)}.
      对正态线性损失,上式中的 ES 也可写为
      ES_\alpha^{(h)} = \sqrt h\, \sigma \frac{\varphi(\Phi^{-1}(\alpha))}{1-\alpha}.
    • 金融数据通常不满足平方根缩放的条件
      风险因子变化通常厚尾、非正态、存在波动率聚集。
      对 GARCH 等动态模型,条件多期损失分布一般没有简单封闭缩放关系。
      更稳妥的方法是用蒙特卡洛模拟未来 h 期路径,再计算 h 期损失样本。

风险量回测

VaR 违约次数检验

  1. VaR 性质
    • 违约率
      时刻 t 的 VaR 估计为 VaR_\alpha^t,下一期实现损失为 L_{t+1},违约指标为
      I_{t+1} = \mathbf 1_{\{L_{t+1}\gt VaR_\alpha^t\}}.
      若 VaR 模型正确,则
      E(I_{t+1}\mid\mathcal F_t) = 1-\alpha.
    • 违约序列
      若模型正确,违约指标应近似 iid Bernoulli:
      I_{t+1}\sim \operatorname{Bernoulli}(1-\alpha).
      因此违约总数
      M = \sum_{t=1}^{m}I_{t+1} \sim B(m,1-\alpha).
  2. 违约次数检验
    • 可用二项检验或 score 检验,实际使用估计 VaR:
      \widehat{VaR}_\alpha^t.
      经验违约指标为
      \hat I_{t+1} = \mathbf 1_{\{L_{t+1}\gt\widehat{VaR}_\alpha^t\}}.
      两侧 score 检验统计量为
      Z_m = \frac{ \sum_{t=1}^{m}\hat I_{t+1} - m(1-\alpha) } { \sqrt{m\alpha(1-\alpha)} }.
    • |Z_m| 太大,则说明 VaR 可能系统性偏高或偏低。
  3. 违约独立性检验
    • 可用间隔检验,若违约发生在 T_1,\ldots,T_M,定义间隔
      S_j=T_j-T_{j-1}.
      正确模型下,违约间隔应近似服从几何分布:
      P(S_j=k) = \alpha^{k-1}(1-\alpha).
      当违约概率较小,可近似为 Poisson 过程,间隔近似指数分布。
    • 若短间隔过多,说明违约成簇,模型没有充分捕捉条件风险变化。

ES 违约残差检验

  1. 定义
    • ES 回测利用 VaR 违约幅度,而不只看是否违约,令
      \mu_{t+1} = E(L_{t+1}\mid\mathcal F_t).
      定义违约残差
      K_{t+1} = \left( \frac{ L_{t+1}-ES_\alpha^t } { ES_\alpha^t-\mu_{t+1} } \right) \mathbf 1_{\{L_{t+1}\gt VaR_\alpha^t\}}.
    • 若没有 VaR 违约,则残差为 0;若发生违约,则残差衡量实际尾部损失相对 ES 的偏离。
  2. 违约残差检验
    • 对连续损失分布,有
      E(K_{t+1}\mid\mathcal F_t)=0.
      因此 (K_t) 构成鞅差分序列。若进一步假设
      L_t=\mu_t+\sigma_tZ_t,
      Z_t 是严格白噪声,则
      ES_\alpha^t = \mu_{t+1} + \sigma_{t+1}ES_\alpha(Z).
      此时违约残差可写成
      K_{t+1} = \left( \frac{ Z_{t+1}-ES_\alpha(Z) } { ES_\alpha(Z) } \right) \mathbf 1_{\{Z_{t+1}\gt q_\alpha(Z)\}}.
      因而非零违约残差可用于均值为零的检验
    • 经验违约残差用估计量代入,得到估计量
      \hat K_{t+1} = \left( \frac{ L_{t+1}-\widehat{ES}_\alpha^t } { \widehat{ES}_\alpha^t-\hat\mu_{t+1} } \right) \hat I_{t+1}.
      实务中条件均值常接近 0,有时直接设 \hat\mu_{t+1}=0
      可对非零违约残差做均值为零的 t 检验,也可用 bootstrap 减少分布假设。

预测分布回测

  1. 定义
    • 除了回测 VaR 和 ES,也可以回测整个条件损失分布
    • 若估计分布F_{L_{t+1}\mid\mathcal F_t},正确,则概率积分变换
      U_{t+1} = F_{L_{t+1}\mid\mathcal F_t}(L_{t+1})
      应服从标准均匀分布。
  2. 检验方式
    • 位置-尺度模型下概率积分变换有明确形式,若
      L_t=\mu_t+\sigma_tZ_t,
      且创新分布函数记为 G_Z,则
      F_{L_{t+1}\mid\mathcal F_t}(l) = G_Z \left( \frac{l-\mu_{t+1}}{\sigma_{t+1}} \right).
      因此
      U_{t+1} = G_Z(Z_{t+1}).
      G_Z 连续且模型正确,则 U_t 应为 iid U(0,1)
    • 实际回测使用估计分布构造 PIT 序列,计算
      \hat U_{t+1} = \widehat F_{L_{t+1}\mid\mathcal F_t}(L_{t+1}).
      若模型正确,\hat U_t 应近似 iid 均匀。
      可用卡方检验、Kolmogorov-Smirnov 检验等检验均匀性。也可做正态变换:
      \Phi^{-1}(\hat U_1),\ldots,\Phi^{-1}(\hat U_n)
      转换后应近似 iid 标准正态,再检查白噪声性质。

可引出性与评分比较

  1. 可引出性把风险度量估计看成预测问题
    • 若风险度量是分布泛函
      \rho(L)=T(F_L),
      则可用评分函数比较不同预测方法。
    • 评分函数衡量预测值 y 和实现损失 l 之间的差异。
  2. 可引出的泛函能最小化某个期望评分
    • 若存在评分函数 S,使得
      T(F) = \arg\min_{y\in\mathbb R} \int_{\mathbb R}S(y,l)\,dF(l),
      则称 T 可引出。
    • 均值可由平方误差引出,中位数可由绝对误差引出。
  3. VaR 可引出,ES 单独一般不可引出
    • 对严格递增分布,VaR 对应分位数泛函:
      T(F_L)=F_L^{\leftarrow}(\alpha).
    • 一个严格一致评分函数为
      S_\alpha^q(y,l) = \left| \mathbf 1_{\{l\le y\}}-\alpha \right| |l-y|.
    • 因此不同 VaR 方法可用经验评分比较:
      \sum_{t=1}^{m} S_\alpha^q \left( \widehat{VaR}_\alpha^t, L_{t+1} \right).
    • 评分越小,条件分位数预测越好。
  4. Expectile 是可引出的风险度量候选
    • Expectile 可由非对称平方损失引出:
      S_\alpha(y,l) = \left| \mathbf 1_{\{l\le y\}}-\alpha \right| (l-y)^2.
    • 在某些条件下,expectile 同时具备可引出性和 coherent 性质。
    • 这解释了为什么可引出性理论会影响风险度量选择和回测方法设计。

发表评论 取消回复
表情 图片 链接 代码

分享