# readme

- 梁衡老师的概统讲的很好，~~少数我想线下听的课~~，可惜也没好好听，而且记了 PF，就当复习个快乐，学习没那么 targeted
- 我总结下每一章比较有意思的地方，这一部分是统计

# 统计学基本概念

- 样本均值

> 设 $x_{1}, x_{2}, \cdots, x_{n}$ 是来自某个总体的样本, $\bar{x}$ 为样本均值,
>
> 1. 若总体分布为 $N\left(\mu, \sigma^{2}\right)$, 则 $\bar{x} \sim N\left(\mu, \frac{\sigma^{2}}{n}\right)$;
> 2. 若总体分布不是正态分布或根本末知, $E(X)=\mu, \operatorname{Var}(X)=\sigma^{2}$, 则 $n$ 较大时, $\bar{x}$ 的渐近分布为 $N\left(\mu, \frac{\sigma^{2}}{n}\right)$, 常记为 $\bar{x} \dot{\sim} N\left(\mu, \frac{\sigma^{2}}{n}\right)$ 
>    (中心极限定理）
> 3. 实际上，如果 X 的分布本身不是正态分布，则 $ E(\bar{x})=\mu,Var(\bar{x})= \frac{\sigma^{2}}{n}$ 仍然成立，只是不严格正态。而 n 足够大的时候，渐进为正态分布

- 样本方差

> 样木本方差 $s^{2}=\frac{1}{n-1} \sum_{i=1}^{n}\left(x_{i}-\bar{x}\right)^{2}$
>
> 设总体 $X$ 具有二阶矩, 即 $E(X)=\mu, \operatorname{Var}(X)=\sigma^{2}<+\infty$, $x_{1}, x_{2}, \cdots, x_{n}$ 为从该总体得到的样本, $\bar{x}$ 和 $s^{2}$ 分别是样本均值和样本方差, 则 $E(\bar{x})=\mu, \operatorname{Var}(\bar{x})=\frac{\sigma^{2}}{n}, E\left(s^{2}\right)=\sigma^{2}$ （无偏估计）
>
> > 注意，$s^2$ 是 $\sigma^2$ 的无偏估计，但是并不意味着 $s$ 是 $\sigma$ 的无偏估计
> >
> >  Var $(S)=E\left(S^{2}\right)-E(S)^{2}=\sigma^{2}-E(S)^{2}>0$, 所以 $E(S)<\sigma$ 
>
> $X_{1}, X_{2}, \cdots, X_{n}$ 是来自均匀总体 $X \sim U(-a, a)$ 的样本, 用矩估计法估计参数 $a$。
>
> $\operatorname{Var}(X)=\frac{a^{2}}{3}$, 令 $\frac{a^{2}}{3}=s^{2} \Rightarrow \hat{a}=\sqrt{3} s$，但不是无偏估计。
>
> 样本 $k$ 阶原点矩 $a_{k}=\frac{1}{n} \sum_{i=1}^{n} x_{i}^{k}$, 样本 $k$ 阶中心矩 $b_{k}=\frac{1}{n} \sum_{i=1}^{n}\left(x_{i}-\bar{x}\right)^{k}$

- 次序统计量

> 对于次序统计量，利用习题课 1 上的 trick 即可

- 三大分布

> 1. $X_{1}, X_{2}, \cdots, X_{n}$ 独立同分布, 服从 $N(0,1)$ 则 $Y=X_{1}{ }^{2}+\cdots+X_{n}{ }^{2} \sim \chi_{n}{ }^{2}$ 或 $\chi^{2}(n)$, 称为自由度为 $n$ 的 $\chi^{2}$ 分布 —— $n$ 个独立同分布的标准正态分布之和为 $n$ 自由度的卡方分布
> 2. $t$ 分布 $X_{1} \sim N(0,1), X_{2} \sim \chi_{n}^{2}, X_{1}, X_{2}$ 相互独立 $t=\frac{X_{1}}{\sqrt{X_{2} / n}} \sim t(n)$, 称为自由度为 $n$ 的 $t$ 分布 —— 标准正态分布除以独立的 $n$ 自由度卡方分布除 $n$ 开根为 $n$ 自由度的 $t$ 分布
> 3. $F$ 分布 $X_{1}, X_{2}$ 相互独立, $X_{1} \sim \chi_{m}{ }^{2}, X_{2} \sim \chi_{n}{ }^{2},F=\frac{X_{1} / m}{X_{2} / n} \sim F(m, n)$ 称为自由度为  $m$  与 $n$ 的 $F$ 分布

> 举个例子，构造分布：
>
> 设 $X_{1}, X_{2}, \ldots, X_{8}$ 为相互独立的 $N(0,1)$ 随机变量, 则 $P\left(\frac{X_{1}-X_{2}}{\left|X_{1}+X_{2}+\cdots+X_{8}\right|} \geq ?\right)= 0.05$
>
> 解: $X_{1}-X_{2} \sim N(0,2), \quad X_{1}+X_{2}+\ldots+X_{8} \sim N(0,8)$
>
> $\operatorname{Cov}\left(X_{1}-X_{2}, X_{1}+X_{2}\right)=0$
>
> 构造 F 分布：
>
> $\frac{\left(X_{1}-X_{2}\right)^{2} / 2}{\left(X_{1}+X_{2}+\ldots+X_{8}\right)^{2} / 8} \sim F(1,1), \quad P\left(\frac{\left(X_{1}-X_{2}\right)^{2} / 2}{\left(X_{1}+X_{2}+\ldots+X_{8}\right)^{2} / 8} \geq F_{0.9}(1,1)\right)=0.1$
>
> $P\left(\frac{\left(X_{1}-X_{2}\right) / \sqrt{2}}{\left|X_{1}+X_{2}+X_{3}+X_{4}\right| / 2 \sqrt{2}} \geq \sqrt{F_{0.9}(1,1)}\right)=0.05 \Rightarrow P\left(\frac{X_{1}-X_{2}}{\left|X_{1}+X_{2}+X_{3}+X_{4}\right|} \geq \frac{\sqrt{F_{0.9}(1,1)}}{2}\right)=0.05$
>
> $P\left(\frac{X_{1}-X_{2}}{\left|X_{1}+X_{2}+X_{3}+X_{4}\right|} \geq \sqrt{10}\right)=0.05$
>
> 构造 T 分布：
>
> $\frac{\left(X_{1}-X_{2}\right) / \sqrt{2}}{\sqrt{\left(X_{1}+X_{2}+\ldots+X_{8}\right)^{2} / 8}} \sim t(1), \quad P\left(\frac{\left(X_{1}-X_{2}\right) / \sqrt{2}}{\left|X_{1}+X_{2}+\ldots+X_{8}\right| / \sqrt{8}} \geq t_{0.95}(1)\right)=0.05$
>
> $P\left(\frac{X_{1}-X_{2}}{\left|X_{1}+X_{2}+X_{3}+X_{4}\right|} \geq \frac{t_{0.95}(1)}{2}\right)=0.05, \quad P\left(\frac{X_{1}-X_{2}}{\left|X_{1}+X_{2}+X_{3}+X_{4}\right|} \geq 3.16\right)=0.05$

- 分布反演

> 设随机变量 $\xi$ 服从自由度为 $(1,1)$ 的 $F$ 分布, 则 $P(\xi \leq 1)=(\quad)$ 
>
> 设 $X_{1} \sim \chi^{2}(1), X_{2} \sim \chi^{2}(1), X_{1} 、 X_{2}$ 相互独立, 所以 
>
> $P\left(X_{1} \leq X_{2}\right)=P\left(X_{1} \geq X_{2}\right)=\frac{1}{2}, \quad P(\xi \leq 1)=P\left(\frac{X_{1}}{X_{2}} \leq 1\right)=P\left(X_{1} \leq X_{2}\right)=\frac{1}{2}$
>
> ----------
>
> 设随机变量 $T$ 服从自由度为 1 的 $t$ 分布, 则 $P(T \leq 1)=(\quad)$ 
>
> 设 $X, Y$ 相互独立, 且均服从 $N(0,1)$, 则 $\frac{X}{|Y|}$ 服从自由度为 1 的 $t$ 分布, 于是
>
> $\begin{array}{l}
> P(T \leq 1)=P(T \leq 0)+P(0<T<1)=0.5+\frac{1}{2} P(|T|<1) \\
> =0.5+0.5 \times P\left(X^{2}<Y^{2}\right)=0.5+0.5 \times 0.5=0.75
> \end{array}$
>
> > 这个稍微需要理解下，$X$ 为负数时，$T$ 必小于 0，此即 $P(T\le0)=\frac{1}{2}$。而 $P(0\le T\le 1)=P(X\ge 0)\times p(X\le |Y|)=\frac{1}{2}\times P(X^2\le Y^2)=\frac{1}{4}$
> >
> > 还有一个想法，$P(X\le |Y|$ 按照全概率公式，分为 $P(Y\le 0)
> > \times P(X\le -Y|Y \le 0)+P(Y\ge 0)\times P(X\le Y|Y \ge 0)$，这个方法很简单，重点是不要忘了全概率公式应该乘的是条件概率。

# 参数点估计的方法与评价

- 矩估计

> 尽量用低阶矩来估计参数

- [极大似然估计](https://zhuanlan.zhihu.com/p/26614750)

>  对于二元函数 $p(x ,\theta)$ 输入有两个：$\mathrm{x}$ 表示某一个具体的数据，$\theta$ 表示模型的参数
>
> 如果 $\theta$ 是已知确定的，$x$ 是变量, 即为概率函数(probability function)，它描述对于不同样本点 $x$, 其出现概率是多少
>
> 如果 $x$ 是已知确定的，$\theta$ 是变量，这个函数叫做似然函数(likelihood function)，它描述对于不同的模型参数，出现 $x$ 这个样本点的概率是多少
>
> **我们想办法让观察样本出现的概率最大**，就是极大似然估计

- 对数似然函数

> $\ln (L(\theta))$，由于 $\ln x$ 是 $x$ 的单调函数，使得 $\ln (L(\theta))$ 与 $L(\theta)$ 达到最大的 $\theta$ 相同，常利用对数似然函数求解极大似然估计。

- 泊松分布与全损指数分布的极大似然估计

> $\hat{\lambda_{Poisson}}=\overline{\boldsymbol{x}}$，$\hat{\lambda_{Exponential}}=\frac{1}{\bar{x}}$

- 有损指数分布的极大似然估计

> 设寿命小于 $T$ 的 $r$ 个观测值为 $x_{1}, x_{2}, \cdots, x_{r}$, 对应的 $r$ 个 $y_{k}$ 的值
>
> 剩下的 $n-r$ 个 $y_{k}$ 的取值均为 $T$, 每一个发生概率为 $P(X \geq T)=e^{-\lambda T}$
>
> 似然函数 $L\left(\lambda ; y_{1}, y_{2}, \cdots, y_{n}\right)=\lambda^{r} e^{-\lambda\left(x_{1}+x_{2}+\cdots+x_{r}\right)} \cdot e^{-\lambda(n-r) T}$
>
> $\ln L(\lambda)=r \ln \lambda-\lambda\left(x_{1}+x_{2}+\cdots+x_{r}\right)-\lambda(n-r) T$
>
> $\begin{array}{l}
> \frac{d \ln L(\lambda)}{d \lambda}=\frac{r}{\lambda}-\left(x_{1}+x_{2}+\cdots+x_{r}+(n-r) T\right)=0 \\
> \Rightarrow \hat{\lambda}=r /\left[x_{1}+\cdots+x_{r}+(n-r) T\right]
> \end{array}$

- 均匀分布的极大似然估计

> 参数 $a, b$ 的极大似然估计 $\hat{a}=\min \left(\boldsymbol{X}_{1}, \boldsymbol{X}_{2} \cdots, \boldsymbol{X}_{n}\right), \hat{b}=\max \left(\boldsymbol{X}_{1}, \boldsymbol{X}_{2} \cdots, \boldsymbol{X}_{n}\right)$
>
> **极大似然估计得到的不一定是无偏估计**

- 柯西分布的极大似然估计

> Cauchy 分布随机变量的期望不存在, 因此不能用矩估计法对参数 $\theta$ 进行估计
>
> 设 $x_{1}, x_{2}, \cdots, x_{n}$ 为来自该总体的样本观测值
>
> 似然函数 $L(\theta)=\prod_{k=1}^{n} f\left(x_{k} ; \theta\right)=\prod_{k=1}^{n} \frac{1}{\pi\left[1+\left(x_{k}-\theta\right)^{2}\right]}$
>
> 对数似然函数 $\ln L(\theta)=\sum_{k=1}^{n}-\left(\ln \pi+\ln \left(1+\left(x_{k}-\theta\right)^{2}\right)\right)$
>
> 将上式对 $\theta$ 求导，并令其等于 0 
>
> $\frac{d \ln L(\theta)}{d \theta}=-\sum_{k=1}^{n} \frac{x_{k}-\theta}{1+\left(x_{k}-\theta\right)^{2}}=0$
>
> 方程无法的到解析解，需要用一定的计算方法近似求解

- 相合估计

> 定理: 设 $\hat{\theta}_{n}=\hat{\theta}_{n}\left(x_{1}, x_{2}, \cdots, x_{n}\right)$ 是 $\theta$ 的一个估计量, 若 $\lim _{n \rightarrow \infty} E\left(\hat{\theta}_{n}\right)=\theta \quad \lim _{n \rightarrow \infty} \operatorname{Var}\left(\hat{\theta}_{n}\right)=0$，则 $\hat{\theta}_{n}$ 是参数 $\theta$ 的相合估计。

- 无偏性与有效性

> 无偏性，保证没有系统偏差
>
> 设 $\theta \in \Theta$ 为末知参数, $\hat{\theta}=\hat{\theta}\left(x_{1}, x_{2}, \cdots, x_{n}\right)$ 是 $\theta$ 的一个估计量，若对任意 $\theta \in \Theta$ 有 $E(\hat{\theta})=\theta$，则称 $\hat{\theta}$ 是参数 $\theta$ 的无偏估计。
>
> 有效性，希望估计围绕参数波动的幅度越小越好。
>
> 设 $\hat{\theta}_{1}, \hat{\theta}_{2}$ 是参数 $\theta$ 的无偏估计，如果对任意 $\theta \in \Theta$ 有 $\operatorname{Var}\left(\hat{\theta}_{1}\right) \leq \operatorname{Var}\left(\hat{\theta}_{2}\right)$，且至少有一个 $\theta \in \Theta$ 使得上述不等号严格成立，则称 $\hat{\theta}_{1}$ 比 $\hat{\theta}_{2}$ 有效。
>
> 简单的应用：样本数量的增加会改善估计。

- **极大似然估计**得到的不一定是无偏估计

> $X_{1}, X_{2}, \cdots, X_{n}$ 是来自均匀总体 $U(0, \theta)$ 的样本，参数 $\theta$ 的极大似然估计量 $\tilde{\theta}=\max _{1 \leq k \leq n} X_{k}$, 考查无偏性。
>
> 计算 $\tilde{\theta}=\max _{1 \leq k \leq n} X_{k}$ 的分布函数，当 $0 \leq y \leq \theta$ 时, 由样本的独立同分布性质，可知其分布函数（CDF）为
> $$
> F_{\dot{\theta}}(y)=P(\tilde{\theta} \leq y)=P\left(\max _{1 \leq k \leq n} X_{k} \leq y\right)=\prod_{k=1}^{n} P\left(X_{k} \leq y\right)=\left(\frac{y}{\theta}\right)^{n}
> $$
> $\tilde{\theta}=\max _{1 \leq k \leq n} X_{k}$ 的分布函数 $F_{\tilde{\theta}}(y)=\left\{\begin{array}{c}0, y<0 \\ \left(\frac{y}{\theta}\right)^{n}, 0 \leq y \leq \theta, \\ 1, y>\theta\end{array}\right.$
> 于是 $\tilde{\theta}$ 的概率密度（PDF）为 $f_{\tilde{\theta}}(y)=\left\{\begin{array}{c}\frac{n}{\theta^{n}} y^{n-1}, y \in[0, \theta] \\ 0, \text { 其它 }\end{array} \quad\right.$ 因此, 我们有
> $$
> \begin{aligned}
> E(\tilde{\theta}) &=\int_{-\infty}^{+\infty} y f_{\tilde{\theta}}(y) d y=\int_{0}^{\theta} y \frac{n}{\theta^{n}} y^{n-1} d y \\
> &=\frac{n}{\theta^{n}} \int_{0}^{\theta} y^{n} d y=\left.\frac{n}{\theta^{n}} \cdot \frac{y^{n+1}}{n+1}\right|_{0} ^{\theta}=\frac{n}{n+1} \theta
> \end{aligned}
> $$
> $E(\tilde{\theta})=E\left(\max _{1 \leq k \leq n} X_{k}\right)=\frac{n}{n+1} \theta$，统计量 $\max _{1 \leq k \leq n} X_{k}$ 不是参数 $\theta$ 的无偏估计，$\frac{n+1}{n} \max _{1 \leq k \leq n} X_{k}$ 则为无偏估计，称为无偏校正。

- 正态分布的极大似然估计

> 所以参数 $\mu$ 和 $\sigma^{2}$ 的极大似然估计量为 $\hat{\mu}=\bar{X}, \hat{\sigma}^{2}=\frac{1}{n} \sum_{i=1}^{n}\left(X_{i}-\bar{X}\right)^{2}$（与 $s^{2}=\frac{1}{n-1} \sum_{i=1}^{n}\left(x_{i}-\bar{x}\right)^{2}$ 完全没关系，而 $s^2$ 是 $\sigma^2$ 的无偏估计）
>
> 注意，估计的不是 $\sigma$，而是 $\sigma^2$

- 均方误差

> $$
> \begin{aligned}
> \operatorname{MSE}(\hat{\theta})=E(\hat{\theta}-\theta)^{2} &=E[(\hat{\theta}-E(\hat{\theta}))+(E(\hat{\theta})-\theta)]^{2} \\
> &=\operatorname{Var}(\hat{\theta})+(\boldsymbol{E}(\hat{\theta})-\theta)^{2}
> \end{aligned}
> $$
> 若 $\hat{\theta}$ 是参数 $\theta$ 的无偏估计, 则 $\operatorname{MSE}(\hat{\theta})=\operatorname{Var}(\hat{\theta})$
>
> 注: 很多时候, 无偏估计的均方误差会小于有偏估计的均方误差, 但二者之间并没有严格的对应关系，例如书上 324 页（第三版 286-287 页）例 6.4.1 即给出一个有偏估计均方误差小于无偏估计均方误差的实例。
>

# 参数区间估计

- 置信系数

> 抽取 n 个样本得到一个区间估计, 将这样的估计重复足够多次, 至少 $1-\alpha$ 比例的估计区间包含真实的 $\mu$ 值。这里置信系数是 $0.9544$, 即大约 $95.44 \%$ 估计区间包含真实的 $\mu$ 值。
>
> 或者说，这种抽样方法得到的这些区间至少有 $1-\alpha$ 的概率包含真实的 $\mu$ 值。
>
> 末知参数本身是确定的值, 不带有随机性。随机性是由区间引入的。

- 下侧 $\alpha$ 分位数

> $\Phi(d)=1-\frac{\alpha}{2}, \quad F(c)=\frac{\alpha}{2} \quad \Rightarrow \quad d=\Phi^{-1}\left(1-\frac{\alpha}{2}\right), \quad c=\Phi^{-1}\left(\frac{\alpha}{2}\right)$
>
> 标准正态分布的 $1-\frac{\alpha}{2}$ 分位数和 $\frac{\alpha}{2}$ 分位数，$d=u_{1-\frac{\alpha}{2}}, \quad c=u_{\frac{\alpha}{2}}=-u_{1-\frac{\alpha}{2}}$
>
> 在此基础上，可以看出 $P(u_{\frac{\alpha}{2}}\le Z\le u_{1-\frac{\alpha}{2}})=P(|Z|\le u_{1-\frac{\alpha}{2}})，u_{\alpha}=-u_{1-\alpha}$
>
> 最主要的还是理解分位数的反函数定义，小于 $\alpha$ 分位点的概率是 $\alpha$

> 标准正态分布的 $\alpha$ 分位点记为 $u_{\alpha}$
>
> $n$ 个自由度的 $\chi^{2}$ 分布的 $\alpha$ 分位点记为 $\chi_{\alpha}^{2}(n)$
>
> $n$ 个自由度的 $t$ 分布的 $\alpha$ 分位点记为 $t_{\alpha}(n)$
>
> $(m, n)$ 自由度的 $F$ 分布的 $\alpha$ 分位点记为 $F_{\alpha}(m, n)$
>
> $X$ 为一连续分布随机变量, 如果 $P(X \geq a)=\alpha$, $a$ 称为上侧 $\alpha$ 分位数

- 统计抽样定理

> 设 $x_{1}, x_{2}, \cdots, x_{n}$ 是来自正态总体 $N\left(\mu, \sigma^{2}\right)$ 的样本, 其样本均值和样本方差分别为:
> $\bar{x}=\frac{x_{1}+x_{2}+\cdots+x_{n}}{n}$ 和 $s^{2}=\frac{1}{n-1} \sum_{i=1}^{n}\left(x_{i}-\bar{x}\right)^{2}$, 则有
>
> 1. $\bar{x}$ 与 $s^{2}$ 相互独立
> 2. $\bar{x} \sim N\left(\mu, \frac{\sigma^{2}}{n}\right)$
> 3. $\frac{(n-1) \cdot s^{2}}{\sigma^{2}} \sim \chi^{2}(n-1)$

- 方差已知区间估计

> 总体 $N\left(\mu, \sigma^{2}\right), \sigma^{2}$ 已知，$\mu$ 末知，$x_{1}, x_{2}, \cdots, x_{n}$ 是简单随机样本, 求 $\mu$ 的1- $\alpha$ 置信区间
>
> $\frac{\bar{x}-\mu}{\sqrt{\frac{\sigma^{2}}{n}}}$ 可作为枢轴量, $Z=\frac{\bar{x}-\mu}{\sqrt{\frac{\sigma^{2}}{n}}}=\frac{\sqrt{n}(\bar{x}-\mu)}{\sigma} \sim N(0,1)$
>
> 构造出枢轴量之后，$P\left\{|\frac{\sqrt{n}(\bar{x}-\mu)}{\sigma}| \leq u_{1-\frac{\alpha}{2}}\right\}=1-\alpha$

- 方差未知区间估计

> 总体 $X \sim N\left(\mu, \sigma^{2}\right), \sigma^{2}$ 末知
>
> 1. 求参数 $\mu$ 的 $1-\alpha$ 置信区间
>
> $\bar{x} \sim N\left(\mu, \frac{\sigma^{2}}{n}\right), \quad \frac{\bar{x}-\mu}{\sigma / \sqrt{n}} \sim N(0,1)$
>
> $\bar{x}$ 与 $s^{2}$ 相互独立, 且 $\frac{(n-1) \cdot s^{2}}{\sigma^{2}} \sim \chi^{2}(n-1)$，$\frac{\frac{\bar{x}-\mu}{\sigma / \sqrt{n}}}{\sqrt{\frac{(n-1) \cdot s^{2}}{\sigma^{2}}}}$ 可以将 $\sigma$ 的影响消去。
>
> $$
> \frac{\frac{\bar{x}-\mu}{\sigma / \sqrt{n}}}{\sqrt{\frac{(n-1)s^2}{\sigma^2} /(n-1)}}=\frac{\bar{x}-\mu}{s / \sqrt{n}}=\frac{\sqrt{n}(\bar{x}-\mu)}{s} \sim t(n-1)
> $$
> 形式上是非常好记下来的。
>
> $-t_{1-\frac{\alpha}{2}}(n-1) \leq \frac{\sqrt{n}(\bar{x}-\mu)}{s} \leq t_{1-\frac{\alpha}{2}}(n-1)$
>
> $\bar{x}-\frac{s}{\sqrt{n}} t_{1-\frac{\alpha}{2}}(n-1) \leq \mu \leq \bar{x}+\frac{s}{\sqrt{n}} t_{1-\frac{\alpha}{2}}(n-1)$
>
> 2. 求 $\sigma^{2}$ 的 $1-\alpha$ 置信区间
>
> $\frac{(n-1) s^{2}}{\sigma^{2}} \sim \chi^{2}(n-1)$ 可作为枢轴量，$\left(\chi_{\frac{\alpha}{2}}^{2} \leq \frac{(n-1) s^{2}}{\sigma^{2}} \leq \chi_{1-\frac{\alpha}{2}}^{2}\right)=1-\alpha$
> $$
> P\left(\frac{(n-1) s^{2}}{\chi_{1-\frac{\alpha}{2}}^{2}} \leq \sigma^{2} \leq \frac{(n-1) s^{2}}{\chi_{\frac{\alpha}{2}}^{2}}\right)=1-\alpha \Rightarrow \sigma^{2} \in\left[\frac{(n-1) s^{2}}{\chi_{1-\frac{\alpha}{2}}^{2}}, \frac{(n-1) s^{2}}{\chi_{\frac{\alpha}{2}}^{2}}\right]
> $$
> **去除未知参数的影响**

- Behrens-Fisher 问题

> $x_{1}, \cdots, x_{m}$ 来自正态总体 $N\left(\mu_{1}, \sigma_{1}{ }^{2}\right), y_{1}, \cdots, y_{n}$ 来自正态总体 $N\left(\mu_{2}, \sigma_{2}{ }^{2}\right), \mu_{1} 、 \mu_{2}$ 末知， $\sigma_{1}{ }^{2}=\sigma_{2}{ }^{2}=\sigma^2$ 末知，求 $\mu_{2}-\mu_{1}$ 的 $1-\alpha$ 置信区间。
>
> $\bar{x} \sim N\left(\mu_{1}, \frac{\sigma^{2}}{m}\right), \bar{y} \sim N\left(\mu_{2}, \frac{\sigma^{2}}{n}\right), \quad \bar{x}-\bar{y} \sim N\left(\mu_{1}-\mu_{2}, \frac{\sigma^{2}}{m}+\frac{\sigma^{2}}{n}\right)$
>
> $\frac{(m-1) s_{x}^{2}}{\sigma^{2}} \sim \chi^{2}(m-1), \frac{(n-1) s_{y}^{2}}{\sigma^{2}} \sim \chi^{2}(n-1), \quad \frac{(m-1) s_{x}^{2}}{\sigma^{2}}+\frac{(n-1) s_{y}^{2}}{\sigma^{2}} \sim \chi^{2}(m+n-2)$
>
> $$
> \frac{\frac{(\bar{x}-\bar{y})-\left(\mu_{1}-\mu_{2}\right)}{\sigma \sqrt{\frac{1}{m}+\frac{1}{n}}}}{\sqrt{\frac{(m-1) s_{x}^{2}+(n-1) s_{y}^{2}}{\sigma^{2}} /(m+n-2)}}=\frac{\sqrt{m+n-2}}{\sqrt{\frac{1}{m}+\frac{1}{n}}} \cdot \frac{(\bar{x}-\bar{y})-\left(\mu_{1}-\mu_{2}\right)}{\sqrt{(m-1) s_{x}^{2}+(n-1) s_{y}^{2}}} \sim t(m+n-2)
> $$
> **这个问题还可以用渐进正态分布来处理**
>
> $\frac{\bar{x}-\bar{y}-\left(\mu_{1}-\mu_{2}\right)}{\sqrt{\sigma_{x}^{2} / m+\sigma_{y}^{2} / n}} \sim N(0,1), \quad \frac{\bar{x}-\bar{y}-\left(\mu_{1}-\mu_{2}\right)}{\sqrt{s_{x}^{2} / m+s_{y}^{2} / n}} \sim N(0,1)$

- 正态方差之商的区间估计

> 例 $x_{1}, \cdots, x_{m}$ 来自正态总体 $N\left(\mu_{1}, \sigma_{1}^{2}\right), y_{1}, \cdots, y_{n}$ 来自正态总体 $N\left(\mu_{2}, \sigma_{2}{ }^{2}\right)$, $\mu_{1} 、 \mu_{2}$ 末知， $\sigma_{1}{ }^{2} 、 \sigma_{2}{ }^{2}$ 末知, 求 $\sigma_{1}{ }^{2} / \sigma_{2}{ }^{2}$ 的区间估计。
>
> $$
> \begin{array}{l}
> \frac{(m-1) s_{1}{ }^{2}}{\sigma_{1}{ }^{2}} \sim \chi^{2}(m-1), \quad \frac{(n-1) s_{2}{ }^{2}}{\sigma_{2}{ }^{2}} \sim \chi^{2}(n-1) \\
> \Rightarrow \quad F=\frac{s_{1}{ }^{2} / \sigma_{1}{ }^{2}}{s_{2}{ }^{2} / \sigma_{2}{ }^{2}} \sim F(m-1, n-1)
> \end{array}
> $$

- 指数分布的区间分布

> $x_{1}, \cdots, x_{n}$ 来自指数总体 $\operatorname{Exp}(\lambda)$, 求参数 $\lambda$ 的区间估计
>
> 可以证明 $X=2 \lambda\left(x_{1}+\cdots+x_{n}\right) \sim \chi^{2}(2 n) \Rightarrow 2 n \lambda \bar{x} \sim \chi^{2}(2 n)$
>
> $P\left(\chi_{\frac{\alpha}{2}}^{2}(2 n) \leq 2 n \lambda \bar{x} \leq \chi_{1-\frac{\alpha}{2}}^{2}(2 n)\right)=1-\alpha$
> $\Rightarrow \chi_{\frac{\alpha}{2}}^{2}(2 n) \leq 2 n \lambda \bar{x} \leq \chi_{1-\frac{\alpha}{2}}^{2}(2 n)$
> $\Rightarrow \lambda \in\left[\chi_{\frac{\alpha}{2}}^{2}(2 n) / 2 n \bar{x}, \chi_{1-\frac{\alpha}{2}}^{2}(2 n) / 2 n \bar{x}\right]$

- 均匀分布的区间估计

> $F_{x_{(j)}}(x, \theta)=\left(\frac{x}{\theta}\right)^{n}, \quad Y=\frac{x_{(n)}}{\theta}, \quad F_{Y}(y)=P(Y<y)=P\left(\frac{x_{(n)}}{\theta}<y\right)=y^{n}$
>
> $\frac{x_{(n)}}{\theta}$ 可作为枢轴量
>
> $P\left(c \leq \frac{x_{(n)}}{\theta} \leq d\right)=d^{n}-c^{n}=1-\alpha \Rightarrow \frac{x_{(n)}}{d} \leq \theta \leq \frac{x_{(n)}}{c}$
>
> 可取 $d=1, c=\sqrt[n]{\alpha}, \quad \theta \in\left[x_{(n)}, \frac{x_{(n)}}{\sqrt[n]{\alpha}}\right]$

- 基于渐进分布的两点分布区间估计

> 例 样本 $X_{1}, \cdots, X_{n}$ 来自两点分布总体 $\boldsymbol{b}(1, \boldsymbol{p})$, 求 $\boldsymbol{p}$ 的区间估计。
> 解：样本均值的期望、方差分别为 $E(\bar{X})=p, \operatorname{Var}(\bar{X})=\frac{p(1-p)}{n}$ 根据中心极限定理当 $n$ 较大时, 有近似分布 $\bar{X} \dot{\sim} N\left(p, \frac{p(1-p)}{n}\right)$, 标准化后得到枢轴量 $\frac{\bar{X}-p}{\sqrt{\frac{p(1-p)}{n}}} \dot{\sim} N(0,1)$
> $$
> P\left(\left|\frac{\bar{X}-p}{\sqrt{p(1-p) / n}}\right| \leq u_{1 \frac{\alpha}{2}}\right) \approx 1-\alpha, \quad \text { 即 }(\bar{X}-p)^{2} \leq u_{1-\frac{\alpha}{2}}^{2} \frac{p(1-p)}{n}
> $$
> $\frac{1}{1+c}\left(\bar{X}+\frac{c}{2}-\sqrt{\frac{\bar{X}(1-\bar{X})}{n} u_{1-\frac{\alpha}{2}}^{2}+\frac{c^{2}}{4}}\right) \leq p \leq \frac{1}{1+c}\left(\bar{X}+\frac{c}{2}+\sqrt{\frac{\bar{X}(1-\bar{X})}{n} u_{1-\frac{\alpha}{2}}^{2}+\frac{c^{2}}{4}}\right)$

# 假设检验

- 假设检验的基本步骤

> 1. 建立假设 $\mathrm{H}_{0}: \theta \in \Theta_{0} \quad$ VS $\quad H_{1}: \theta \in \Theta_{1}$（原假设和备择假设不一定是对立的）
> 2. 选择检验统计量, 给出拒绝域的形式——所谓拒绝域 W是指使原假设被拒绝的样本观测值所在的区域, 有时也将 $\overline{\mathbf{W}}$ 称为接受域。
> 3. 选择显著性水平 $\alpha$ (具体异常到什么程度拒绝原假设)。其定义为 $\alpha=\max \left\{\mathrm{P}\left(\right.\right.$ 拒绝 $\mathrm{H}_{0} \mid \mathrm{H}_{0}$ 为真 $\left.)\right\}=\max \left\{\mathrm{P}_{\theta}(\mathrm{X} \in \mathbf{W}), \boldsymbol{\theta} \in \Theta_{0}\right\}$，也即原假设成立时被拒绝的概率的最大值。（如果原假设是 $\mu \ge const$，那么 $\alpha$ 就是取最大值，一般就在 $\mu=const$ 时取到，如果原假设就是 $\mu=const$，那么 $\alpha$ 就是 $\mu=const$ 时被拒绝的概率）
> 4.  给出拒绝域的具体范围。

- 两类错误

> 第一类错误 $\alpha(\theta)=\mathrm{P}\left(\right.$ 拒绝 $\mathrm{H}_{0} \mid \mathrm{H}_{0}$ 为真 $)=\mathrm{P}_{\theta}(\mathrm{X} \in \mathrm{W}), \theta \in \Theta_{0}$
>
> 第二类错误 $\beta(\theta)=P\left(\right.$ 接受 $H_{0} \mid H_{1}$ 为真 $)=P_{\theta}(X \in \bar{W}), \theta \in \Theta_{1}$
>
> 举个例子：
>
> 对均匀总体 $U(0, \theta)$ 做假设检验, 原假设与备择假设分别为 $H_{0}: \theta=5, H_{1}: \theta<5$, 以 $x_{(n)}=\max \left\{x_{1}, \cdots, x_{n}\right\}$ 为检验统计量, 显著性水平 $\alpha=0.064$, 若样本容量 $\boldsymbol{n}=\mathbf{3}$, 则拒绝域为
>
> 解: 只需要根据 $\alpha$ 的定义，原假设为真时，拒绝检验统计量的最大概率。
>
> $P\left(x_{(n)}<c\right)=\left(\frac{c}{5}\right)^{n}=\alpha \Rightarrow\left(\frac{c}{5}\right)^{3}=0.064 \Rightarrow c=2, \quad\left\{\left(x_{1}, x_{2}, x_{3}\right): x_{(3)}<2\right\}$

- U 检测（方差已知）

> 正态总体 $N\left(\mu, \sigma^{2}\right), \mu$ 末知, $\sigma^{2}$ 已知, 对 $\mu$ 做检验
> 检 验 统 计 量 $: u=\frac{\bar{x}-\mu_{0}}{\sigma / \sqrt{n}}=\frac{\sqrt{n}\left(\bar{x}-\mu_{0}\right)}{\sigma} \sim N(0,1)$ 
>
> $H_{0}: \mu=\mu_{0} ; \quad H_{1}: \mu \neq \mu_{0} \quad$ 拒绝域 $\bar{x}>\mu_{0}+\frac{\sigma}{\sqrt{n}} u_{1-\frac{\alpha}{2}}$ 或 $\bar{x}<\mu_{0}-\frac{\sigma}{\sqrt{n}} u_{1-\frac{\alpha}{2}}$
>
>  $H_{0}: \mu \geq \mu_{0} ; \quad H_{1}: \mu<\mu_{0} \quad$ 拒绝域 $\bar{x}<\mu_{0}-\frac{\sigma}{\sqrt{n}} u_{1-\alpha}$ 
>
> $H_{0}: \mu \leq \mu_{0} ; \quad H_{1}: \mu>\mu_{0} \quad$ 拒绝域 $\bar{x}>\mu_{0}+\frac{\sigma}{\sqrt{n}} u_{1-\alpha}$

- t 检测（方差未知）

> 正态总体 $N\left(\mu, \sigma^{2}\right), \mu$ 末知, $\sigma^{2}$ 末知, 对 $\mu$ 做检验，检验统计量 $t=\frac{\bar{x}-\mu_{0}}{s / \sqrt{n}}=\frac{\sqrt{n}\left(\bar{x}-\mu_{0}\right)}{s} \sim t(n-1)$
> $$
> \begin{array}{ll}
> H_{0}: \mu=\mu_{0} ; \quad H_{1}: \mu \neq \mu_{0} & \text { 拒绝域 } \bar{x}>\mu_{0}+\frac{\sigma}{\sqrt{n}} t_{1-\frac{\alpha}{2}}(n-1) \text { 或 } \bar{x}<\mu_{0}-\frac{\sigma}{\sqrt{n}} t_{1-\frac{\alpha}{2}}(n-1) \\
> H_{0}: \mu \geq \mu_{0} ; H_{1}: \mu<\mu_{0} & \text { 拒绝域 } \bar{x}<\mu_{0}-\frac{\sigma}{\sqrt{n}} t_{1-\alpha}(n-1) \\
> H_{0}: \mu \leq \mu_{0} ; H_{1}: \mu>\mu_{0} & \text { 拒绝域 } \bar{x}>\mu_{0}+\frac{\sigma}{\sqrt{n}} t_{1-\alpha}(n-1)
> \end{array}
> $$

- p 值（更异常的概率）

> 检验的 p 值: 在一个假设检验问题中, 利用样本观测值能够做出拒绝原假设的最小显著性水平; **即原假设成立条件下, 检验统计量出现在比观测值更异常的范围的概率的最大值**
>
> 所谓更异常，指的是更偏向备择假设的那个方向。
>
> 判断产品是否优质的问题 $H_{0}: \mu \geq 10$ vs $H_{1}: \mu<10$; 两次观测结果 $\bar{x}=9.3, \bar{x}=10.15$ 
>
> p 值分别为
> $$
> \begin{array}{l}
> p_{1}=P(\bar{x} \leq 9.3)=P\left(\frac{\bar{x}-10}{1 / 2} \leq \frac{9.3-10}{1 / 2}\right)=\Phi(-1.4)=0.081 \\
> p_{2}=P(\bar{x} \leq 10.15)=P\left(\frac{\bar{x}-10}{1 / 2} \leq \frac{10.15-10}{1 / 2}\right)=\Phi(0.3)=0.618
> \end{array}
> $$

# 拟合优度检验与贝叶斯估计

- 势函数

> 检验问题 $\mathrm{H}_{0}: \theta \in \Theta_{0} \quad\mathrm{ VS } \quad \mathrm{H}_{1}: \theta \in \Theta_{1}$ 拒绝域为 $\mathrm{X} \in \mathrm{W}$ 该检验的势函数: $\mathbf{g}(\theta)=P_{\theta}(X \in W)$
>
> 第一类错误 $\alpha(\theta)=\mathrm{P}\left(\right.$ 拒绝 $\mathrm{H}_{0} \mid \mathrm{H}_{0}$ 为真 $)=\mathrm{P}_{\theta}(\mathrm{X} \in \mathrm{W}), \theta \in \Theta_{0}$
>
> 第二类错误 $\beta(\theta)=P\left(\right.$ 接受 $H_{0} \mid H_{1}$ 为真 $)=P_{\theta}(X \in \bar{W}), \theta \in \Theta_{1}$
> $$
> g(\theta)=\left\{\begin{array}{cc}
> \alpha(\theta), & \theta \in \Theta_{0} \\
> 1-\beta(\theta), & \theta \in \Theta_{1}
> \end{array}\right.
> $$
> 如果对任意的 $\theta \in \Theta_{0}$，都有 $\mathrm{g}(\theta) \leq \alpha$，则称该检验是显著性水平为 $\alpha$ 的显著性检验，简称显著性水平为 $\alpha$ 的检验或水平为 $\alpha$ 的检验

-  拟合优度检验

> K.Pearson 的  $\chi^{2}$ 检验
>
> 设总体服从离散分布：
>
> $\begin{array}{cccc}\boldsymbol{X} & \boldsymbol{x}_{1} & \cdots & \boldsymbol{x}_{k} \\ \boldsymbol{P} & \boldsymbol{p}_{1} & \cdots & \boldsymbol{p}_{k}\end{array}$
>
> 进行 $n$ 次独立地观测, $k$ 个取值出现的频次分别为 $N_{i}(i=1, \cdots, k)$, 则 $X=\sum_{i=1}^{k} \frac{\left(N_{i}-n p_{i}\right)^{2}}{n p_{i}}$ 近似服从自由度为 $k-1$ 的 $\chi^{2}$ 分布。若需要通过样本估计 $\mathrm{s}$ 个参数，则 $X=\sum_{i=1}^{\mathrm{n}} \frac{\left(N_{i}-N p_{i}\right)^{2}}{N p_{i}}$ 近似服从自由度 $\mathrm{k}-\mathrm{s}-1$ 的卡方分布。
>

- 列联表检测

> 行 $c_i$，列 $d_i$
> $$
> Y=\sum_{i=1}^{s} \sum_{j=1}^{t} \frac{\left(n_{i j}-n \cdot \frac{c_{i}}{n} \cdot \frac{d_{j}}{n}\right)^{2}}{n \cdot \frac{c_{i}}{n} \cdot \frac{d_{j}}{n}}=\sum_{i=1}^{s} \sum_{j=1}^{t} \frac{\left(n n_{i j}-c_{i} d_{j}\right)^{2}}{n c_{i} d_{j}}
> $$
> 近似服从自由度为 $(s-1)(t-1)$ 的 $\chi^{2}$ 分布

