数学 数理统计

总体与样本

区分总体分布、随机样本与观测值,说明独立同分布样本的空间、联合分布和密度。

本页目录3 节

总体与样本 #

总体与个体 #

总体是统计问题中研究对象的全体,个体是其中的每个成员。建模时关注的是某一指标及其分布:例如研究全国大学生的身高,记录身高,而不是把体重、成绩等其他指标混入同一个变量。用随机变量 XX 描述所研究的指标,其分布称为总体分布。

可从两个角度分类:

  • 分布模型:正态分布总体、指数分布总体等属于指定的有参分布族,参数可以未知;非参数模型不把总体分布限定在某个有限维参数族内。“参数未知”本身不等于“非参数”。
  • 个体数目:有限总体与无限总体。这一分类与采用哪种分布模型是不同的维度。

样本 #

抽样前,用随机变量 X1,X2,,XnX_1,X_2,\ldots,X_n 表示将要获得的指标值,称为随机样本;抽样后实际记录的 x1,x2,,xnx_1,x_2,\ldots,x_n 是它的一次实现,称为样本值nn 称为样本容量样本量,抽取的个体也称为样品。

这就是样本的二重性:推断概率性质时讨论随机变量,分析一份已经收集的数据时讨论它们的观测值。

本节采用数理统计中的简单随机样本模型

  • 同分布:每个 XiX_i 都服从总体分布 FXF_X
  • 相互独立:对任意可测集合 A1,,AnA_1,\ldots,A_n,有 P(X1A1,,XnAn)=i=1nP(XiAi)P(X_1\in A_1,\ldots,X_n\in A_n)=\prod_{i=1}^nP(X_i\in A_i)

二者合称独立同分布,记为 X1,,Xni.i.d.FXX_1,\ldots,X_n\overset{\mathrm{i.i.d.}}{\sim}F_X。独立同分布是模型假设,不是任何“随机抽取”都会自动满足的性质。有限总体的不放回简单随机抽样通常产生依赖;若每次独立地等概率、有放回抽取,指标值才符合相应的独立同分布模型。不同指标取值的概率也不必相等。

若单个观测的取值空间为 X\mathcal X,则有序样本向量 (X1,,Xn)(X_1,\ldots,X_n) 的样本空间取为

X=Xn={(x1,,xn):xiX, i=1,,n}.\mathscr X=\mathcal X^n =\{(x_1,\ldots,x_n):x_i\in\mathcal X,\ i=1,\ldots,n\}.

它描述所有可能的样本向量,不是某次观测值组成的集合 {x1,,xn}\{x_1,\ldots,x_n\}。例如两次 Bernoulli 观测的样本空间为 {(0,0),(0,1),(1,0),(1,1)}\{(0,0),(0,1),(1,0),(1,1)\};顺序和重复值都不能丢失。

设总体分布函数为 FXF_X。独立同分布样本的联合分布函数

FX1,,Xn(x1,,xn)=P(X1x1,,Xnxn)=独立性i=1nFXi(xi)=同分布i=1nFX(xi).\begin{aligned} F_{X_1,\ldots,X_n}(x_1,\ldots,x_n) &=P(X_1\le x_1,\ldots,X_n\le x_n)\\ &\overset{\text{独立性}}{=}\prod_{i=1}^n F_{X_i}(x_i)\\ &\overset{\text{同分布}}{=}\prod_{i=1}^n F_X(x_i). \end{aligned}

若总体具有概率密度 fXf_X,联合密度相应为

fX1,,Xn(x1,,xn)=i=1nfX(xi).f_{X_1,\ldots,X_n}(x_1,\ldots,x_n)=\prod_{i=1}^n f_X(x_i).

离散总体的联合概率质量函数也有同样的乘积形式;没有密度的分布仍可使用上面的分布函数公式。

讨论

评论

正在加载评论…

输入关键词开始搜索。