
机器学习必备基础知识,力求以最简洁的语言,描述最完整的内容。
很多知识没有深入剖析,也没必要深入剖析。大致了解知识框架之后,即可开始学习机器学习,有不懂的再回过头再仔细研究,驱动式学习才是最高效的学习。
P ( X = x i ) = p i , i = 1 , 2 , . . . P(X=x_i)=p_i,i=1,2,... P(X=xi)=pi,i=1,2,...,若级数 ∑ i = 1 + ∞ ∣ x i ∣ p i \sum_{i=1}^{+\infin}|x_i|p_i ∑i=1+∞∣xi∣pi收敛,则称 ∑ i = 1 + ∞ x i p i \sum_{i=1}^{+\infin}x_ip_i ∑i=1+∞xipi为 X X X的数学期望,记为 E X EX EX;如果发散,那么 E X EX EX不存在
0-1分布 取1的概率为
p
p
p, 取0的概率为
1
−
p
1-p
1−p
E
X
=
1
⋅
p
+
0
⋅
(
1
−
p
)
=
p
EX=1·p+0·(1-p)=p
EX=1⋅p+0⋅(1−p)=p
二项分布
B
(
n
,
p
)
B(n,p)
B(n,p)
E
X
=
∑
k
=
0
n
k
P
(
X
=
k
)
=
∑
k
=
1
n
k
C
n
k
p
k
(
1
−
p
)
n
−
k
=
∑
k
=
1
n
k
n
!
k
!
(
n
−
k
)
!
p
k
(
1
−
p
)
n
−
k
=
∑
k
=
1
n
n
!
(
k
−
1
)
!
(
n
−
k
)
!
p
k
(
1
−
p
)
n
−
k
=
n
p
∑
k
=
1
n
(
n
−
1
)
!
(
k
−
1
)
!
(
(
n
−
1
)
−
(
k
−
1
)
)
!
p
k
−
1
(
1
−
p
)
(
n
−
1
)
−
(
k
−
1
)
=
n
p
∑
k
=
1
n
C
n
−
1
k
−
1
p
k
−
1
(
1
−
p
)
(
1
−
p
)
(
n
−
1
)
−
(
k
−
1
)
=
n
p
泊松分布
P
(
X
=
k
)
=
λ
k
k
!
e
−
λ
,
k
=
0
,
1
,
2
,
.
.
.
P(X=k)=\frac{\lambda^k}{k!}e^{-\lambda},k=0,1,2,...
P(X=k)=k!λke−λ,k=0,1,2,...
E
X
=
∑
k
=
0
+
∞
k
P
(
X
=
k
)
=
∑
k
=
1
+
∞
k
λ
k
k
!
e
−
λ
=
λ
∑
k
=
1
+
∞
λ
k
−
1
(
k
−
1
)
!
e
−
λ
=
λ
EX=\sum_{k=0}^{+\infin}kP(X=k)=\sum_{k=1}^{+\infin}k\frac{\lambda^k}{k!}e^{-\lambda}=\lambda\sum_{k=1}^{+\infin}\frac{\lambda^{k-1}}{(k-1)!}e^{-\lambda}=\lambda
EX=k=0∑+∞kP(X=k)=k=1∑+∞kk!λke−λ=λk=1∑+∞(k−1)!λk−1e−λ=λ
泊松分布的期望就是参数
λ
\lambda
λ,还记得之前二项分布中的
n
n
n很大
p
p
p很小时,就变成泊松分布,其中
λ
=
n
p
\lambda=np
λ=np
若积分 ∫ − ∞ + ∞ ∣ x ∣ p ( x ) d x < + ∞ \int_{-\infin}^{+\infin}|x|p(x){\rm d}x<+\infin ∫−∞+∞∣x∣p(x)dx<+∞,则 E X = ∫ − ∞ + ∞ x p ( x ) d x EX=\int_{-\infin}^{+\infin}xp(x){\rm d}x EX=∫−∞+∞xp(x)dx
p ( x ) Δ x p(x)\Delta x p(x)Δx近似表示 X X X在 ( x , x + Δ x ] (x,x+\Delta x] (x,x+Δx]内取值的概率,这里的积分就相当于离散型中的求和
一些常见分布的数学期望
均匀分布
p
(
x
)
=
{
1
b
−
a
,
a
<
x
<
b
0
,
其他
E
X
=
∫
−
∞
+
∞
x
p
(
x
)
d
x
=
∫
a
b
x
b
−
a
d
x
=
a
+
b
2
p(x)=
指数分布
X
∼
E
(
λ
)
,
λ
>
0
X\sim E(\lambda),\lambda>0
X∼E(λ),λ>0
p
(
x
)
=
λ
e
−
λ
x
,
x
>
0
E
X
=
∫
0
+
∞
x
p
(
x
)
d
x
=
λ
∫
0
+
∞
x
e
−
λ
x
d
x
=
1
λ
p(x)=\lambda e^{-\lambda x},x>0\\ EX=\int_0^{+\infin}xp(x){\rm d }x=\lambda\int_0^{+\infin}xe^{-\lambda x}{\rm d}x=\frac1\lambda
p(x)=λe−λx,x>0EX=∫0+∞xp(x)dx=λ∫0+∞xe−λxdx=λ1
正态分布
x
∼
N
(
μ
,
σ
2
)
x\sim N(\mu,\sigma^2)
x∼N(μ,σ2)
p
(
x
)
=
1
2
π
σ
e
−
(
x
−
μ
)
2
2
σ
2
E
X
=
∫
−
∞
+
∞
x
p
(
x
)
d
x
=
∫
−
∞
+
∞
x
1
2
π
σ
e
−
(
x
−
μ
)
2
2
σ
2
d
x
p(x)=\frac1{\sqrt{2\pi}\sigma}e^{-\frac{(x-\mu)^2}{2\sigma^2}}\\ EX=\int_{-\infin}^{+\infin}xp(x){\rm d}x=\int_{-\infin}^{+\infin}x\frac1{\sqrt{2\pi}\sigma}e^{-\frac{(x-\mu)^2}{2\sigma^2}}{\rm d}x
p(x)=2πσ1e−2σ2(x−μ)2EX=∫−∞+∞xp(x)dx=∫−∞+∞x2πσ1e−2σ2(x−μ)2dx
令
t
=
x
−
μ
σ
t=\frac{x-\mu}{\sigma}
t=σx−μ,则
x
=
σ
t
+
μ
x=\sigma t+\mu
x=σt+μ
则
E
X
=
1
2
π
∫
−
∞
+
∞
(
σ
t
+
μ
)
e
−
t
2
2
d
t
=
μ
EX=\frac1{\sqrt{2\pi}}\int_{-\infin}^{+\infin}(\sigma t+\mu)e^{-\frac {t^2}{2}}{\rm d}t=\mu
EX=2π1∫−∞+∞(σt+μ)e−2t2dt=μ
设 X X X的函数 Y = g ( X ) Y=g(X) Y=g(X)也是一个随机变量,则
若
X
X
X为离散型,分布律
P
(
X
=
x
k
)
=
p
k
,
k
=
1
,
2
,
.
.
.
P(X=x_k)=p_k,k=1,2,...
P(X=xk)=pk,k=1,2,...,若
∑
k
=
1
+
∞
∣
g
(
x
k
)
∣
p
k
\sum_{k=1}^{+\infin}|g(x_k)|p_k
∑k=1+∞∣g(xk)∣pk收敛,则
E
Y
=
∑
k
=
1
+
∞
g
(
x
k
)
p
k
EY=\sum_{k=1}^{+\infin}g(x_k)p_k
EY=k=1∑+∞g(xk)pk
若
X
X
X为连续型,密度函数为
p
(
x
)
p(x)
p(x),若
∫
−
∞
+
∞
∣
g
(
x
)
∣
p
(
x
)
d
x
<
+
∞
\int_{-\infin}^{+\infin}|g(x)|p(x){\rm d}x<+\infin
∫−∞+∞∣g(x)∣p(x)dx<+∞,则
E
Y
=
∫
−
∞
+
∞
g
(
x
)
p
(
x
)
d
x
EY=\int_{-\infin}^{+\infin}g(x)p(x){\rm d}x
EY=∫−∞+∞g(x)p(x)dx
推广到随机向量类型
定义:若 E X 2 < + ∞ EX^2<+\infin EX2<+∞,则称 E ( X − E X ) 2 E(X-EX)^2 E(X−EX)2为随机变量 X X X的方差,记为 D ( X ) D(X) D(X)或 V a r ( X ) Var(X) Var(X),同时称 D ( X ) \sqrt{D(X)} D(X)为 X X X的均方差或标准差,记为 σ ( X ) \sigma(X) σ(X)
事实上,方差 D ( X ) D(X) D(X)就是随机变量 X X X的函数 g ( X ) = ( X − E X ) 2 g(X)=(X-EX)^2 g(X)=(X−EX)2的数学期望,方差不一定存在
那么方差公式如下:
X
X
X离散型
P
(
X
=
x
k
)
=
p
k
,
k
=
1
,
2
,
.
.
.
P(X=x_k)=p_k,k=1,2,...
P(X=xk)=pk,k=1,2,...
D
(
X
)
=
E
(
X
−
E
X
)
2
=
∑
k
=
1
+
∞
(
x
k
−
E
X
)
2
p
k
D(X)=E(X-EX)^2=\sum_{k=1}^{+\infin}(x_k-EX)^2p_k
D(X)=E(X−EX)2=k=1∑+∞(xk−EX)2pk
X
X
X连续型,密度函数
p
(
x
)
p(x)
p(x)
D
(
X
)
=
E
(
X
−
E
X
)
2
=
∫
−
∞
+
∞
(
x
−
E
X
)
2
p
(
x
)
d
x
D(X)=E(X-EX)^2=\int_{-\infin}^{+\infin}(x-EX)^2p(x){\rm d}x
D(X)=E(X−EX)2=∫−∞+∞(x−EX)2p(x)dx
不过这个
E
(
X
−
E
X
)
2
E(X-EX)^2
E(X−EX)2似乎可以化简一下:
D
(
X
)
=
E
(
X
−
E
X
)
2
=
E
[
X
2
−
2
X
E
X
+
(
E
X
)
2
]
=
E
X
2
−
2
E
X
⋅
E
X
+
(
E
X
)
2
=
E
X
2
−
(
E
X
)
2
D(X)=E(X-EX)^2=E[X^2-2XEX+(EX)^2]=EX^2-2EX·EX+(EX)^2=EX^2-(EX)^2
D(X)=E(X−EX)2=E[X2−2XEX+(EX)2]=EX2−2EX⋅EX+(EX)2=EX2−(EX)2
所以
D
(
X
)
=
E
X
2
−
(
E
X
)
2
D(X)=EX^2-(EX)^2
D(X)=EX2−(EX)2
离散型
二项分布,
X
∼
B
(
n
,
p
)
X\sim B(n,p)
X∼B(n,p)
E
X
=
n
p
EX=np
EX=np
D
(
X
)
=
E
X
2
−
(
E
X
)
2
E
X
2
=
∑
k
=
0
n
k
2
P
(
X
=
k
)
=
∑
k
=
1
n
k
2
C
n
k
p
k
(
1
−
p
)
n
−
k
=
n
p
∑
k
=
1
n
k
⋅
(
n
−
1
)
!
(
k
−
1
)
!
(
n
−
k
)
!
p
k
−
1
(
1
−
p
)
(
n
−
1
)
−
(
k
−
1
)
/
/
比
E
X
每项多乘了个
k
=
n
p
∑
k
=
1
n
[
(
k
−
1
)
+
1
]
⋅
(
n
−
1
)
!
(
k
−
1
)
!
(
n
−
k
)
!
p
k
−
1
(
1
−
p
)
(
n
−
1
)
−
(
k
−
1
)
=
n
p
∑
k
=
1
n
(
k
−
1
)
⋅
(
n
−
1
)
!
(
k
−
1
)
!
(
n
−
k
)
!
p
k
−
1
(
1
−
p
)
(
n
−
1
)
−
(
k
−
1
)
+
n
p
∑
k
=
1
n
(
n
−
1
)
!
(
k
−
1
)
!
(
n
−
k
)
!
p
k
−
1
(
1
−
p
)
(
n
−
1
)
−
(
k
−
1
)
/
/
左边是
n
p
⋅
[
B
(
n
−
1
,
k
)
的期望
]
,右边是
n
p
⋅
1
=
n
p
[
(
n
−
1
)
p
+
1
]
所以
D
(
X
)
=
n
p
[
(
n
−
1
)
p
+
1
]
+
(
n
p
)
2
=
n
p
(
1
−
p
)
=
n
p
q
泊松分布,
X
∼
P
(
λ
)
X\sim P(\lambda)
X∼P(λ)
p
k
=
P
(
X
=
k
)
=
λ
k
k
!
e
−
λ
(
k
=
0
,
1
,
2...
,
n
)
,
λ
>
0
E
X
=
λ
D
(
X
)
=
E
X
2
−
(
E
X
)
2
E
X
2
=
∑
k
=
0
+
∞
k
2
P
(
X
=
k
)
=
∑
k
=
1
+
∞
k
2
λ
k
k
!
e
−
λ
=
λ
∑
k
=
1
+
∞
k
λ
k
−
1
(
k
−
1
)
!
e
−
λ
=
λ
∑
k
=
1
+
∞
[
(
k
−
1
)
+
1
]
λ
k
−
1
(
k
−
1
)
!
e
−
λ
=
λ
∑
k
=
1
+
∞
(
k
−
1
)
λ
k
−
1
(
k
−
1
)
!
e
−
λ
+
λ
∑
k
=
1
+
∞
λ
k
−
1
(
k
−
1
)
!
e
−
λ
/
/
左边是
λ
⋅
E
X
,右边是
λ
=
λ
2
+
λ
所以
D
(
X
)
=
λ
2
+
λ
−
λ
2
=
λ
p_k=P(X=k)=\frac{\lambda^k}{k!}e^{-\lambda}\\(k=0,1,2...,n),\ \lambda>0\\ EX=\lambda\\ \begin{align*} D(X)&=EX^2-(EX)^2\\ EX^2&=\sum_{k=0}^{+\infin}k^2P(X=k)\\ &=\sum_{k=1}^{+\infin}k^2\frac{\lambda^k}{k!}e^{-\lambda}=\lambda\sum_{k=1}^{+\infin}k\frac{\lambda^{k-1}}{(k-1)!}e^{-\lambda}\\ &=\lambda\sum_{k=1}^{+\infin}[(k-1)+1]\frac{\lambda^{k-1}}{(k-1)!}e^{-\lambda}\\ &=\lambda\sum_{k=1}^{+\infin}(k-1)\frac{\lambda^{k-1}}{(k-1)!}e^{-\lambda}+\lambda\sum_{k=1}^{+\infin}\frac{\lambda^{k-1}}{(k-1)!}e^{-\lambda}\\ //&左边是\lambda·EX,右边是\lambda\\ &=\lambda^2+\lambda\\ 所以D(X)&=\lambda^2+\lambda-\lambda^2=\lambda \end{align*}
pk=P(X=k)=k!λke−λ(k=0,1,2...,n), λ>0EX=λD(X)EX2//所以D(X)=EX2−(EX)2=k=0∑+∞k2P(X=k)=k=1∑+∞k2k!λke−λ=λk=1∑+∞k(k−1)!λk−1e−λ=λk=1∑+∞[(k−1)+1](k−1)!λk−1e−λ=λk=1∑+∞(k−1)(k−1)!λk−1e−λ+λk=1∑+∞(k−1)!λk−1e−λ左边是λ⋅EX,右边是λ=λ2+λ=λ2+λ−λ2=λ
连续型
常数的方差为0,即任意常数 a a a, D ( a ) = 0 D(a)=0 D(a)=0
设
a
,
b
a,b
a,b为任意有限常数,若
X
X
X的方差存在,则
D
(
a
X
+
b
)
=
a
2
D
(
X
)
D(aX+b)=a^2D(X)
D(aX+b)=a2D(X)
证明
D
(
a
X
+
b
)
=
E
(
a
X
+
b
−
E
(
a
X
+
b
)
)
2
=
E
(
a
X
+
b
−
a
E
X
−
b
)
2
=
E
(
a
X
−
a
E
X
)
2
=
a
2
E
(
X
−
E
X
)
2
=
a
2
D
(
X
)
对任意随机变量
X
,
Y
X,Y
X,Y,方差均存在,则
D
(
X
±
Y
)
=
D
(
X
)
+
D
(
Y
)
±
2
E
[
(
X
−
E
X
)
(
Y
−
E
Y
)
]
D(X\pm Y)=D(X)+D(Y)\pm 2E[(X-EX)(Y-EY)]
D(X±Y)=D(X)+D(Y)±2E[(X−EX)(Y−EY)]
证明(以加法为例)
D
(
X
+
Y
)
=
E
(
X
+
Y
−
E
(
X
+
Y
)
)
2
=
E
(
(
X
−
E
X
)
+
(
Y
−
E
Y
)
)
2
=
E
[
(
X
−
E
X
)
2
+
2
(
X
−
E
X
)
(
Y
−
E
Y
)
+
(
Y
−
E
Y
)
2
]
=
D
(
X
)
+
D
(
Y
)
±
2
E
[
(
X
−
E
X
)
(
Y
−
E
Y
)
]
当
X
X
X和
Y
Y
Y独立时,
X
−
E
X
X-EX
X−EX和
Y
−
E
Y
Y-EY
Y−EY也相互独立,则
E
[
(
X
−
E
X
)
(
Y
−
E
Y
)
]
=
E
(
X
−
E
X
)
E
(
Y
−
E
Y
)
=
0
E[(X-EX)(Y-EY)]=E(X-EX)E(Y-EY)=0
E[(X−EX)(Y−EY)]=E(X−EX)E(Y−EY)=0,此时
D
(
X
±
Y
)
=
D
(
X
)
+
D
(
Y
)
D(X\pm Y)=D(X)+D(Y)
D(X±Y)=D(X)+D(Y)
定义:对于随机变量
X
,
Y
X,Y
X,Y,若
E
X
,
E
Y
,
E
(
X
Y
)
EX,EY,E(XY)
EX,EY,E(XY)均存在,则称
E
[
(
X
−
E
X
)
(
Y
−
E
Y
)
]
E[(X-EX)(Y-EY)]
E[(X−EX)(Y−EY)]为
X
X
X和
Y
Y
Y的协方差,记为
c
o
v
(
X
,
Y
)
\rm cov(X,Y)
cov(X,Y),即
c
o
v
(
X
,
Y
)
=
E
[
(
X
−
E
X
)
(
Y
−
E
Y
)
]
{\rm cov}(X,Y)=E[(X-EX)(Y-EY)]
cov(X,Y)=E[(X−EX)(Y−EY)]
那么我们之前方差性质可以写成:
D
(
X
±
Y
)
=
D
(
X
)
+
D
(
Y
)
±
2
E
[
(
X
−
E
X
)
(
Y
−
E
Y
)
]
=
D
(
X
)
+
D
(
Y
)
±
2
c
o
v
(
X
,
Y
)
D(X\pm Y)=D(X)+D(Y)\pm 2E[(X-EX)(Y-EY)]=D(X)+D(Y)\pm 2{\rm cov}(X,Y)
D(X±Y)=D(X)+D(Y)±2E[(X−EX)(Y−EY)]=D(X)+D(Y)±2cov(X,Y)
此外,将协方差的公式展开得:
c
o
v
(
X
,
Y
)
=
E
[
(
X
−
E
X
)
(
Y
−
E
Y
)
]
=
E
(
X
Y
−
X
E
Y
−
Y
E
X
+
E
X
E
Y
)
=
E
(
X
Y
)
−
E
(
X
E
Y
)
−
E
(
Y
E
X
)
+
E
X
⋅
E
Y
=
E
(
X
Y
)
−
E
X
⋅
E
Y
协方差性质
[ c o v ( X , Y ) ] 2 ⩽ D ( X ) D ( Y ) [{\rm cov}(X,Y)]^2\leqslant D(X)D(Y) [cov(X,Y)]2⩽D(X)D(Y)
其中等号成立的充要条件是存在不全为0的常数 a , b a,b a,b,使得 Y = a X + b Y=aX+b Y=aX+b,即 X X X与 Y Y Y成线性关系
相关系数
对于
X
X
X,令
X
∗
=
X
−
E
X
D
(
X
)
X^*=\frac{X-EX}{\sqrt{D(X)}}
X∗=D(X)X−EX
可以发现有
E
X
∗
=
E
X
−
E
X
D
(
X
)
=
0
D
X
∗
=
D
(
X
−
E
X
D
(
X
)
)
=
E
(
X
∗
−
E
X
∗
)
2
=
E
(
X
∗
)
2
=
E
(
X
−
E
X
)
2
D
(
X
)
=
E
(
X
−
E
X
)
2
D
(
X
)
=
1
EX^*=E\frac{X-EX}{\sqrt{D(X)}}=0\\ DX^*=D(\frac{X-EX}{\sqrt{D(X)}})=E(X^*-EX^*)^2=E(X^*)^2=E\frac{(X-EX)^2}{D(X)}=\frac{E(X-EX)^2}{D(X)}=1
EX∗=ED(X)X−EX=0DX∗=D(D(X)X−EX)=E(X∗−EX∗)2=E(X∗)2=ED(X)(X−EX)2=D(X)E(X−EX)2=1
则称
X
∗
X^*
X∗为
X
X
X的标准化随机变量。
若随机变量
X
,
Y
X,Y
X,Y的方差均存在且都
>
0
>0
>0,则称
c
o
v
(
X
,
Y
)
D
(
X
)
D
(
Y
)
\frac{{\rm cov}(X,Y)}{\sqrt{D(X)D(Y)}}
D(X)D(Y)cov(X,Y)
为
X
X
X和
Y
Y
Y的相关系数,记为
ρ
X
Y
\rho_{XY}
ρXY或
C
o
r
r
(
X
,
Y
)
{\rm Corr}(X,Y)
Corr(X,Y),
ρ
X
Y
>
0
\rho_{XY}>0
ρXY>0称
X
,
Y
X,Y
X,Y正相关,反之负相关。
考虑 X , Y X,Y X,Y的标准化随机变量 X ∗ = X − E X D ( X ) , Y ∗ = Y − E Y D ( Y ) X^*=\frac{X-EX}{\sqrt{D(X)}},Y^*=\frac{Y-EY}{\sqrt{D(Y)}} X∗=D(X)X−EX,Y∗=D(Y)Y−EY
有
c
o
v
(
X
∗
,
Y
∗
)
=
c
o
v
(
X
−
E
X
D
(
X
)
,
Y
−
E
Y
D
(
Y
)
)
=
(
协方差性质
3
)
c
o
v
(
X
,
Y
)
D
(
X
)
D
(
Y
)
=
ρ
X
Y
{\rm cov}(X^*,Y^*)={\rm cov}(\frac{X-EX}{\sqrt{D(X)}},\frac{Y-EY}{\sqrt{D(Y)}})=(协方差性质3)\frac{{\rm cov}(X,Y)}{\sqrt{D(X)D(Y)}}=\rho_{XY}
cov(X∗,Y∗)=cov(D(X)X−EX,D(Y)Y−EY)=(协方差性质3)D(X)D(Y)cov(X,Y)=ρXY
可见相关系数是随机变量标准化后的协方差
ρ X Y \rho_{XY} ρXY的性质:
∣ ρ X Y ∣ |\rho_{XY}| ∣ρXY∣越大, X , Y X,Y X,Y间的线性关系约密切,越小则线性关系越弱
特别地, ρ X Y = 0 \rho_{XY}=0 ρXY=0时,称 X , Y X,Y X,Y线性无关或不相关
下面四个命题相互等价:
注意, ρ X Y = 0 ⇔ \rho_{XY}=0\Leftrightarrow ρXY=0⇔ X , Y X,Y X,Y线性无关,但不能得出 X , Y X,Y X,Y相互独立,因为两者可能有其他的非线性关系,独立性是说两者没有任何关系