• 机器学习基础:随机变量及其概率分布


    在这里插入图片描述
    机器学习必备基础知识,力求以最简洁的语言,描述最完整的内容。
    很多知识没有深入剖析,也没必要深入剖析。大致了解知识框架之后,即可开始学习机器学习,有不懂的再回过头再仔细研究,驱动式学习才是最高效的学习。

    随机变量的数字特征

    数学期望

    离散型随机变量的数学期望

    P ( X = x i ) = p i , i = 1 , 2 , . . . P(X=x_i)=p_i,i=1,2,... P(X=xi)=pi,i=1,2,...,若级数 ∑ i = 1 + ∞ ∣ x i ∣ p i \sum_{i=1}^{+\infin}|x_i|p_i i=1+xipi收敛,则称 ∑ i = 1 + ∞ x i p i \sum_{i=1}^{+\infin}x_ip_i i=1+xipi X X X的数学期望,记为 E X EX EX;如果发散,那么 E X EX EX不存在

    0-1分布 取1的概率为 p p p, 取0的概率为 1 − p 1-p 1p
    E X = 1 ⋅ p + 0 ⋅ ( 1 − p ) = p EX=1·p+0·(1-p)=p EX=1p+0(1p)=p
    二项分布 B ( n , p ) B(n,p) B(n,p)
    E X = ∑ k = 0 n k P ( X = k ) = ∑ k = 1 n k C n k p k ( 1 − p ) n − k = ∑ k = 1 n k n ! k ! ( n − k ) ! p k ( 1 − p ) n − k = ∑ k = 1 n n ! ( k − 1 ) ! ( n − k ) ! p k ( 1 − p ) n − k = n p ∑ k = 1 n ( n − 1 ) ! ( k − 1 ) ! ( ( n − 1 ) − ( k − 1 ) ) ! p k − 1 ( 1 − p ) ( n − 1 ) − ( k − 1 ) = n p ∑ k = 1 n C n − 1 k − 1 p k − 1 ( 1 − p ) ( 1 − p ) ( n − 1 ) − ( k − 1 ) = n p

    EX=k=0nkP(X=k)=k=1nkCnkpk(1p)nk=k=1nkn!k!(nk)!pk(1p)nk=k=1nn!(k1)!(nk)!pk(1p)nk=npk=1n(n1)!(k1)!((n1)(k1))!pk1(1p)(n1)(k1)=npk=1nCn1k1pk1(1p)(1p)(n1)(k1)=np" role="presentation">EX=k=0nkP(X=k)=k=1nkCnkpk(1p)nk=k=1nkn!k!(nk)!pk(1p)nk=k=1nn!(k1)!(nk)!pk(1p)nk=npk=1n(n1)!(k1)!((n1)(k1))!pk1(1p)(n1)(k1)=npk=1nCn1k1pk1(1p)(1p)(n1)(k1)=np
    EX=k=0nkP(X=k)=k=1nkCnkpk(1p)nk=k=1nkk!(nk)!n!pk(1p)nk=k=1n(k1)!(nk)!n!pk(1p)nk=npk=1n(k1)!((n1)(k1))!(n1)!pk1(1p)(n1)(k1)=npk=1nCn1k1pk1(1p)(1p)(n1)(k1)=np
    泊松分布 P ( X = k ) = λ k k ! e − λ , k = 0 , 1 , 2 , . . . P(X=k)=\frac{\lambda^k}{k!}e^{-\lambda},k=0,1,2,... P(X=k)=k!λkeλ,k=0,1,2,...
    E X = ∑ k = 0 + ∞ k P ( X = k ) = ∑ k = 1 + ∞ k λ k k ! e − λ = λ ∑ k = 1 + ∞ λ k − 1 ( k − 1 ) ! e − λ = λ EX=\sum_{k=0}^{+\infin}kP(X=k)=\sum_{k=1}^{+\infin}k\frac{\lambda^k}{k!}e^{-\lambda}=\lambda\sum_{k=1}^{+\infin}\frac{\lambda^{k-1}}{(k-1)!}e^{-\lambda}=\lambda EX=k=0+kP(X=k)=k=1+kk!λkeλ=λk=1+(k1)!λk1eλ=λ
    泊松分布的期望就是参数 λ \lambda λ,还记得之前二项分布中的 n n n很大 p p p很小时,就变成泊松分布,其中 λ = n p \lambda=np λ=np

    连续型随机变量的数学期望

    若积分 ∫ − ∞ + ∞ ∣ x ∣ p ( x ) d x < + ∞ \int_{-\infin}^{+\infin}|x|p(x){\rm d}x<+\infin +xp(x)dx<+,则 E X = ∫ − ∞ + ∞ x p ( x ) d x EX=\int_{-\infin}^{+\infin}xp(x){\rm d}x EX=+xp(x)dx

    p ( x ) Δ x p(x)\Delta x p(x)Δx近似表示 X X X ( x , x + Δ x ] (x,x+\Delta x] (x,x+Δx]内取值的概率,这里的积分就相当于离散型中的求和

    一些常见分布的数学期望

    • 均匀分布
      p ( x ) = { 1 b − a , a < x < b 0 , 其他 E X = ∫ − ∞ + ∞ x p ( x ) d x = ∫ a b x b − a d x = a + b 2 p(x)=

      {1ba,a<x<b0,其他" role="presentation">{1ba,a<x<b0,其他
      \\ EX=\int_{-\infin}^{+\infin}xp(x){\rm d}x=\int_a^b\frac x{b-a}{\rm d}x=\frac{a+b}{2} p(x)={ba1,0,a<x<b其他EX=+xp(x)dx=abbaxdx=2a+b

    • 指数分布 X ∼ E ( λ ) , λ > 0 X\sim E(\lambda),\lambda>0 XE(λ),λ>0
      p ( x ) = λ e − λ x , x > 0 E X = ∫ 0 + ∞ x p ( x ) d x = λ ∫ 0 + ∞ x e − λ x d x = 1 λ p(x)=\lambda e^{-\lambda x},x>0\\ EX=\int_0^{+\infin}xp(x){\rm d }x=\lambda\int_0^{+\infin}xe^{-\lambda x}{\rm d}x=\frac1\lambda p(x)=λeλx,x>0EX=0+xp(x)dx=λ0+xeλxdx=λ1

    • 正态分布 x ∼ N ( μ , σ 2 ) x\sim N(\mu,\sigma^2) xN(μ,σ2)
      p ( x ) = 1 2 π σ e − ( x − μ ) 2 2 σ 2 E X = ∫ − ∞ + ∞ x p ( x ) d x = ∫ − ∞ + ∞ x 1 2 π σ e − ( x − μ ) 2 2 σ 2 d x p(x)=\frac1{\sqrt{2\pi}\sigma}e^{-\frac{(x-\mu)^2}{2\sigma^2}}\\ EX=\int_{-\infin}^{+\infin}xp(x){\rm d}x=\int_{-\infin}^{+\infin}x\frac1{\sqrt{2\pi}\sigma}e^{-\frac{(x-\mu)^2}{2\sigma^2}}{\rm d}x p(x)=2π σ1e2σ2(xμ)2EX=+xp(x)dx=+x2π σ1e2σ2(xμ)2dx
      t = x − μ σ t=\frac{x-\mu}{\sigma} t=σxμ,则 x = σ t + μ x=\sigma t+\mu x=σt+μ


      E X = 1 2 π ∫ − ∞ + ∞ ( σ t + μ ) e − t 2 2 d t = μ EX=\frac1{\sqrt{2\pi}}\int_{-\infin}^{+\infin}(\sigma t+\mu)e^{-\frac {t^2}{2}}{\rm d}t=\mu EX=2π 1+(σt+μ)e2t2dt=μ

    随机变量函数的数学期望

    • X X X的函数 Y = g ( X ) Y=g(X) Y=g(X)也是一个随机变量,则

      • X X X为离散型,分布律 P ( X = x k ) = p k , k = 1 , 2 , . . . P(X=x_k)=p_k,k=1,2,... P(X=xk)=pk,k=1,2,...,若 ∑ k = 1 + ∞ ∣ g ( x k ) ∣ p k \sum_{k=1}^{+\infin}|g(x_k)|p_k k=1+g(xk)pk收敛,则
        E Y = ∑ k = 1 + ∞ g ( x k ) p k EY=\sum_{k=1}^{+\infin}g(x_k)p_k EY=k=1+g(xk)pk

      • X X X为连续型,密度函数为 p ( x ) p(x) p(x),若 ∫ − ∞ + ∞ ∣ g ( x ) ∣ p ( x ) d x < + ∞ \int_{-\infin}^{+\infin}|g(x)|p(x){\rm d}x<+\infin +g(x)p(x)dx<+,则
        E Y = ∫ − ∞ + ∞ g ( x ) p ( x ) d x EY=\int_{-\infin}^{+\infin}g(x)p(x){\rm d}x EY=+g(x)p(x)dx

    • 推广到随机向量类型

      • ( X , Y ) (X,Y) (X,Y)为离散型,分布律 P ( X = x i , Y = y j ) = p i j , i , j = 1 , 2 , . . . P(X=x_i,Y=y_j)=p_{ij},i,j=1,2,... P(X=xi,Y=yj)=pij,i,j=1,2,...,若 ∑ i = 1 + ∞ ∑ j = 1 + ∞ ∣ g ( x i , y j ) ∣ p i j \sum_{i=1}^{+\infin}\sum_{j=1}^{+\infin}|g(x_i,y_j)|p_{ij} i=1+j=1+g(xi,yj)pij收敛,则
        E Z = ∑ i = 1 + ∞ ∑ j = 1 + ∞ g ( x i , y j ) p i j EZ=\sum_{i=1}^{+\infin}\sum_{j=1}^{+\infin}g(x_i,y_j)p_{ij} EZ=i=1+j=1+g(xi,yj)pij
        ( X , Y ) (X,Y) (X,Y)为连续型,密度函数为 p ( x , y ) p(x,y) p(x,y),若 ∫ − ∞ + ∞ ∫ − ∞ + ∞ ∣ g ( x , y ) ∣ p ( x , y ) d x d y < + ∞ \int_{-\infin}^{+\infin}\int_{-\infin}^{+\infin}|g(x,y)|p(x,y){\rm d}x{\rm d}y<+\infin ++g(x,y)p(x,y)dxdy<+,则
        E Z = ∫ − ∞ + ∞ ∫ − ∞ + ∞ g ( x , y ) p ( x , y ) d x d y EZ=\int_{-\infin}^{+\infin}\int_{-\infin}^{+\infin}g(x,y)p(x,y){\rm d}x{\rm d}y EZ=++g(x,y)p(x,y)dxdy

    数学期望的性质

    • a a a为常数, E ( a ) = a E(a)=a E(a)=a
    • 线性性质,对任意有限常数 a , b a,b a,b E ( a X + b Y ) = a E X + b E Y E(aX+bY)=aEX+bEY E(aX+bY)=aEX+bEY
    • X , Y X,Y X,Y相互独立,则 E X Y = E X ⋅ E Y EXY=EX·EY EXY=EXEY

    方差

    定义:若 E X 2 < + ∞ EX^2<+\infin EX2<+,则称 E ( X − E X ) 2 E(X-EX)^2 E(XEX)2为随机变量 X X X的方差,记为 D ( X ) D(X) D(X) V a r ( X ) Var(X) Var(X),同时称 D ( X ) \sqrt{D(X)} D(X) X X X均方差标准差,记为 σ ( X ) \sigma(X) σ(X)

    事实上,方差 D ( X ) D(X) D(X)就是随机变量 X X X的函数 g ( X ) = ( X − E X ) 2 g(X)=(X-EX)^2 g(X)=(XEX)2的数学期望,方差不一定存在

    那么方差公式如下:

    • X X X离散型 P ( X = x k ) = p k , k = 1 , 2 , . . . P(X=x_k)=p_k,k=1,2,... P(X=xk)=pk,k=1,2,...
      D ( X ) = E ( X − E X ) 2 = ∑ k = 1 + ∞ ( x k − E X ) 2 p k D(X)=E(X-EX)^2=\sum_{k=1}^{+\infin}(x_k-EX)^2p_k D(X)=E(XEX)2=k=1+(xkEX)2pk

    • X X X连续型,密度函数 p ( x ) p(x) p(x)
      D ( X ) = E ( X − E X ) 2 = ∫ − ∞ + ∞ ( x − E X ) 2 p ( x ) d x D(X)=E(X-EX)^2=\int_{-\infin}^{+\infin}(x-EX)^2p(x){\rm d}x D(X)=E(XEX)2=+(xEX)2p(x)dx

    • 不过这个 E ( X − E X ) 2 E(X-EX)^2 E(XEX)2似乎可以化简一下:
      D ( X ) = E ( X − E X ) 2 = E [ X 2 − 2 X E X + ( E X ) 2 ] = E X 2 − 2 E X ⋅ E X + ( E X ) 2 = E X 2 − ( E X ) 2 D(X)=E(X-EX)^2=E[X^2-2XEX+(EX)^2]=EX^2-2EX·EX+(EX)^2=EX^2-(EX)^2 D(X)=E(XEX)2=E[X22XEX+(EX)2]=EX22EXEX+(EX)2=EX2(EX)2
      所以 D ( X ) = E X 2 − ( E X ) 2 D(X)=EX^2-(EX)^2 D(X)=EX2(EX)2

    一些常用分布的方差

    离散型

    二项分布, X ∼ B ( n , p ) X\sim B(n,p) XB(n,p) E X = n p EX=np EX=np
    D ( X ) = E X 2 − ( E X ) 2 E X 2 = ∑ k = 0 n k 2 P ( X = k ) = ∑ k = 1 n k 2 C n k p k ( 1 − p ) n − k = n p ∑ k = 1 n k ⋅ ( n − 1 ) ! ( k − 1 ) ! ( n − k ) ! p k − 1 ( 1 − p ) ( n − 1 ) − ( k − 1 ) / / 比 E X 每项多乘了个 k = n p ∑ k = 1 n [ ( k − 1 ) + 1 ] ⋅ ( n − 1 ) ! ( k − 1 ) ! ( n − k ) ! p k − 1 ( 1 − p ) ( n − 1 ) − ( k − 1 ) = n p ∑ k = 1 n ( k − 1 ) ⋅ ( n − 1 ) ! ( k − 1 ) ! ( n − k ) ! p k − 1 ( 1 − p ) ( n − 1 ) − ( k − 1 ) + n p ∑ k = 1 n ( n − 1 ) ! ( k − 1 ) ! ( n − k ) ! p k − 1 ( 1 − p ) ( n − 1 ) − ( k − 1 ) / / 左边是 n p ⋅ [ B ( n − 1 , k ) 的期望 ] ,右边是 n p ⋅ 1 = n p [ ( n − 1 ) p + 1 ] 所以 D ( X ) = n p [ ( n − 1 ) p + 1 ] + ( n p ) 2 = n p ( 1 − p ) = n p q

    D(X)=EX2(EX)2EX2=k=0nk2P(X=k)=k=1nk2Cnkpk(1p)nk=npk=1nk·(n1)!(k1)!(nk)!pk1(1p)(n1)(k1)//EXk=npk=1n[(k1)+1]·(n1)!(k1)!(nk)!pk1(1p)(n1)(k1)=npk=1n(k1)·(n1)!(k1)!(nk)!pk1(1p)(n1)(k1)+npk=1n(n1)!(k1)!(nk)!pk1(1p)(n1)(k1)//np·[B(n1,k)]np·1=np[(n1)p+1]D(X)=np[(n1)p+1]+(np)2=np(1p)=npq" role="presentation">D(X)=EX2(EX)2EX2=k=0nk2P(X=k)=k=1nk2Cnkpk(1p)nk=npk=1nk·(n1)!(k1)!(nk)!pk1(1p)(n1)(k1)//EXk=npk=1n[(k1)+1]·(n1)!(k1)!(nk)!pk1(1p)(n1)(k1)=npk=1n(k1)·(n1)!(k1)!(nk)!pk1(1p)(n1)(k1)+npk=1n(n1)!(k1)!(nk)!pk1(1p)(n1)(k1)//np·[B(n1,k)]np·1=np[(n1)p+1]D(X)=np[(n1)p+1]+(np)2=np(1p)=npq
    D(X)EX2所以D(X)=EX2(EX)2=k=0nk2P(X=k)=k=1nk2Cnkpk(1p)nk=npk=1n(k1)!(nk)!k(n1)!pk1(1p)(n1)(k1)//EX每项多乘了个k=npk=1n(k1)!(nk)![(k1)+1](n1)!pk1(1p)(n1)(k1)=npk=1n(k1)!(nk)!(k1)(n1)!pk1(1p)(n1)(k1)+npk=1n(k1)!(nk)!(n1)!pk1(1p)(n1)(k1)//左边是np[B(n1,k)的期望],右边是np1=np[(n1)p+1]=np[(n1)p+1]+(np)2=np(1p)=npq
    泊松分布, X ∼ P ( λ ) X\sim P(\lambda) XP(λ)
    p k = P ( X = k ) = λ k k ! e − λ ( k = 0 , 1 , 2... , n ) ,   λ > 0 E X = λ D ( X ) = E X 2 − ( E X ) 2 E X 2 = ∑ k = 0 + ∞ k 2 P ( X = k ) = ∑ k = 1 + ∞ k 2 λ k k ! e − λ = λ ∑ k = 1 + ∞ k λ k − 1 ( k − 1 ) ! e − λ = λ ∑ k = 1 + ∞ [ ( k − 1 ) + 1 ] λ k − 1 ( k − 1 ) ! e − λ = λ ∑ k = 1 + ∞ ( k − 1 ) λ k − 1 ( k − 1 ) ! e − λ + λ ∑ k = 1 + ∞ λ k − 1 ( k − 1 ) ! e − λ / / 左边是 λ ⋅ E X ,右边是 λ = λ 2 + λ 所以 D ( X ) = λ 2 + λ − λ 2 = λ p_k=P(X=k)=\frac{\lambda^k}{k!}e^{-\lambda}\\(k=0,1,2...,n),\ \lambda>0\\ EX=\lambda\\ \begin{align*} D(X)&=EX^2-(EX)^2\\ EX^2&=\sum_{k=0}^{+\infin}k^2P(X=k)\\ &=\sum_{k=1}^{+\infin}k^2\frac{\lambda^k}{k!}e^{-\lambda}=\lambda\sum_{k=1}^{+\infin}k\frac{\lambda^{k-1}}{(k-1)!}e^{-\lambda}\\ &=\lambda\sum_{k=1}^{+\infin}[(k-1)+1]\frac{\lambda^{k-1}}{(k-1)!}e^{-\lambda}\\ &=\lambda\sum_{k=1}^{+\infin}(k-1)\frac{\lambda^{k-1}}{(k-1)!}e^{-\lambda}+\lambda\sum_{k=1}^{+\infin}\frac{\lambda^{k-1}}{(k-1)!}e^{-\lambda}\\ //&左边是\lambda·EX,右边是\lambda\\ &=\lambda^2+\lambda\\ 所以D(X)&=\lambda^2+\lambda-\lambda^2=\lambda \end{align*} pk=P(X=k)=k!λkeλ(k=0,1,2...,n), λ>0EX=λD(X)EX2//所以D(X)=EX2(EX)2=k=0+k2P(X=k)=k=1+k2k!λkeλ=λk=1+k(k1)!λk1eλ=λk=1+[(k1)+1](k1)!λk1eλ=λk=1+(k1)(k1)!λk1eλ+λk=1+(k1)!λk1eλ左边是λEX,右边是λ=λ2+λ=λ2+λλ2=λ

    连续型

    • 均匀分布, X ∼ U [ a , b ] X\sim U[a,b] XU[a,b]
      p ( x ) = { 1 b − a , a < x < b 0 , 其他 D ( X ) = E X 2 − ( E X ) 2 E X = a + b 2 E X 2 = ∫ − ∞ + ∞ x 2 p ( x ) d x = ∫ a b x 2 b − a d x = a 2 + a b + b 2 3 所以 D ( X ) = a 2 + a b + b 2 3 − ( a + b 2 ) 2 = ( b − a ) 2 12 p(x)=
      {1ba,a<x<b0,其他" role="presentation">{1ba,a<x<b0,其他
      \\ D(X)=EX^2-(EX)^2\\ EX=\frac {a+b}2\\ EX^2=\int_{-\infin}^{+\infin}x^2p(x){\rm d}x=\int_{a}^{b}\frac{x^2}{b-a}{\rm d}x\\ =\frac{a^2+ab+b^2}{3}\\ 所以D(X)=\frac{a^2+ab+b^2}{3}-(\frac{a+b}2)^2=\frac{(b-a)^2}{12}
      p(x)={ba1,0,a<x<b其他D(X)=EX2(EX)2EX=2a+bEX2=+x2p(x)dx=abbax2dx=3a2+ab+b2所以D(X)=3a2+ab+b2(2a+b)2=12(ba)2

      指数分布, X ∼ E ( λ ) X\sim E(\lambda) XE(λ)
      p ( x ) = λ e − λ x , x > 0 E X = 1 λ E X 2 = ∫ 0 + ∞ x 2 λ e − λ x d x = − ∫ 0 + ∞ x 2 d e − λ x = − x 2 e − λ x ∣ 0 + ∞ + 2 ∫ 0 + ∞ x e − λ x d x = 2 λ 2 所以 D ( X ) = 2 λ 2 − ( 1 λ ) 2 = 1 λ 2 p(x)=\lambda e^{-\lambda x},x>0\\ EX=\frac1\lambda\\ EX^2=\int_0^{+\infin}x^2\lambda e^{-\lambda x}{\rm d}x=-\int_0^{+\infin}x^2 {\rm d}e^{-\lambda x}\\ =-x^2e^{-\lambda x}|_0^{+\infin}+2\int_0^{+\infin}xe^{-\lambda x}{\rm d}x \\=\frac2{\lambda^2}\\ 所以D(X)=\frac2{\lambda^2}-(\frac1\lambda)^2=\frac1{\lambda^2} p(x)=λeλx,x>0EX=λ1EX2=0+x2λeλxdx=0+x2deλx=x2eλx0++20+xeλxdx=λ22所以D(X)=λ22(λ1)2=λ21
      正态分布, X ∼ N ( μ , σ 2 ) X\sim N(\mu,\sigma^2) XN(μ,σ2)
      p ( x ) = 1 2 π σ e − ( x − μ ) 2 2 σ 2 E X = μ D ( X ) = E ( X − E X ) 2 = 1 2 π σ ∫ − ∞ + ∞ ( x − μ ) 2 e − ( x − μ ) 2 2 σ 2 d x p(x)=\frac1{\sqrt{2\pi}\sigma}e^{-\frac{(x-\mu)^2}{2\sigma^2}}\\ EX=\mu\\ D(X)=E(X-EX)^2=\frac1{\sqrt{2\pi}\sigma}\int_{-\infin}^{+\infin}(x-\mu)^2e^{-\frac{(x-\mu)^2}{2\sigma^2}}{\rm d}x p(x)=2π σ1e2σ2(xμ)2EX=μD(X)=E(XEX)2=2π σ1+(xμ)2e2σ2(xμ)2dx
      t = x − μ σ t=\frac{x-\mu}{\sigma} t=σxμ,则
      D ( X ) = 1 2 π σ ∫ − ∞ + ∞ σ 2 t 2 e − t 2 2 σ d t = σ 2 1 2 π ∫ − ∞ + ∞ t 2 e − t 2 2 d t = − σ 2 2 π ∫ − ∞ + ∞ t d e − t 2 2 = − σ 2 2 π ( t e − t 2 2 ∣ − ∞ + ∞ − ∫ − ∞ + ∞ e − t 2 2 d t ) / / 左边为 0 ,右边为标准正态分布的积分 = σ 2
      D(X)=12πσ\infin+\infinσ2t2et22σdt=σ212π\infin+\infint2et22dt=σ22π\infin+\infintdet22=σ22π(tet22|\infin+\infin\infin+\infinet22dt)//0=σ2" role="presentation">D(X)=12πσ\infin+\infinσ2t2et22σdt=σ212π\infin+\infint2et22dt=σ22π\infin+\infintdet22=σ22π(tet22|\infin+\infin\infin+\infinet22dt)//0=σ2
      D(X)=2π σ1+σ2t2e2t2σdt=σ22π 1+t2e2t2dt=2π σ2+tde2t2=2π σ2(te2t2++e2t2dt)//左边为0,右边为标准正态分布的积分=σ2

    方差的性质

    • 常数的方差为0,即任意常数 a a a D ( a ) = 0 D(a)=0 D(a)=0

    • a , b a,b a,b为任意有限常数,若 X X X的方差存在,则
      D ( a X + b ) = a 2 D ( X ) D(aX+b)=a^2D(X) D(aX+b)=a2D(X)
      证明
      D ( a X + b ) = E ( a X + b − E ( a X + b ) ) 2 = E ( a X + b − a E X − b ) 2 = E ( a X − a E X ) 2 = a 2 E ( X − E X ) 2 = a 2 D ( X )

      D(aX+b)=E(aX+bE(aX+b))2=E(aX+baEXb)2=E(aXaEX)2=a2E(XEX)2=a2D(X)" role="presentation">D(aX+b)=E(aX+bE(aX+b))2=E(aX+baEXb)2=E(aXaEX)2=a2E(XEX)2=a2D(X)
      D(aX+b)=E(aX+bE(aX+b))2=E(aX+baEXb)2=E(aXaEX)2=a2E(XEX)2=a2D(X)

    • 对任意随机变量 X , Y X,Y X,Y,方差均存在,则
      D ( X ± Y ) = D ( X ) + D ( Y ) ± 2 E [ ( X − E X ) ( Y − E Y ) ] D(X\pm Y)=D(X)+D(Y)\pm 2E[(X-EX)(Y-EY)] D(X±Y)=D(X)+D(Y)±2E[(XEX)(YEY)]
      证明(以加法为例)
      D ( X + Y ) = E ( X + Y − E ( X + Y ) ) 2 = E ( ( X − E X ) + ( Y − E Y ) ) 2 = E [ ( X − E X ) 2 + 2 ( X − E X ) ( Y − E Y ) + ( Y − E Y ) 2 ] = D ( X ) + D ( Y ) ± 2 E [ ( X − E X ) ( Y − E Y ) ]

      D(X+Y)=E(X+YE(X+Y))2=E((XEX)+(YEY))2=E[(XEX)2+2(XEX)(YEY)+(YEY)2]=D(X)+D(Y)±2E[(XEX)(YEY)]" role="presentation">D(X+Y)=E(X+YE(X+Y))2=E((XEX)+(YEY))2=E[(XEX)2+2(XEX)(YEY)+(YEY)2]=D(X)+D(Y)±2E[(XEX)(YEY)]
      D(X+Y)=E(X+YE(X+Y))2=E((XEX)+(YEY))2=E[(XEX)2+2(XEX)(YEY)+(YEY)2]=D(X)+D(Y)±2E[(XEX)(YEY)]
      X X X Y Y Y独立时, X − E X X-EX XEX Y − E Y Y-EY YEY也相互独立,则 E [ ( X − E X ) ( Y − E Y ) ] = E ( X − E X ) E ( Y − E Y ) = 0 E[(X-EX)(Y-EY)]=E(X-EX)E(Y-EY)=0 E[(XEX)(YEY)]=E(XEX)E(YEY)=0,此时
      D ( X ± Y ) = D ( X ) + D ( Y ) D(X\pm Y)=D(X)+D(Y) D(X±Y)=D(X)+D(Y)

      • 推广到 n n n个的情形
        D ( X 1 + X 2 + . . . + X n ) = ∑ k = 1 n D ( X k ) + 2 ∑ 1 ⩽ i < j ⩽ n E [ ( X i − E X i ) ( X j − E X j ) ] D(X_1+X_2+...+X_n)=\sum_{k=1}^nD(X_k)+2\sum_{1\leqslant iD(X1+X2+...+Xn)=k=1nD(Xk)+21i<jnE[(XiEXi)(XjEXj)]
        X 1 , X 2 , . . . , X n X_1,X_2,...,X_n X1,X2,...,Xn两两独立,则
        D ( X 1 + X 2 + . . . + X n ) = ∑ k = 1 n D ( X k ) D(X_1+X_2+...+X_n)=\sum_{k=1}^nD(X_k) D(X1+X2+...+Xn)=k=1nD(Xk)

    切比雪夫不等式

    • X X X E X EX EX D X DX DX均存在,则对任意 ε > 0 \varepsilon>0 ε>0,有
      P ( ∣ X − E X ∣ ⩾ ε ) ⩽ D X ε 2 P(|X-EX|\geqslant\varepsilon)\leqslant\frac{DX}{\varepsilon^2} P(XEXε)ε2DX
      证明:(以连续型为例 X X X的密度函数 p ( x ) p(x) p(x)
      P ( ∣ X − E X ∣ ⩾ ε ) = ∫ { x : ∣ x − E X ∣ ⩾ ε } p ( x ) d x ⩽ ∫ { x : ∣ x − E X ∣ ⩾ ε } ( x − E X ) 2 ε 2 p ( x ) d x ⩽ 1 ε 2 ∫ − ∞ + ∞ ( x − E X ) 2 p ( x ) d x = D X ε 2
      P(|XEX|ε)={x:|xEX|ε}p(x)dx{x:|xEX|ε}(xEX)2ε2p(x)dx1ε2\infin+\infin(xEX)2p(x)dx=DXε2" role="presentation">P(|XEX|ε)={x:|xEX|ε}p(x)dx{x:|xEX|ε}(xEX)2ε2p(x)dx1ε2\infin+\infin(xEX)2p(x)dx=DXε2
      P(XEXε)={x:xEXε}p(x)dx{x:xEXε}ε2(xEX)2p(x)dxε21+(xEX)2p(x)dx=ε2DX

    协方差与相关系数

    定义:对于随机变量 X , Y X,Y X,Y,若 E X , E Y , E ( X Y ) EX,EY,E(XY) EX,EY,E(XY)均存在,则称 E [ ( X − E X ) ( Y − E Y ) ] E[(X-EX)(Y-EY)] E[(XEX)(YEY)] X X X Y Y Y协方差,记为 c o v ( X , Y ) \rm cov(X,Y) cov(X,Y),即
    c o v ( X , Y ) = E [ ( X − E X ) ( Y − E Y ) ] {\rm cov}(X,Y)=E[(X-EX)(Y-EY)] cov(X,Y)=E[(XEX)(YEY)]

    那么我们之前方差性质可以写成:
    D ( X ± Y ) = D ( X ) + D ( Y ) ± 2 E [ ( X − E X ) ( Y − E Y ) ] = D ( X ) + D ( Y ) ± 2 c o v ( X , Y ) D(X\pm Y)=D(X)+D(Y)\pm 2E[(X-EX)(Y-EY)]=D(X)+D(Y)\pm 2{\rm cov}(X,Y) D(X±Y)=D(X)+D(Y)±2E[(XEX)(YEY)]=D(X)+D(Y)±2cov(X,Y)
    此外,将协方差的公式展开得:
    c o v ( X , Y ) = E [ ( X − E X ) ( Y − E Y ) ] = E ( X Y − X E Y − Y E X + E X E Y ) = E ( X Y ) − E ( X E Y ) − E ( Y E X ) + E X ⋅ E Y = E ( X Y ) − E X ⋅ E Y

    cov(X,Y)=E[(XEX)(YEY)]=E(XYXEYYEX+EXEY)=E(XY)E(XEY)E(YEX)+EX·EY=E(XY)EX·EY" role="presentation">cov(X,Y)=E[(XEX)(YEY)]=E(XYXEYYEX+EXEY)=E(XY)E(XEY)E(YEX)+EX·EY=E(XY)EX·EY
    cov(X,Y)=E[(XEX)(YEY)]=E(XYXEYYEX+EXEY)=E(XY)E(XEY)E(YEX)+EXEY=E(XY)EXEY
    协方差性质

    • 对称性 c o v ( X , Y ) = c o v ( Y , X ) {\rm cov}(X,Y)={\rm cov}(Y,X) cov(X,Y)=cov(Y,X)
    • 对任意常数 c c c c o v ( X , c ) = 0 {\rm cov}(X,c)=0 cov(X,c)=0
    • 对常数 a , b , c , d a,b,c,d a,b,c,d c o v ( a X + c , b Y + d ) = a b c o v ( X , Y ) {\rm cov}(aX+c,bY+d)=ab{\rm cov}(X,Y) cov(aX+c,bY+d)=abcov(X,Y)
    • c o v ( X 1 + X 2 , Y ) = c o v ( X 1 , Y ) + c o v ( X 2 , Y ) {\rm cov}(X_1+X_2,Y)={\rm cov}(X_1,Y)+{\rm cov}(X_2,Y) cov(X1+X2,Y)=cov(X1,Y)+cov(X2,Y)
    • X X X Y Y Y独立, c o v ( X , Y ) = 0 {\rm cov}(X,Y)=0 cov(X,Y)=0,反过来 c o v ( X , Y ) {\rm cov}(X,Y) cov(X,Y)并不能推出独立
    • 性质三、四体现协方差的双线性

    柯西-施瓦茨不等式

    [ c o v ( X , Y ) ] 2 ⩽ D ( X ) D ( Y ) [{\rm cov}(X,Y)]^2\leqslant D(X)D(Y) [cov(X,Y)]2D(X)D(Y)

    其中等号成立的充要条件是存在不全为0的常数 a , b a,b a,b,使得 Y = a X + b Y=aX+b Y=aX+b,即 X X X Y Y Y成线性关系

    • 相关系数

      • 对于 X X X,令
        X ∗ = X − E X D ( X ) X^*=\frac{X-EX}{\sqrt{D(X)}} X=D(X) XEX
        可以发现有
        E X ∗ = E X − E X D ( X ) = 0 D X ∗ = D ( X − E X D ( X ) ) = E ( X ∗ − E X ∗ ) 2 = E ( X ∗ ) 2 = E ( X − E X ) 2 D ( X ) = E ( X − E X ) 2 D ( X ) = 1 EX^*=E\frac{X-EX}{\sqrt{D(X)}}=0\\ DX^*=D(\frac{X-EX}{\sqrt{D(X)}})=E(X^*-EX^*)^2=E(X^*)^2=E\frac{(X-EX)^2}{D(X)}=\frac{E(X-EX)^2}{D(X)}=1 EX=ED(X) XEX=0DX=D(D(X) XEX)=E(XEX)2=E(X)2=ED(X)(XEX)2=D(X)E(XEX)2=1
        则称 X ∗ X^* X X X X标准化随机变量

      • 若随机变量 X , Y X,Y X,Y的方差均存在且都 > 0 >0 >0,则称
        c o v ( X , Y ) D ( X ) D ( Y ) \frac{{\rm cov}(X,Y)}{\sqrt{D(X)D(Y)}} D(X)D(Y) cov(X,Y)
        X X X Y Y Y的相关系数,记为 ρ X Y \rho_{XY} ρXY C o r r ( X , Y ) {\rm Corr}(X,Y) Corr(X,Y) ρ X Y > 0 \rho_{XY}>0 ρXY>0 X , Y X,Y X,Y正相关,反之负相关。

        考虑 X , Y X,Y X,Y的标准化随机变量 X ∗ = X − E X D ( X ) , Y ∗ = Y − E Y D ( Y ) X^*=\frac{X-EX}{\sqrt{D(X)}},Y^*=\frac{Y-EY}{\sqrt{D(Y)}} X=D(X) XEX,Y=D(Y) YEY


        c o v ( X ∗ , Y ∗ ) = c o v ( X − E X D ( X ) , Y − E Y D ( Y ) ) = ( 协方差性质 3 ) c o v ( X , Y ) D ( X ) D ( Y ) = ρ X Y {\rm cov}(X^*,Y^*)={\rm cov}(\frac{X-EX}{\sqrt{D(X)}},\frac{Y-EY}{\sqrt{D(Y)}})=(协方差性质3)\frac{{\rm cov}(X,Y)}{\sqrt{D(X)D(Y)}}=\rho_{XY} cov(X,Y)=cov(D(X) XEX,D(Y) YEY)=(协方差性质3)D(X)D(Y) cov(X,Y)=ρXY
        可见相关系数是随机变量标准化后的协方差

      • ρ X Y \rho_{XY} ρXY的性质:

        • ∣ ρ X Y ∣ ⩽ 1 |\rho_{XY}|\leqslant 1 ρXY1
        • ∣ ρ X Y ∣ = 1 |\rho_{XY}|= 1 ρXY=1的充要条件是存在不全为0的常数 a , b a,b a,b,使得 Y = a X + b Y=aX+b Y=aX+b,即 X X X Y Y Y成线性关系
      • ∣ ρ X Y ∣ |\rho_{XY}| ρXY越大, X , Y X,Y X,Y间的线性关系约密切,越小则线性关系越弱

      • 特别地, ρ X Y = 0 \rho_{XY}=0 ρXY=0时,称 X , Y X,Y X,Y线性无关不相关

    • 下面四个命题相互等价:

      • ρ X Y = 0 \rho_{XY}=0 ρXY=0
      • c o v ( X , Y ) = 0 {\rm cov}(X,Y)=0 cov(X,Y)=0
      • E ( X Y ) = E X ⋅ E Y E(XY)=EX·EY E(XY)=EXEY
      • D ( X ± Y ) = D ( X ) + D ( Y ) D(X\pm Y)=D(X)+D(Y) D(X±Y)=D(X)+D(Y)
    • 注意, ρ X Y = 0 ⇔ \rho_{XY}=0\Leftrightarrow ρXY=0 X , Y X,Y X,Y线性无关,但不能得出 X , Y X,Y X,Y相互独立,因为两者可能有其他的非线性关系,独立性是说两者没有任何关系

  • 相关阅读:
    Linux开发工具使用
    2023年10月工作经验及问题整理总结
    R语言使用plot函数可视化数据散点图,使用pch参数设置数据点类型、fg参数自定义设置可视化图像边框颜色
    嵌入式面试常见问题(一)
    利用IP地址信息提升网络安全
    动态路由协议RIP(思科、华为)
    甘露糖-聚乙二醇-CY3 Cy3-PEG-mannose
    解决uniapp打包过大问题的实用方法
    网络流行简笔画图片大全,互联网图标简笔画
    Spring源码解析—— AOP代理的生成
  • 原文地址:https://blog.csdn.net/weixin_45755332/article/details/127089434