Skip to content

第 7 章:参数估计(Estimation)

四大板块:

  1. 最大似然估计(MLE)
  2. 区间估计(置信区间)
  3. 估计量的性质(无偏性、有效性)
  4. Fisher 信息矩阵与 Cramér–Rao 下界

0. 什么是"参数估计"?先把问题讲清楚

在统计学里,我们通常假设数据来自某个带未知参数的分布。比如:

  • 抛硬币:XBernoulli(p),参数 p 未知
  • 顾客到达数:XPoisson(λ),参数 λ 未知
  • 测量误差:XN(μ,σ2),参数 μ,σ2 未知

参数估计要回答的问题:拿到一组样本 X1,X2,,Xn 之后,怎样用这些数据猜出未知参数的值? 估计又分两种:

  • 点估计:给出一个具体的数字,比如 p^=0.6
  • 区间估计:给出一个区间,比如 p[0.55,0.65],并说明"我有 95% 把握"

1. 最大似然估计(Maximum Likelihood Estimation, MLE)

1.1 直觉:抛三次硬币的例子

假设一枚硬币正面概率为 p(未知)。你抛了 3 次,结果是 HHT(正正反)。问:p 最有可能是多少?

X=1 表示正面,X=0 表示反面,则 P(X=k)=pk(1p)1k

观察到 X1=1,X2=1,X3=0,这个序列出现的概率是:

P(HHT)=pp(1p)=p2(1p)

关键思想:既然这件事真的发生了,那就找一个 p 让这件事发生的概率最大

p2(1p) 求导:

ddp[p2(1p)]=2p(1p)p2=p(23p)

令其为 0,得 p=2/3

这就是最大似然的核心思想:找让已发生数据出现概率最大的参数值

1.2 似然函数的定义

定义:给定样本 y1,y2,,yn 独立同分布(i.i.d.)来自 pdf fY(y;θ)似然函数定义为:

L(θ)=i=1nfY(yi;θ)

(离散情形把 f 换成 pX 即可。)

⚠ 注意:似然函数 L(θ)θ 的函数,数据 yi 是已经知道的、固定的常数!这是最容易混淆的地方。

最大似然估计量(MLE) θ~ 就是使 L(θ) 取最大值的那个 θ

θ~=argmaxθL(θ)

1.3 求解套路(标准流程)

由于连乘的求导很麻烦,通常先取对数(对数是单调函数,不改变最大值位置):

步骤 1:写出似然函数 L(θ)=f(yi;θ)步骤 2:取对数得对数似然 (θ)=lnL(θ)=lnf(yi;θ)步骤 3:求导 ddθ,令其为 0,解出 θ~步骤 4(可选):验证二阶导 <0,确认是最大值

1.4 例 1:Poisson 分布

题目X1=3,X2=5,X3=4,X4=2XPoisson(λ),求 λ 的 MLE。

Poisson 分布:pX(k;λ)=eλλkk!

第一步:写似然

L(λ)=i=14eλλkiki!=e4λλ3+5+4+213!5!4!2!=e4λλ14C

(其中 C 是和 λ 无关的常数)

第二步:取对数

(λ)=4λ+14lnλ+lnC

第三步:求导

ddλ=4+14λ=0λ~=144=3.5

推广:对 i.i.d. 样本 k1,,kn,可推出

λ~=1ni=1nki=k¯

即样本均值——这和我们直觉一致(Poisson 的期望就是 λ)。

1.5 例 2:双参数指数(备用设备故障时间)

题目:两个独立指数设备之和 fY(y;θ)=1θ2yey/θ(Gamma(2,1/θ)),样本 9.2, 5.6, 18.4, 12.1, 10.7,求 θ~

似然

L(θ)=i=1n1θ2yieyi/θ=θ2n(yi)e1θyi

对数似然

(θ)=2nlnθ+lnyi1θyi

求导并令为 0

ddθ=2nθ+1θ2yi=0θ~=12ni=1nyi

代入数据:yi=56n=5,所以 θ~=56/(10)=5.6

1.6 例 3:顺序统计量情形(导数不起作用!)

重点:不是所有 MLE 都能靠求导解出来。

当 pdf 的定义域与参数 θ 有关时(比如 0yθ 这种),求导往往无法求解。

题目fY(y;θ)=e(yθ), yθ,求 θ~

似然

L(θ)=i=1ne(yiθ)=eyi+nθ

求导?ddθ=n,永远等于 n0,解不出来!

改用直接观察L(θ)θ 单调递增,所以 θ 越大越好。但 pdf 有约束 yiθ,即 θminyi

因此:

θ~=ymin

记住:定义域含参数时 → 别求导,看范围约束 → MLE 往往是 yminymax

1.7 多参数情形:Normal 分布

题目Y1,,Yn i.i.d. N(μ,σ2),求 μ~,σ2~

对数似然

(μ,σ2)=n2ln(2πσ2)12σ2(yiμ)2

μ 求偏导

μ=1σ2(yiμ)=0μ~=y¯

σ2 求偏导

σ2=n2σ2+12σ4(yiμ)2=0

代入 μ~=y¯

σ2~=1ni=1n(yiy¯)2

⚠ 注意分母是 n不是 n1!—— 后面会证明这是有偏估计,需要用 nn1 修正成样本方差 S2


1.8 矩估计法(Method of Moments, MoM)

MLE 很好用,但有时候(比如 Gamma 分布里涉及 Γ(r))对数似然没法闭式求解。这时可用矩估计

核心思想:理论矩 = 样本矩。

对有 s 个参数的分布,让理论前 s 阶矩等于样本前 s 阶矩:

{E(Y)=1nyiE(Y2)=1nyi2 E(Ys)=1nyis

解这个方程组就得到 θ~1,,θ~s

例:fY(y;θ)=θyθ1,0y1

只有 1 个参数,所以只需要 1 阶矩。

E(Y)=01yθyθ1dy=θθ+1

令其 =y¯

θθ+1=y¯θ~=y¯1y¯

代入数据(0.42, 0.10, 0.65, 0.23),y¯=0.35,所以 θ~=0.35/0.650.54

例:Gamma 分布

fY(y;r,λ)=λrΓ(r)yr1eλy,MLE 难求,用 MoM:

已知 E(Y)=r/λVar(Y)=r/λ2,所以 E(Y2)=Var+E2=r(r+1)/λ2

联立:

y¯=rλ,1nyi2=r(r+1)λ2

解出:

λ~=yiyi21n(yi)2,r~=y¯λ~

2. 区间估计(Interval Estimation)

2.1 为什么要区间估计?

点估计给出一个具体数字,但没说它"多准"。比如 λ~=6.8,真实值可能是 6.7?6.9?还是 5.0?我们不知道!

区间估计:给出一个范围,并声明"有 100(1α)% 的把握真值落在里面"。

2.2 正态总体均值的置信区间(已知 σ

:数据 6.5, 9.2, 9.9, 12.4,YN(μ,0.82),求 μ 的 95% CI。

关键工具

Z=Y¯μσ/nN(0,1)

因此:

P(1.96Y¯μ0.8/41.96)=0.95

"反转"这个概率(把 μ 解出来):

P(Y¯1.960.84μY¯+1.960.84)=0.95

代入 y¯=9.5,得到 CI:

(9.50.784, 9.5+0.784)=(8.72, 10.28)

解读:我们有 95% 的把握说真实均值 μ 在 (8.72, 10.28) 之间。

⚠ 严格地说:不是"μ 有 95% 的概率在这个区间里"(μ 是固定的数!),而是"这种造区间的方法,长期重复使用 95% 的区间会包含真值"。

2.3 二项分布参数 p 的置信区间

XBinomial(n,p)n 很大时由 CLT:

X/np(X/n)(1X/n)nN(0,1)

定理p100(1α)% 近似 CI 为

[knzα/2(k/n)(1k/n)n, kn+zα/2(k/n)(1k/n)n]

:Gallup 调查 1012 人,810 支持,p^=810/1012=0.800,95% CI:

0.800±1.960.8×0.21012(0.776,0.825)

2.4 误差范围(Margin of Error, MOE)

注意到 CI 宽度:

w=2zα/2(k/n)(1k/n)n

由于 (k/n)(1k/n)1/4(算术-几何均值),所以:

wmax=2zα/214n=zα/2n

定义:95% CI 的误差范围为

d=1.962n

这就是新闻里常说的"误差 ±3%""±4%"的由来。

n=597d=1.96/(2597)0.040=4%。✓

重要理解:MOE 只和 n 有关,和民调结果 k/n 无关!

2.5 样本量的确定

问题:想让 |X/np|d 的概率至少为 1αn 要多大?

定理

nzα/224d2

推导:由 dp(1p)/n=zα/2n=zα/22p(1p)d2。取最坏情况 p(1p)=1/4,即得。

:要求 98% 把握误差不超过 0.05。z0.01=2.33,所以

n=2.3324×0.052543

3. 估计量的性质

同一个参数,可能有多个估计量。哪个更好?两大标准:无偏性 + 有效性

3.1 无偏性(Unbiasedness)

定义:估计量 θ^ 称为无偏的,若

E(θ^)=θ,θ

直观:平均来说,θ^ 恰好等于真值,没有系统性偏差。

例 1:fY(y;θ)=2y/θ2,0yθ

考虑两个估计量:

  • θ^1=32Y¯
  • θ^2=Ymax

计算 E(Y)=0θy2yθ2dy=23θ

θ^1 是否无偏?

E(θ^1)=32E(Y¯)=3223θ=θ

θ^2 是否无偏?

Ymax 的 pdf:fYmax(y)=n[F(y)]n1f(y),其中 F(y)=y2/θ2

fYmax(y)=n(y2θ2)n12yθ2=2nθ2ny2n1E(Ymax)=0θy2nθ2ny2n1dy=2n2n+1θ

所以 θ^2 有偏!但是 limn2n2n+1θ=θ,称为渐近无偏

例 2:nY¯2 对应的无偏方差(重要!)

Y1,,YnN(μ,σ2)。MLE 给出 σ^2=1n(YiY¯)2

是否无偏?

E(σ^2)=1nE[Yi2nY¯2]=1n[n(σ2+μ2)n(σ2n+μ2)]=n1nσ2

所以 σ^2有偏的,偏向低估!

修正:乘以 nn1

S2=1n1i=1n(YiY¯)2

这就是为什么样本方差分母是 n1,而非 n

3.2 有效性(Efficiency)

两个估计量都无偏时,谁的方差更小,谁就更"有效"(估计更集中在真值附近)。

定义:若 θ^1,θ^2 都是 θ 的无偏估计,且 Var(θ^1)<Var(θ^2),则 θ^1θ^2 更有效

相对有效性Var(θ^2)Var(θ^1)

例:正态均值的两个估计

Y1,Y2,Y3N(μ,σ2) i.i.d.

  • μ^1=14Y1+12Y2+14Y3
  • μ^2=13Y1+13Y2+13Y3(即 Y¯

两者都无偏(系数和为 1)。比方差:

Var(μ^1)=(116+14+116)σ2=38σ2Var(μ^2)=13σ2=39σ2

由于 3/9<3/8,所以 μ^2=Y¯ 更有效

一般结论:对 Y¯=aiYiai=1,保证无偏),由 Cauchy–Schwarz,Var 的最小值在 ai=1/n 时取到。即算术平均是最有效的线性无偏估计


4. Fisher 信息矩阵与 Cramér–Rao 下界

这是本章的理论巅峰,回答一个根本问题:一个无偏估计量的方差能小到什么程度?

4.1 直觉:信息 = 数据告诉我们参数的"多少"

考虑对数似然 (θ)=lnf(X;θ)

  • 如果 在真值附近非常"尖"(二阶导很负),说明数据对 θ 反应灵敏 → 信息量大
  • 如果 很"平",说明稍微移动 θ 对似然几乎没影响 → 信息量小

4.2 Fisher 信息(单参数)

定义

I(θ)=E[(θlnf(X;θ))2]

这个东西叫得分函数(score)的方差。

等价形式(在正则性条件下,即积分/求导可换序):

I(θ)=E[2θ2lnf(X;θ)]

这个形式更直观:对数似然的曲率期望 = 信息量。曲率越大(二阶导越负),信息越多。

4.3 多参数:Fisher 信息矩阵

θ=(θ1,,θk),定义

I(θ)=E[(lnfθ)(lnfθ)]

等价地:

I(θ)=E[2lnfθθ]

(这是一个 k×k 矩阵,元素为 Iij(θ)=E[2/θiθj]。)

4.4 参数变换下的信息

θ=ψ(η)ψ 可微,则 X 关于 η 的 Fisher 信息为

Iη(η)=(ψη)I(ψ(η))(ψη)

这就是信息随参数化的链式法则

4.5 Cramér–Rao 下界(CRLB)

定理:设 T(X) 是参数 θ 的估计量,E[T(X)]=g(θ) 可微。在正则性条件下:

Var(T(X))(gθ)[I(θ)]1(gθ)

特例:若 Tθ无偏估计(即 g(θ)=θk=1):

Var(T)1I(θ)

物理含义任何无偏估计量的方差都不可能小于 1/I(θ)

  • 所以 I(θ) 越大,方差下界越小,我们能做得越好
  • 如果某个无偏估计达到了 CRLB,它就是最有效的(称为有效估计量

4.6 证明思路(一维情形)

要证:Var(T)[g(θ)]2/I(θ)

关键等式

  1. E[lnfθ]=0(得分函数均值为 0)

    推导:lnfθfdx=fθdx=θfdx=0

  2. 由 1 知 E[(lnfθ)2]=Var(lnfθ)=I(θ)

  3. g(θ)=Cov(T,lnfθ)

    推导:

    g(θ)=θT(x)f(x;θ)dx=T(x)fθdx=T(x)lnfθfdx=E[Tlnfθ]

    再减去 E(T)E[lnf/θ]=0,就得到 Cov。

  4. 用 Cauchy–Schwarz:

    [Cov(T,S)]2Var(T)Var(S)

    [g(θ)]2Var(T)I(θ),整理得证。

4.7 指数族的特别结论

命题:若 fθ(x)=exp{η(θ)T(x)ξ(θ)}h(x) 是指数族。

  1. 正则性条件自动满足
  2. I(η) 是关于自然参数 η 的 Fisher 信息矩阵,则 Var(T)=I(η)
  3. I¯(ϑ) 是关于 ϑ=E[T(X)] 的 Fisher 信息,则 Var(T)=[I¯(ϑ)]1

结论:指数族里的充分统计量 T(X) 的方差恰好等于/就是 Fisher 信息的逆,达到 CRLB

4.8 例:正态均值 μ(已知 σ2

X1,,XnN(μ,σ2) i.i.d.

lnfμ(X)=n2ln(2πσ2)12σ2(Xiμ)2μlnf=1σ2(Xiμ)2μ2lnf=nσ2

所以 I(μ)=n/σ2,CRLB =σ2/n

X¯ 是无偏估计,Var(X¯)=σ2/n正好达到下界X¯μ 的 UMVUE(一致最小方差无偏估计)。

4.9 例:估计 ϑ=μ2

E[X¯2]=μ2+σ2/n,所以无偏估计为 h(X¯)=X¯2σ2/n

可算得

Var(h(X¯))=4μ2σ2n+2σ4n2

由链式法则 CRLB(g(μ)=μ2g(μ)=2μ):

CRLB=[g(μ)]2I(μ)=4μ2n/σ2=4μ2σ2n

两者之差为 2σ4/n2,是 O(1/n2) 量级。这说明 h(X¯)UMVUE 但不是有效估计(没达到 CRLB)。

这是一个重要认识:UMVUE ⊋ 有效估计(UMVUE 只保证方差在所有无偏估计中最小,但不一定等于 CRLB)。


5. 复习梳理:本章知识体系图

                     参数估计
                       |
         ┌─────────────┼─────────────┐
         |             |             |
      点估计         区间估计       估计量评价
         |             |             |
   ┌─────┼─────┐   正态/二项CI    无偏性
   MLE  MoM  顺序统计量  误差范围    有效性
                 (定义域含θ)  样本量         |
                                       Fisher 信息
                                          |
                                    Cramér-Rao 下界
                                          |
                                   有效估计 / UMVUE

6. 常见错误与考点提示

误区正确认识
样本方差分母用 n无偏需用 n1S2
MLE 一定无偏不一定!比如 σ^2Ymax
CI 里有 95% 的概率含真值95% 是方法的重复覆盖率,μ 是定值
定义域含参数的 MLE 仍求导要直接看似然函数的单调性,MLE 往往是顺序统计量
CRLB 一定能达到只有指数族自然参数的充分统计量可以,其他情况不一定
Margin of Error 取决于 p^只取决于 n(取最坏情况 p=0.5

7. 关键公式速查表

内容公式
似然函数L(θ)=f(yi;θ)
对数似然(θ)=lnf(yi;θ)
Poisson MLEλ~=k¯
Normal MLEμ~=y¯, σ2~=1n(yiy¯)2
样本方差(无偏)S2=1n1(YiY¯)2
Normal 均值 CIy¯±zα/2σ/n
Binomial p 的 CIp^±zα/2p^(1p^)/n
Margin of Error (95%)d=1.96/(2n)
样本量n=zα/22/(4d2)
Fisher 信息I(θ)=E[2/θ2]
Cramér–Rao 下界Var(T)[g(θ)]2/I(θ)
无偏估计 CRLBVar(θ^)1/I(θ)

8. 学习建议

  1. 先理解直觉再看公式:MLE 就是"反向推理——哪种参数值最可能产生这组数据"。
  2. 推导走一遍:别只记结论。Poisson、Normal、Uniform 的 MLE 都亲手推一遍。
  3. MoM vs MLE:MoM 简单但不一定有效;MLE 通常更优(大样本下是渐近最优的)。
  4. CI 理解要准:95% 是方法属性,不是 μ 的属性。
  5. Fisher 信息是一级难点:记住两种等价定义(一阶得分的方差 / 二阶负期望),指数族里方差直接等于 I(η)I(η)1
  6. CRLB 是理论上限:不是所有无偏估计都能达到;达到的叫"有效估计"。

完成这些思路的梳理之后,建议把本章中的每个 Case Study / Example 都自己从头算一遍,尤其是:

  • Poisson 的 MLE(第 9 页)
  • Normal 双参数 MLE(第 20 页)
  • Gamma 的 MoM(第 26 页)
  • Binomial 的 CI(第 35–38 页)
  • 样本方差无偏化(第 59 页)
  • CRLB 证明(第 72 页)
  • 指数族 CRLB 达到(第 73 页)

祝学习顺利!


9. 专题补充:MLE 的技术细节与边界问题

MLE 的例题不只是“求导令零”。真正要掌握的是:似然函数、支持集、边界、约束和参数化都会影响答案。

9.1 MLE 标准流程

对样本 Y1,,Yn,若联合密度或 pmf 为

L(θ)=i=1nf(yi;θ),

常用步骤是:

  1. 写出 likelihood,不能漏掉参数相关的支持集;
  2. 取 log-likelihood:
(θ)=logL(θ);
  1. 求 score:
U(θ)=(θ)θ;
  1. U(θ)=0
  2. 检查二阶导、边界和参数空间;
  3. 给出最终 MLE。

若参数是向量 θ=(θ1,,θp),则解的是 score equations:

(θ)=0.

9.2 支持集依赖参数时,不能只求导

Uniform(0,θ) 是典型例子。似然为

L(θ)=θnI(θy(n)).

在允许的区域 θy(n) 内,θnθ 增大而减小,因此最大值在最小可行点取得:

θ^=y(n).

这里若直接求导,会发现没有内部临界点。正确答案来自边界。

类似地,Uniform(θ,θ+1)、Pareto 下界参数、截断分布等题都要先看支持集。

9.3 MLE 的不变性

θ^θ 的 MLE,且目标参数为

η=g(θ),

则在适当条件下

η^=g(θ^)

η 的 MLE。

例子:若 σ^2σ2 的 MLE,则 σ^=σ^2σ 的 MLE。

注意:MLE 的不变性不等于无偏性保留。g(θ^) 可能是 MLE,但不一定无偏。

9.4 Normal 双参数 MLE 的细节

YiN(μ,σ2),

log-likelihood 为

(μ,σ2)=n2log(2π)n2logσ212σ2i=1n(yiμ)2.

μ 求导得

μ^=y¯.

代回或同时对 σ2 求导得

σ^MLE2=1ni=1n(yiy¯)2.

这不是无偏样本方差。无偏样本方差是

S2=1n1i=1n(yiy¯)2.

MLE 追求最大似然,不自动追求无偏。


10. 专题补充:CI、Margin of Error 与样本量

10.1 区间估计的 pivot 思路

置信区间常从 pivot 开始。pivot 是一个分布不依赖未知参数的随机量。

例如已知 σ 的正态均值:

Z=Y¯μσ/nN(0,1).

P(zα/2Zzα/2)=1α

反解 μ,得到区间。

未知 σ 时,pivot 变成

T=Y¯μS/ntn1.

10.2 Margin of Error

对均值区间

y¯±zα/2σn,

半宽为

d=zα/2σn.

若希望误差不超过 d,需要

n(zα/2σd)2.

对比例 p,大样本区间半宽近似为

d=zα/2p(1p)n.

若没有先验估计,使用最保守的

p(1p)14

得到

nzα/224d2.

95% 区间下 zα/21.96,于是常见近似

d1.962n.

10.3 区间解释的标准表述

正确表述:

使用这种方法重复抽样构造区间,长期来看约有 95% 的区间包含真实参数。

不严谨表述:

这个具体区间以 95% 的概率包含真实参数。

在频率派框架中,参数是固定的,随机的是区间构造过程。


11. 专题补充:Fisher 信息与 CRLB 串联

11.1 Score 的均值为 0

score 定义为

U(θ)=θlogf(Y;θ).

在正则条件下,

Eθ[U(θ)]=0.

这来自

f(y;θ)dy=1

θ 求导。

11.2 Fisher 信息的两个表达

Fisher 信息为

I(θ)=E[U(θ)2].

在正则条件下,也可写为

I(θ)=E[2θ2logf(Y;θ)].

样本独立时,信息量相加:

In(θ)=nI1(θ).

这解释了为什么估计精度通常随 n 增大而提高,标准误通常按 1/n 缩小。

11.3 Cramer-Rao 下界

T(Y)g(θ) 的无偏估计量,则

Varθ(T)[g(θ)]2I(θ).

g(θ)=θ,则

Varθ(T)1I(θ).

达到下界的无偏估计量称为有效估计量。

11.4 CRLB 与 MLE 的关系

CRLB 是有限样本下对无偏估计量方差的下界;MLE 则通常有大样本性质:

n(θ^θ)dN(0,1I1(θ)).

所以 MLE 常说“渐近有效”,即大样本下达到 CRLB 对应的效率。


12. 本章复习清单

核心内容复习时要能做到
likelihood会写联合似然并保留支持集
log-likelihood会取对数简化乘积
score equation会求导并检查最大值
边界 MLE知道 Uniform 类题不能只求导
MLE 不变性会把 θ^ 变换成 g(θ^)
Normal MLE区分 MLE 方差和无偏样本方差
pivot会从分布不含未知参数的量反解 CI
margin of error会由半宽反推样本量
Fisher 信息会使用一阶和二阶表达
CRLB会判断无偏估计方差是否达到下界
渐近有效能解释 MLE 与 CRLB 的大样本关系

13. 综合深化:估计量比较、样本量与预测区间

13.1 同为无偏估计,方差可以相差很大

X1,,Xni.i.d.Unif(0,θ)。两个常见的无偏估计量为

T1=2X¯,T2=n+1nX(n).

它们的方差分别是

Var(T1)=θ23n,Var(T2)=θ2n(n+2).

若把 T2 相对于 T1 的效率定义为 Var(T1)/Var(T2),则为 (n+2)/3;反向比值为 3/(n+2)。次序统计量利用了参数进入支持集这一结构,效率会随 n 明显提高。

13.2 偏差—方差分解

评价估计量时不应只看无偏性。平方损失下

MSE(θ^)=Var(θ^)+Bias(θ^)2.

一个略有偏差但方差显著更小的估计量,可能拥有更小的 MSE。后续的收缩估计与正则化正是利用这一权衡。

13.3 由精度要求反推样本量

总体比例的正态近似置信区间半宽约为

d=z1α/2p(1p)n.

若设计阶段不知道 p,利用 p(1p)1/4,取保守样本量

nz1α/224d2,

并向上取整。若已有可靠的先导估计,可用该估计替代 p,但要说明设计依据。

13.4 三类区间不要混淆

  • 参数置信区间:覆盖固定但未知的参数,如总体均值。
  • 均值响应区间:估计给定协变量处的条件均值,包含参数估计误差。
  • 个体预测区间:还要加入新个体自身的随机误差,通常更宽。

共形预测进一步提供有限样本的边际覆盖保证;但边际覆盖不等于对每个协变量取值都满足同样的条件覆盖率。

13.5 正则条件为什么重要

经典 MLE 渐近正态理论通常要求参数不位于边界、支持集不随参数变化、似然足够光滑且 Fisher 信息非退化。Unif(0,θ) 的支持集随 θ 改变,MLE 为 X(n),其误差常呈 n1 量级,而不是常见的 n1/2 量级。这不是理论失效,而是正则模型结论不适用于非正则模型。