知经百科 / W

无约束

无约束最优化 (Unconstrained Optimization)

无约束最优化最优化理论中最基本的框架,指在决策变量不受任何等式或不等式限制的条件下,寻找使得目标函数 f:RnRf: \mathbb{R}^n \to \mathbb{R} 取得极大值或极小值的点。它是非线性规划计量经济学估计(如最大似然估计)、机器学习参数训练和各类经济模型求解的数学基础。

一阶必要条件

对于 C1C^1(连续可微)的函数 f(x)f(\mathbf{x}),若 x\mathbf{x}^* 是局部极值点,则梯度向量在该点必为零:

f(x)=0\nabla f(\mathbf{x}^*) = \mathbf{0}

即对于所有 i=1,,ni = 1, \dots, n,有 fxi(x)=0\frac{\partial f}{\partial x_i}(\mathbf{x}^*) = 0。满足该条件的点称为驻点 (stationary point) 或临界点。一阶条件是必要而非充分的:驻点可能是局部极小点、局部极大点,也可能是鞍点

在经济学的企业理论中,利润最大化的一阶条件正是边际收益等于边际成本。设利润函数 π(q)=R(q)C(q)\pi(q) = R(q) - C(q),则 π(q)=R(q)C(q)=0\pi'(q^*) = R'(q^*) - C'(q^*) = 0,即 MR(q)=MC(q)MR(q^*) = MC(q^*)。这是无约束利润最大化(如完全竞争市场中企业以价格为参数选择产量)的核心条件。

二阶充分条件与海森矩阵

x\mathbf{x}^* 为驻点,定义海森矩阵 (Hessian matrix):

Hf(x)=[2fxixj]n×nH_f(\mathbf{x}) = \left[ \frac{\partial^2 f}{\partial x_i \partial x_j} \right]_{n \times n}

二阶充分条件取决于海森矩阵的定号性:

  1. 局部极小点的充分条件f(x)=0\nabla f(\mathbf{x}^*) = \mathbf{0}Hf(x)H_f(\mathbf{x}^*) 正定(所有顺序主子式大于零)。
  2. 局部极大点的充分条件f(x)=0\nabla f(\mathbf{x}^*) = \mathbf{0}Hf(x)H_f(\mathbf{x}^*) 负定(顺序主子式符号交替为负、正、负……)。
  3. 鞍点:海森矩阵不定(同时有正、负特征值)。

对于单变量函数 f(x)f(x),二阶条件退化为 f(x)>0f''(x^*) > 0(极小)或 f(x)<0f''(x^*) < 0(极大)。在经济学中,利润最大化的二阶条件是 R(q)<C(q)R''(q^*) < C''(q^*),即边际收益的斜率小于边际成本的斜率,这实质上要求海森矩阵负定,确保利润函数在驻点处是局部凹的。

凹性与全局最优

若目标函数 ff凹函数 (concave function),则任何局部极大点自动成为全局极大点,且一阶必要条件也是充分的。凹性定义:对于任意 x,y\mathbf{x}, \mathbf{y}λ[0,1]\lambda \in [0,1]

f(λx+(1λ)y)λf(x)+(1λ)f(y)f(\lambda \mathbf{x} + (1-\lambda)\mathbf{y}) \geq \lambda f(\mathbf{x}) + (1-\lambda) f(\mathbf{y})

等价地,当 ffC2C^2 时,Hf(x)H_f(\mathbf{x}) 处处半负定。类似地,若 ff凸函数,则一阶条件给出全局极小点。

计量经济学中,普通最小二乘法 (OLS) 的目标函数 S(β)=yXβ2S(\boldsymbol{\beta}) = \|\mathbf{y} - \mathbf{X}\boldsymbol{\beta}\|^2β\boldsymbol{\beta} 的凸二次函数,因此一阶条件 S=2X(yXβ)=0\nabla S = -2\mathbf{X}^\top(\mathbf{y} - \mathbf{X}\boldsymbol{\beta}) = \mathbf{0} 直接给出全局最优解 β^=(XX)1Xy\hat{\boldsymbol{\beta}} = (\mathbf{X}^\top\mathbf{X})^{-1}\mathbf{X}^\top\mathbf{y}。凸性的保证使得 OLS 具有解析解和良好的数值稳定性。

与约束最优化的联系

无约束最优化虽是约束最优化的退化情形,但许多约束问题通过拉格朗日乘数法KKT条件处理后可转化为无约束或低约束问题。例如,惩罚函数法障碍函数法将约束融入目标函数:

minx  f(x)+μiϕ(gi(x))\min_{\mathbf{x}} \; f(\mathbf{x}) + \mu \sum_{i} \phi(g_i(\mathbf{x}))

其中 μ>0\mu > 0 是惩罚参数,ϕ\phi 随约束违反程度递增。当 μ\mu \to \infty 时,该无约束问题的解趋近原约束问题的解。

在经济学中,支出最小化问题 minxpx  s.t.  u(x)uˉ\min_{\mathbf{x}} \mathbf{p} \cdot \mathbf{x} \; \text{s.t.} \; u(\mathbf{x}) \geq \bar{u} 是一个约束问题,但通过拉格朗日函数 L=pxλ(u(x)uˉ)\mathcal{L} = \mathbf{p} \cdot \mathbf{x} - \lambda(u(\mathbf{x}) - \bar{u}),其求解最终归结为一组无约束型的一阶方程。

数值求解方法

解析求解一阶条件方程组在实际问题中往往不可行,因此常借助迭代数值方法:

  1. 梯度下降法x(k+1)=x(k)αkf(x(k))\mathbf{x}^{(k+1)} = \mathbf{x}^{(k)} - \alpha_k \nabla f(\mathbf{x}^{(k)}),沿负梯度方向迭代,步长 αk\alpha_k 由线搜索确定。适用于大规模问题,是机器学习中反向传播优化的基础。
  2. 牛顿法x(k+1)=x(k)[Hf(x(k))]1f(x(k))\mathbf{x}^{(k+1)} = \mathbf{x}^{(k)} - [H_f(\mathbf{x}^{(k)})]^{-1} \nabla f(\mathbf{x}^{(k)}),利用二阶信息实现二次收敛速度,但每步需计算和求逆海森矩阵,计算成本高。
  3. 拟牛顿法 (如 BFGS):不直接计算海森矩阵,而是通过梯度差分逐步逼近海森矩阵或其逆,兼顾超线性收敛速度与计算可行性,是计量经济学软件中非线性估计的主流算法。

全局最优与凸性

对于一般的非线性函数,一阶和二阶条件仅保证局部最优,无法区分局部极值与全局极值。但当目标函数满足特定的凸性或凹性条件时,局部最优自动升格为全局最优,极大地简化了分析。

凹规划:若极大化问题的目标函数 ff 是凹函数且定义域为凸集,则任何驻点即为全局极大点。同理,对于极小化问题,若 ff 为凸函数,驻点即为全局极小点。这一性质在经济学中至关重要:利润函数在价格和投入品数量上满足凸性或凹性条件,确保了企业最优化问题的良定性。

严格凹性与唯一性:若 ff 是严格凹函数(或严格凸函数),则全局极值点不仅存在且唯一。例如,在消费者理论中,严格拟凹的效用函数在预算约束下导出唯一的马歇尔需求,而这本质上源于加边海森矩阵的负定性——一种无约束二阶条件的推广。

拟凹性与拟凸性:比凹性更弱的条件是拟凹性 (quasiconcavity) 和拟凸性 (quasiconvexity)。拟凹函数的上水平集为凸集,保证了局部极大点也是全局极大点(但未必唯一)。在经济均衡分析中,拟凹性常用于确保竞争均衡的存在性和最优性。

经济学中的应用

无约束最优化贯穿经济学分析的全过程。在微观层面,企业理论中企业选择投入使利润最大化(当不存在投入约束时),或选择产出使利润最大化;在博弈论中,每个参与者的最优反应函数是无约束最大化自身支付的结果;在宏观层面,动态规划中的贝尔曼方程求解将跨期选择转化为每期的无约束优化子问题。

实证产业组织中,结构模型的估计依赖于无约束或弱约束非线性最优化求解参数。在资产定价中,广义矩估计 (GMM) 的目标函数最小化同样是多维无约束问题。无约束最优化方法的可靠性与效率直接影响经济模型从理论设定到实证拟合的转换质量。

一个经典的经济学实例是完全竞争企业的短期利润最大化。设企业以市场价格 pp 销售产品,总成本函数为 C(q)=F+c(q)C(q) = F + c(q),其中 FF 为固定成本。利润函数 π(q)=pqFc(q)\pi(q) = pq - F - c(q)。一阶条件给出 p=c(q)p = c'(q^*)——价格等于边际成本——这是完全竞争市场供给决策的基本法则。二阶条件要求 c(q)>0c''(q^*) > 0,即边际成本在最优产量处递增,这与企业成本曲线通常呈现的 U 形特征一致。若 c(q)c(q) 是凸函数,则利润函数是凹函数,一阶条件自动给出全局最优产量。

总结

无约束最优化是经济数学的基石。一阶条件提供了极值候选点,海森矩阵的定号性从局部确认极值类型,而凹性(或凸性)为局部到全局最优的跃迁提供保障。尽管许多经济问题表面上是约束性的——资源有限、制度制约——但通过拉格朗日法和惩罚技术,求解的内核往往回归无约束框架。对经济学研究者和实践者而言,熟练掌握梯度条件、海森判别和迭代数值方法,是贯通理论推导与实证计算的关键能力。

返回百科索引