知经百科 / Z

正定二次型

定义

V V 是实数域 R \mathbb{R} 上的 n n 维向量空间,Q:VR Q: V \to \mathbb{R} 是一个二次型。若对任意非零向量 xV{0} \mathbf{x} \in V\setminus\{\mathbf{0}\} ,恒有 Q(x)>0 Q(\mathbf{x}) > 0 ,则称 Q Q 正定二次型(positive definite quadratic form)。

在标准基下,二次型可唯一地表示为

Q(x)=xTAx=i=1nj=1naijxixj,Q(\mathbf{x}) = \mathbf{x}^{\mathsf{T}} A \mathbf{x} = \sum_{i=1}^{n}\sum_{j=1}^{n} a_{ij} x_i x_j,

其中 A=(aij) A = (a_{ij}) n n 阶实对称矩阵,称为该二次型的矩阵。此时 Q Q 正定当且仅当 A A 正定矩阵(positive definite matrix),即 A A 的所有特征值均为正数。几何上,正定二次型 Q(x)=c Q(\mathbf{x}) = c c>0 c > 0 )表示 Rn \mathbb{R}^n 中的一个椭球面,其中心位于原点。

历史背景

正定二次型的概念最早由 Gauss 在数论研究中提出,用于讨论二元二次型的分类问题。随后 Jacobi、Sylvester 等人将其发展为线性代数的重要分支。Sylvester 于 1852 年提出了著名的惯性定律,揭示了实二次型在合同变换下的不变量——正惯性指数、负惯性指数和零惯性指数,为正定性的判定奠定了理论基础。

正定性的判别准则

1. 顺序主子式判别法(Sylvester 准则)

实二次型 Q(x)=xTAx Q(\mathbf{x}) = \mathbf{x}^{\mathsf{T}} A \mathbf{x} 正定的充要条件是 A A 的各阶顺序主子式(leading principal minors)全部大于零:

Δ1=a11>0,Δ2=a11a12a21a22>0,\Delta_1 = a_{11} > 0,\quad \Delta_2 = \begin{vmatrix} a_{11} & a_{12} \\ a_{21} & a_{22} \end{vmatrix} > 0,\quad

\ldots,\quad

Δn=detA>0.\Delta_n = \det A > 0.

这是判断正定性最经典、最常用的代数方法。以二阶情况为例,二次型 Q(x,y)=ax2+2bxy+cy2 Q(x,y) = ax^2 + 2bxy + cy^2 正定的充要条件是 a>0 a > 0 acb2>0 ac - b^2 > 0 ,这正是解析几何中判别椭圆的条件。

2. 特征值判别法

Q Q 正定当且仅当对称矩阵 A A 的所有特征值 λ1,λ2,,λn \lambda_1, \lambda_2, \ldots, \lambda_n 均为正数。这一判别法在理论分析中尤为重要,它揭示了正定性的内在几何意义:二次型 Q Q 的等值面 Q(x)=c Q(\mathbf{x}) = c c>0 c > 0 )是 Rn \mathbb{R}^n 中的椭球面,各主轴方向由特征向量决定,主轴长度由特征值的倒数 c/λi \sqrt{c/\lambda_i} 决定。

3. 合同变换法

若存在可逆矩阵 P P 使得 PTAP=In P^{\mathsf{T}} A P = I_n (单位矩阵),则 A A 正定。换言之,正定矩阵与单位矩阵合同。通过 Lagrange 配方法或 LDL 分解可将二次型化为标准形:

Q(x)=y12+y22++yn2,Q(\mathbf{x}) = y_1^2 + y_2^2 + \cdots + y_n^2,

其中 y=P1x \mathbf{y} = P^{-1}\mathbf{x} 。配方法的基本思路是逐步提取完全平方项,每次消去一个变量,最终将二次型化为平方和的形式。

4. Cholesky 分解

对称矩阵 A A 正定当且仅当存在唯一的实可逆下三角矩阵 L L (对角线元素为正)使得 A=LLT A = L L^{\mathsf{T}} 。这一分解称为 Cholesky 分解,在数值计算中广泛用于求解正定线性方程组。与 LU 分解相比,Cholesky 分解的计算量约减半,且数值稳定性更好。具体算法如下:对 j=1,2,,n j = 1, 2, \ldots, n ,计算

ljj=ajjk=1j1ljk2,lij=1ljj(aijk=1j1likljk),i>j.l_{jj} = \sqrt{a_{jj} - \sum_{k=1}^{j-1} l_{jk}^2},\qquad l_{ij} = \frac{1}{l_{jj}}\left(a_{ij} - \sum_{k=1}^{j-1} l_{ik} l_{jk}\right),\quad i > j.

5. 主子式判别法

除顺序主子式外,正定矩阵的所有主子式(principal minors)也都大于零。所谓主子式,是指行指标集与列指标集相同的子式。这一条件实际上与顺序主子式条件等价,但有时在理论推导中更为方便。

基本性质

A A B B 均为 n n 阶正定矩阵,则有以下性质:

  1. 加法封闭性A+B A + B 也是正定矩阵。
  2. 数乘封闭性:对任意正实数 k>0 k > 0 kA kA 是正定矩阵。
  3. 逆矩阵正定A1 A^{-1} 存在且正定。
  4. 合同不变性:若 P P 可逆,则 PTAP P^{\mathsf{T}} A P 也正定。
  5. 对角元为正aii>0 a_{ii} > 0 i=1,2,,n i = 1, 2, \ldots, n )。
  6. 行列式为正detA>0 \det A > 0
  7. 可对角化:存在正交矩阵 U U 使得 UTAU=diag(λ1,,λn) U^{\mathsf{T}} A U = \operatorname{diag}(\lambda_1, \ldots, \lambda_n) ,其中 λi>0 \lambda_i > 0
  8. 平方根存在:存在唯一的正定矩阵 R R 使得 R2=A R^2 = A ,记作 R=A1/2 R = A^{1/2}

与其他定号类型的关系

与正定性相对应,还有以下几种重要的定号类型:

  • 负定二次型(negative definite):对任意非零 x \mathbf{x} Q(x)<0 Q(\mathbf{x}) < 0 ,等价于 A A 的所有特征值为负,也等价于 (1)kΔk>0 (-1)^k \Delta_k > 0 k=1,2,,n k = 1, 2, \ldots, n )。
  • 半正定二次型(positive semidefinite):Q(x)0 Q(\mathbf{x}) \ge 0 ,且存在非零向量使等号成立;等价于 A A 的特征值均非负。半正定的顺序主子式条件为所有主子式 0 \ge 0
  • 半负定二次型(negative semidefinite):Q(x)0 Q(\mathbf{x}) \le 0 ,且存在非零向量使等号成立。
  • 不定二次型(indefinite):Q(x) Q(\mathbf{x}) 既可取正值也可取负值,此时 A A 既有正特征值也有负特征值。

Sylvester 惯性定理指出,实二次型 Q Q 在合同变换下的正惯性指数 p p (正特征值个数)、负惯性指数 q q (负特征值个数)和零惯性指数 r r (零特征值个数)是唯一确定的,且 p+q+r=n p + q + r = n 。正定即 p=n p = n q=0 q = 0 ;半正定即 q=0 q = 0

应用举例

多元函数极值

f:RnR f: \mathbb{R}^n \to \mathbb{R} 是二阶连续可微函数,x0 \mathbf{x}_0 是其驻点,即 f(x0)=0 \nabla f(\mathbf{x}_0) = \mathbf{0} 。将 f f x0 \mathbf{x}_0 处 Taylor 展开到二阶:

f(x0+h)=f(x0)+12hTH(x0)h+o(h2),f(\mathbf{x}_0 + \mathbf{h}) = f(\mathbf{x}_0) + \frac12 \mathbf{h}^{\mathsf{T}} H(\mathbf{x}_0) \mathbf{h} + o(\|\mathbf{h}\|^2),

其中 H(x0) H(\mathbf{x}_0) 是 Hessian 矩阵。若 H(x0) H(\mathbf{x}_0) 正定,则 f f x0 \mathbf{x}_0 处取严格局部极小值;若 H(x0) H(\mathbf{x}_0) 负定,则取严格局部极大值;若 H(x0) H(\mathbf{x}_0) 不定,则为鞍点。

最优化方法

在凸优化中,若目标函数 f f 的 Hessian 矩阵处处正定,则 f f 是严格凸函数。强凸性(strong convexity)即 Hessian 矩阵的最小特征值一致大于某个正数 μ>0 \mu > 0 ,它保证了梯度下降法等一阶迭代算法的线性收敛速度,且收敛率与条件数 κ=λmax/λmin \kappa = \lambda_{\max}/\lambda_{\min} 有关。牛顿法利用 Hessian 矩阵的正定性构造 Newton 方向 d=H1f \mathbf{d} = -H^{-1}\nabla f ,在正定条件下该方向是下降方向。

内积与度量

正定二次型与内积有着天然的联系:Rn \mathbb{R}^n 上的标准内积 x,y=xTy \langle \mathbf{x}, \mathbf{y} \rangle = \mathbf{x}^{\mathsf{T}} \mathbf{y} 诱导出二次型 Q(x)=x2 Q(\mathbf{x}) = \|\mathbf{x}\|^2 。更一般地,任意正定矩阵 A A 定义了 Rn \mathbb{R}^n 上的一个内积 x,yA=xTAy \langle \mathbf{x}, \mathbf{y} \rangle_A = \mathbf{x}^{\mathsf{T}} A \mathbf{y} ,从而给出了一个新的度量结构。这正是 Riemann 几何中度量张量的线性代数基础——Riemann 度量在每一点可视为切空间上的一个正定二次型。

概率统计与机器学习

协方差矩阵 Σ \Sigma 是半正定矩阵。在多维正态分布 N(μ,Σ) N(\boldsymbol{\mu}, \Sigma) 中,若 Σ \Sigma 正定,则分布有密度函数

f(x)=1(2π)n/2(detΣ)1/2exp ⁣(12(xμ)TΣ1(xμ)),f(\mathbf{x}) = \frac{1}{(2\pi)^{n/2}(\det\Sigma)^{1/2}} \exp\!\left(-\frac12 (\mathbf{x}-\boldsymbol{\mu})^{\mathsf{T}} \Sigma^{-1} (\mathbf{x}-\boldsymbol{\mu})\right),

等密度面为椭球面,其形状由 Σ \Sigma 的特征值分解决定。主成分分析(PCA)本质上是对协方差矩阵进行特征值分解,各主成分的方差即对应特征值。在核方法中,核矩阵(Gram 矩阵)的正定性保证了 Mercer 定理成立,从而保证核函数的合法性。

数值线性代数

在有限元方法和偏微分方程数值解中,刚度矩阵通常是正定矩阵,这保证了离散系统的解存在唯一且可用共轭梯度法(CG)高效求解。CG 法是求解大型稀疏正定线性方程组最有效的迭代方法之一,其收敛速度依赖于系数矩阵的条件数。

参考文献

  1. Horn, R. A., \& Johnson, C. R. (2012). Matrix Analysis (2nd ed.). Cambridge University Press.
  2. Strang, G. (2016). Introduction to Linear Algebra (5th ed.). Wellesley-Cambridge Press.
  3. 张恭庆, 林源渠. (2005). 泛函分析讲义 (上册). 北京大学出版社.
  4. Boyd, S., \& Vandenberghe, L. (2004). Convex Optimization. Cambridge University Press.
  5. Golub, G. H., \& Van Loan, C. F. (2013). Matrix Computations (4th ed.). Johns Hopkins University Press.

返回百科索引