定义
设 V 是实数域 R 上的 n 维向量空间,Q:V→R 是一个二次型。若对任意非零向量 x∈V∖{0},恒有 Q(x)>0,则称 Q 是正定二次型(positive definite quadratic form)。
在标准基下,二次型可唯一地表示为
Q(x)=xTAx=i=1∑nj=1∑naijxixj,
其中 A=(aij) 是 n 阶实对称矩阵,称为该二次型的矩阵。此时 Q 正定当且仅当 A 是正定矩阵(positive definite matrix),即 A 的所有特征值均为正数。几何上,正定二次型 Q(x)=c(c>0)表示 Rn 中的一个椭球面,其中心位于原点。
历史背景
正定二次型的概念最早由 Gauss 在数论研究中提出,用于讨论二元二次型的分类问题。随后 Jacobi、Sylvester 等人将其发展为线性代数的重要分支。Sylvester 于 1852 年提出了著名的惯性定律,揭示了实二次型在合同变换下的不变量——正惯性指数、负惯性指数和零惯性指数,为正定性的判定奠定了理论基础。
正定性的判别准则
1. 顺序主子式判别法(Sylvester 准则)
实二次型 Q(x)=xTAx 正定的充要条件是 A 的各阶顺序主子式(leading principal minors)全部大于零:
Δ1=a11>0,Δ2=a11a21a12a22>0,
\ldots,\quad
Δn=detA>0.
这是判断正定性最经典、最常用的代数方法。以二阶情况为例,二次型 Q(x,y)=ax2+2bxy+cy2 正定的充要条件是 a>0 且 ac−b2>0,这正是解析几何中判别椭圆的条件。
2. 特征值判别法
Q 正定当且仅当对称矩阵 A 的所有特征值 λ1,λ2,…,λn 均为正数。这一判别法在理论分析中尤为重要,它揭示了正定性的内在几何意义:二次型 Q 的等值面 Q(x)=c(c>0)是 Rn 中的椭球面,各主轴方向由特征向量决定,主轴长度由特征值的倒数 c/λi 决定。
3. 合同变换法
若存在可逆矩阵 P 使得 PTAP=In(单位矩阵),则 A 正定。换言之,正定矩阵与单位矩阵合同。通过 Lagrange 配方法或 LDL 分解可将二次型化为标准形:
Q(x)=y12+y22+⋯+yn2,
其中 y=P−1x。配方法的基本思路是逐步提取完全平方项,每次消去一个变量,最终将二次型化为平方和的形式。
4. Cholesky 分解
对称矩阵 A 正定当且仅当存在唯一的实可逆下三角矩阵 L(对角线元素为正)使得 A=LLT。这一分解称为 Cholesky 分解,在数值计算中广泛用于求解正定线性方程组。与 LU 分解相比,Cholesky 分解的计算量约减半,且数值稳定性更好。具体算法如下:对 j=1,2,…,n,计算
ljj=ajj−k=1∑j−1ljk2,lij=ljj1(aij−k=1∑j−1likljk),i>j.
5. 主子式判别法
除顺序主子式外,正定矩阵的所有主子式(principal minors)也都大于零。所谓主子式,是指行指标集与列指标集相同的子式。这一条件实际上与顺序主子式条件等价,但有时在理论推导中更为方便。
基本性质
设 A 和 B 均为 n 阶正定矩阵,则有以下性质:
- 加法封闭性:A+B 也是正定矩阵。
- 数乘封闭性:对任意正实数 k>0,kA 是正定矩阵。
- 逆矩阵正定:A−1 存在且正定。
- 合同不变性:若 P 可逆,则 PTAP 也正定。
- 对角元为正:aii>0(i=1,2,…,n)。
- 行列式为正:detA>0。
- 可对角化:存在正交矩阵 U 使得 UTAU=diag(λ1,…,λn),其中 λi>0。
- 平方根存在:存在唯一的正定矩阵 R 使得 R2=A,记作 R=A1/2。
与其他定号类型的关系
与正定性相对应,还有以下几种重要的定号类型:
- 负定二次型(negative definite):对任意非零 x,Q(x)<0,等价于 A 的所有特征值为负,也等价于 (−1)kΔk>0(k=1,2,…,n)。
- 半正定二次型(positive semidefinite):Q(x)≥0,且存在非零向量使等号成立;等价于 A 的特征值均非负。半正定的顺序主子式条件为所有主子式 ≥0。
- 半负定二次型(negative semidefinite):Q(x)≤0,且存在非零向量使等号成立。
- 不定二次型(indefinite):Q(x) 既可取正值也可取负值,此时 A 既有正特征值也有负特征值。
Sylvester 惯性定理指出,实二次型 Q 在合同变换下的正惯性指数 p(正特征值个数)、负惯性指数 q(负特征值个数)和零惯性指数 r(零特征值个数)是唯一确定的,且 p+q+r=n。正定即 p=n、q=0;半正定即 q=0。
应用举例
多元函数极值
设 f:Rn→R 是二阶连续可微函数,x0 是其驻点,即 ∇f(x0)=0。将 f 在 x0 处 Taylor 展开到二阶:
f(x0+h)=f(x0)+21hTH(x0)h+o(∥h∥2),
其中 H(x0) 是 Hessian 矩阵。若 H(x0) 正定,则 f 在 x0 处取严格局部极小值;若 H(x0) 负定,则取严格局部极大值;若 H(x0) 不定,则为鞍点。
最优化方法
在凸优化中,若目标函数 f 的 Hessian 矩阵处处正定,则 f 是严格凸函数。强凸性(strong convexity)即 Hessian 矩阵的最小特征值一致大于某个正数 μ>0,它保证了梯度下降法等一阶迭代算法的线性收敛速度,且收敛率与条件数 κ=λmax/λmin 有关。牛顿法利用 Hessian 矩阵的正定性构造 Newton 方向 d=−H−1∇f,在正定条件下该方向是下降方向。
内积与度量
正定二次型与内积有着天然的联系:Rn 上的标准内积 ⟨x,y⟩=xTy 诱导出二次型 Q(x)=∥x∥2。更一般地,任意正定矩阵 A 定义了 Rn 上的一个内积 ⟨x,y⟩A=xTAy,从而给出了一个新的度量结构。这正是 Riemann 几何中度量张量的线性代数基础——Riemann 度量在每一点可视为切空间上的一个正定二次型。
概率统计与机器学习
协方差矩阵 Σ 是半正定矩阵。在多维正态分布 N(μ,Σ) 中,若 Σ 正定,则分布有密度函数
f(x)=(2π)n/2(detΣ)1/21exp(−21(x−μ)TΣ−1(x−μ)),
等密度面为椭球面,其形状由 Σ 的特征值分解决定。主成分分析(PCA)本质上是对协方差矩阵进行特征值分解,各主成分的方差即对应特征值。在核方法中,核矩阵(Gram 矩阵)的正定性保证了 Mercer 定理成立,从而保证核函数的合法性。
数值线性代数
在有限元方法和偏微分方程数值解中,刚度矩阵通常是正定矩阵,这保证了离散系统的解存在唯一且可用共轭梯度法(CG)高效求解。CG 法是求解大型稀疏正定线性方程组最有效的迭代方法之一,其收敛速度依赖于系数矩阵的条件数。
参考文献
- Horn, R. A., \& Johnson, C. R. (2012). Matrix Analysis (2nd ed.). Cambridge University Press.
- Strang, G. (2016). Introduction to Linear Algebra (5th ed.). Wellesley-Cambridge Press.
- 张恭庆, 林源渠. (2005). 泛函分析讲义 (上册). 北京大学出版社.
- Boyd, S., \& Vandenberghe, L. (2004). Convex Optimization. Cambridge University Press.
- Golub, G. H., \& Van Loan, C. F. (2013). Matrix Computations (4th ed.). Johns Hopkins University Press.