知经百科 / V

value function

价值函数 (Value Function)

价值函数是现代经济学中两个重要分支的核心概念:在动态规划与宏观经济学中,价值函数刻画了决策者在给定状态下所能获得的最大化(或最小化)折现总效用;在行为经济学的前景理论中,价值函数描述了人们对收益和损失的主观估值方式。两者虽共用同一名称,但其数学结构与经济含义截然不同。

动态规划中的价值函数

贝尔曼方程

考虑一个无限期界的离散时间动态优化问题。决策者在每一期 tt 观察状态变量 st∈Ss_t \in S,选择控制变量 at∈A(st)a_t \in A(s_t),获得即期效用 u(st,at)u(s_t, a_t),然后状态按转移方程 st+1=g(st,at)s_{t+1} = g(s_t, a_t) 演化。给定折现因子 β∈(0,1)\beta \in (0,1),决策者的目标是最大化期望折现总效用:

E0∑t=0∞βtu(st,at)\mathbb{E}_0 \sum_{t=0}^{\infty} \beta^t u(s_t, a_t)

价值函数 V(s)V(s) 定义为从状态 ss 出发,遵循最优策略所能获得的最大折现总效用:

V(s)=max⁡a∈A(s){u(s,a)+βE[V(s′)∣s,a]}V(s) = \max_{a \in A(s)} \left\{ u(s, a) + \beta \mathbb{E}\left[V(s') \mid s, a\right] \right\}

这就是著名的贝尔曼方程 (Bellman Equation)。方程右侧的第一项 u(s,a)u(s, a) 是当期回报,第二项 βE[V(s′)]\beta \mathbb{E}[V(s')] 是未来所有回报的折现期望值。最优策略函数 a∗=π(s)a^* = \pi(s) 通过对右侧取 argmax 得到。

贝尔曼方程是递归方法的核心:它将一个无限维的序列优化问题压缩为关于未知函数 VV 的函数方程。

贝尔曼算子的压缩性

定义贝尔曼算子 T\mathcal{T}:

(TW)(s)=max⁡a∈A(s){u(s,a)+βE[W(s′)∣s,a]}(\mathcal{T}W)(s) = \max_{a \in A(s)} \left\{ u(s, a) + \beta \mathbb{E}\left[W(s') \mid s, a\right] \right\}

在上确界范数下,若效用函数有界,T\mathcal{T} 是模 β\beta 的压缩映射。根据巴拿赫不动点定理(压缩映射定理),T\mathcal{T} 存在唯一不动点,即价值函数 V=TVV = \mathcal{T}V。这为数值求解提供了理论基础:值函数迭代 (Value Function Iteration) 从任意初始猜测 V0V_0 出发,反复施加 T\mathcal{T},以线性收敛速率逼近 VV。

标准应用示例:消费-储蓄问题

考虑一个经典的永久收入假说框架下的消费-储蓄决策。代表性家庭拥有资产 ata_t,选择消费 ctc_t,面临预算约束:

at+1=(1+r)(at−ct)+yt+1a_{t+1} = (1 + r)(a_t - c_t) + y_{t+1}

其中 rr 为利率,yty_t 为随机劳动收入。价值函数满足:

V(a,y)=max⁡0≤c≤a{u(c)+βE[V((1+r)(a−c)+y′,y′)∣y]}V(a, y) = \max_{0 \leq c \leq a} \left\{ u(c) + \beta \mathbb{E}\left[V((1+r)(a-c) + y', y') \mid y\right] \right\}

其中 u(c)=c1−γ−11−γu(c) = \frac{c^{1-\gamma} - 1}{1-\gamma} 为 CRRA 效用函数。该问题的求解是异质性代理人模型(如 Aiyagari 模型、Huggett 模型)的基础。

随机动态规划与 Q-因子

在强化学习与马尔可夫决策过程 (MDP) 中,价值函数的概念被进一步推广。状态-动作价值函数 Q(s,a)Q(s, a)(简称 Q-因子)定义为在状态 ss 采取行动 aa 并此后遵循最优策略的期望回报:

Q(s,a)=u(s,a)+βE[max⁡a′Q(s′,a′)∣s,a]Q(s, a) = u(s, a) + \beta \mathbb{E}\left[\max_{a'} Q(s', a') \mid s, a\right]

价值函数与 Q-因子的关系为 V(s)=max⁡aQ(s,a)V(s) = \max_a Q(s, a)。Q-学习等算法直接估计 Q-因子,而无需求解转移概率模型,这使得价值函数思想在人工智能领域获得了广泛应用。

前景理论中的价值函数

定义与形状

在丹尼尔·卡尼曼与阿莫斯·特沃斯基提出的前景理论 (Prospect Theory) 中,价值函数替代了期望效用理论中的效用函数,描述个体对货币结果的主观估值。其核心特征有三:

  1. 参考点依赖:价值定义在相对于某个参考点(通常为现状)的收益与损失上,而非绝对财富水平。
  2. 损失厌恶:损失带来的痛苦大于等额收益带来的快乐,即函数在损失区域的斜率大于收益区域。实证估计损失厌恶系数 λ≈2.25\lambda \approx 2.25。
  3. 边际敏感性递减:在收益区域为凹函数(风险厌恶),在损失区域为凸函数(风险寻求)。

常用的参数化形式(Tversky \& Kahneman, 1992)为分段幂函数:

v(x)={xα若 x≥0−λ(−x)β若 x<0v(x) = \begin{cases} x^{\alpha} & \text{若 } x \geq 0 \\ -\lambda (-x)^{\beta} & \text{若 } x < 0 \end{cases}

其中 xx 为相对于参考点的损益值,α,β∈(0,1)\alpha, \beta \in (0,1) 控制敏感性递减的曲率,λ>1\lambda > 1 为损失厌恶系数。典型估计值为 α=β=0.88\alpha = \beta = 0.88,λ=2.25\lambda = 2.25。

S 形函数图像

前景理论价值函数呈现著名的 S 形:在原点(参考点)处存在一个折拐(kink),左侧(损失域)斜率是右侧(收益域)的 λ\lambda 倍。该折拐反映了损失厌恶——从参考点向右走一小步所获得的愉悦,小于向左走同样距离所遭受的痛苦。

这一形状解释了诸多行为异常,包括禀赋效应(一旦拥有某物,放弃它的痛苦大于获得它的快乐)、现状偏差以及股权溢价之谜的短视损失厌恶解释。

与标准效用函数的对比

与传统期望效用理论相比,前景理论价值函数的关键区别在于:

  • 载体不同:传统效用定义在最终财富水平上(Bernoulli 的 ln⁡w\ln w 或 CRRA 的 w1−γ/(1−γ)w^{1-\gamma}/(1-\gamma)),而价值函数定义在财富变化 Δw\Delta w 上。
  • 非线性概率加权:前景理论中,价值并非直接按客观概率期望,而是按决策权重函数 π(p)\pi(p) 加权,其中小概率被高估,中大概率被低估。
  • 损失域的风险态度反转:传统效用函数通常全局凹,而在前景理论中,损失域为凸函数,预测个体在损失域内倾向于风险寻求——愿意赌一把来挽回损失。

两种价值函数的比较

  • 动态规划价值函数 V(s)V(s) 是规范性的:它描述了完全理性决策者应当如何选择以达到最优结果。其理论基础是压缩映射与不动点定理,主要应用于宏观经济学、产业组织、劳动经济学中的动态结构模型估计。
  • 前景理论价值函数 v(x)v(x) 是描述性的:它刻画了现实中人们如何进行决策,包含系统性偏离理性基准的行为特征。其理论基础是实验心理学,主要应用于行为经济学、金融学、市场营销与公共政策设计。

尽管两类价值函数用途迥异,它们共享一个深层主题:将复杂的决策问题映射为一个标量值,从而实现对选择的排序与优化。在动态规划中,价值函数的"值"是折现总效用的充分统计量;在前景理论中,价值函数的"值"是主观感受的载体。这使价值函数成为贯穿经济学理论——从最抽象的数学规划到最贴近现实的心理学描述——的统一语言。

返回百科索引