value function
价值函数 (Value Function)
价值函数是现代经济学中两个重要分支的核心概念:在动态规划与宏观经济学中,价值函数刻画了决策者在给定状态下所能获得的最大化(或最小化)折现总效用;在行为经济学的前景理论中,价值函数描述了人们对收益和损失的主观估值方式。两者虽共用同一名称,但其数学结构与经济含义截然不同。
动态规划中的价值函数
贝尔曼方程
考虑一个无限期界的离散时间动态优化问题。决策者在每一期 观察状态变量 ,选择控制变量 ,获得即期效用 ,然后状态按转移方程 演化。给定折现因子 ,决策者的目标是最大化期望折现总效用:
价值函数 定义为从状态 出发,遵循最优策略所能获得的最大折现总效用:
这就是著名的贝尔曼方程 (Bellman Equation)。方程右侧的第一项 是当期回报,第二项 是未来所有回报的折现期望值。最优策略函数 通过对右侧取 argmax 得到。
贝尔曼方程是递归方法的核心:它将一个无限维的序列优化问题压缩为关于未知函数 的函数方程。
贝尔曼算子的压缩性
定义贝尔曼算子 :
在上确界范数下,若效用函数有界, 是模 的压缩映射。根据巴拿赫不动点定理(压缩映射定理), 存在唯一不动点,即价值函数 。这为数值求解提供了理论基础:值函数迭代 (Value Function Iteration) 从任意初始猜测 出发,反复施加 ,以线性收敛速率逼近 。
标准应用示例:消费-储蓄问题
考虑一个经典的永久收入假说框架下的消费-储蓄决策。代表性家庭拥有资产 ,选择消费 ,面临预算约束:
其中 为利率, 为随机劳动收入。价值函数满足:
其中 为 CRRA 效用函数。该问题的求解是异质性代理人模型(如 Aiyagari 模型、Huggett 模型)的基础。
随机动态规划与 Q-因子
在强化学习与马尔可夫决策过程 (MDP) 中,价值函数的概念被进一步推广。状态-动作价值函数 (简称 Q-因子)定义为在状态 采取行动 并此后遵循最优策略的期望回报:
价值函数与 Q-因子的关系为 。Q-学习等算法直接估计 Q-因子,而无需求解转移概率模型,这使得价值函数思想在人工智能领域获得了广泛应用。
前景理论中的价值函数
定义与形状
在丹尼尔·卡尼曼与阿莫斯·特沃斯基提出的前景理论 (Prospect Theory) 中,价值函数替代了期望效用理论中的效用函数,描述个体对货币结果的主观估值。其核心特征有三:
- 参考点依赖:价值定义在相对于某个参考点(通常为现状)的收益与损失上,而非绝对财富水平。
- 损失厌恶:损失带来的痛苦大于等额收益带来的快乐,即函数在损失区域的斜率大于收益区域。实证估计损失厌恶系数 。
- 边际敏感性递减:在收益区域为凹函数(风险厌恶),在损失区域为凸函数(风险寻求)。
常用的参数化形式(Tversky \& Kahneman, 1992)为分段幂函数:
其中 为相对于参考点的损益值, 控制敏感性递减的曲率, 为损失厌恶系数。典型估计值为 ,。
S 形函数图像
前景理论价值函数呈现著名的 S 形:在原点(参考点)处存在一个折拐(kink),左侧(损失域)斜率是右侧(收益域)的 倍。该折拐反映了损失厌恶——从参考点向右走一小步所获得的愉悦,小于向左走同样距离所遭受的痛苦。
这一形状解释了诸多行为异常,包括禀赋效应(一旦拥有某物,放弃它的痛苦大于获得它的快乐)、现状偏差以及股权溢价之谜的短视损失厌恶解释。
与标准效用函数的对比
与传统期望效用理论相比,前景理论价值函数的关键区别在于:
- 载体不同:传统效用定义在最终财富水平上(Bernoulli 的 或 CRRA 的 ),而价值函数定义在财富变化 上。
- 非线性概率加权:前景理论中,价值并非直接按客观概率期望,而是按决策权重函数 加权,其中小概率被高估,中大概率被低估。
- 损失域的风险态度反转:传统效用函数通常全局凹,而在前景理论中,损失域为凸函数,预测个体在损失域内倾向于风险寻求——愿意赌一把来挽回损失。
两种价值函数的比较
- 动态规划价值函数 是规范性的:它描述了完全理性决策者应当如何选择以达到最优结果。其理论基础是压缩映射与不动点定理,主要应用于宏观经济学、产业组织、劳动经济学中的动态结构模型估计。
- 前景理论价值函数 是描述性的:它刻画了现实中人们如何进行决策,包含系统性偏离理性基准的行为特征。其理论基础是实验心理学,主要应用于行为经济学、金融学、市场营销与公共政策设计。
尽管两类价值函数用途迥异,它们共享一个深层主题:将复杂的决策问题映射为一个标量值,从而实现对选择的排序与优化。在动态规划中,价值函数的"值"是折现总效用的充分统计量;在前景理论中,价值函数的"值"是主观感受的载体。这使价值函数成为贯穿经济学理论——从最抽象的数学规划到最贴近现实的心理学描述——的统一语言。