计量经济学研究现实经济问题。人们收集经济数据。数据包含许多数字。这些数字记录经济现象。研究者想知道经济变量之间的关系。比如收入如何影响消费。比如教育如何影响工资。研究者使用统计方法分析数据。计量经济学提供这些方法。
研究者首先有一个问题。这个问题来自经济理论。比如最低工资会不会影响就业。理论给出不同观点。有的理论说最低工资减少就业。有的理论说最低工资可能增加就业。研究者需要事实检验理论。事实就在数据中。数据来自现实世界。政府发布很多数据。企业也有数据。调查公司收集数据。研究者找到合适数据。
数据有很多形式。有的是时间序列数据。时间序列数据跟踪同一个对象不同时间。比如中国每年的国内生产总值。比如每月的物价指数。时间序列数据展示变化趋势。有的是截面数据。截面数据记录不同对象同一时间的信息。比如今年不同家庭的收入与支出。截面数据比较个体差异。还有面板数据。面板数据结合时间和截面。面板数据跟踪多个个体多年情况。面板数据更丰富。
数据需要整理。原始数据可能混乱。可能有错误数字。可能有缺失值。研究者清洗数据。研究者检查数据合理性。比如年龄不能是负数。比如工资不能异常高。研究者处理缺失值。有时用平均值填充。有时直接删除缺失样本。数据整理好后才能分析。
研究者建立计量模型。模型是数学公式。公式表达变量关系。最简单的模型是线性回归模型。线性回归假设关系是直线。比如消费等于收入乘以系数再加常数。系数表示影响大小。常数表示基础水平。模型包含扰动项。扰动项代表其他所有因素。扰动项是随机的。模型不可能完美。扰动项吸收未考虑因素。
研究者用数据估计模型。估计就是找系数值。最常用方法是最小二乘法。最小二乘法找一条直线。这条直线距离所有数据点最近。距离指垂直距离。最小二乘法计算简单。计算机可以快速计算。研究者得到系数估计值。系数估计值是一个数字。这个数字表示关系强度。比如收入系数是零点八。这表示收入增加一元消费增加八角。研究者也得到系数标准误。标准误衡量估计精度。标准误小表示估计准确。标准误大表示估计不准确。
研究者检验假设。假设检验判断关系是否真实存在。零假设通常是没有关系。备择假设是有关系。研究者计算t统计量。t统计量是系数估计值除以标准误。t统计量大表示关系显著。研究者查看p值。p值小表示结果显著。显著意味着关系不太可能是偶然。研究者通常用百分之五作为标准。p值小于零点零五认为显著。研究者也检查整体模型。R平方衡量模型拟合程度。R平方高表示模型解释力强。R平方低表示模型解释力弱。
现实问题更复杂。经济变量相互影响。比如教育影响工资。工资也影响教育选择。这导致内生性问题。内生性问题使估计不准。研究者需要工具变量。工具变量需要满足条件。工具变量影响内生变量。工具变量不影响被解释变量除了通过内生变量。研究者找到合适工具变量。工具变量法解决内生性问题。工具变量法需要两阶段回归。第一阶段回归内生变量对工具变量。第二阶段回归被解释变量对预测值。工具变量法提供一致估计。
另一种常见问题是遗漏变量。遗漏变量导致偏误。比如研究教育回报。能力影响工资。能力也影响教育。如果数据没有能力信息。教育系数包含能力效应。教育回报估计偏高。研究者想办法控制变量。面板数据有帮助。面板数据可以固定个体效应。个体效应包括不变特征比如能力。固定效应模型消除个体效应。固定效应模型使用个体内部变化。固定效应模型解决部分遗漏变量问题。
模型需要诊断检验。研究者检查残差。残差是实际值减预测值。残差应该随机分布。残差不应该有模式。如果残差有模式模型可能错误。研究者检验异方差。异方差指方差变化。异方差不影响系数估计。异方差影响标准误估计。异方差时标准误需要调整。怀特标准误处理异方差。研究者检验多重共线性。多重共线性指解释变量高度相关。多重共线性使标准误变大。多重共线性降低估计精度。研究者检查方差膨胀因子。方差膨胀因子大表示多重共线性严重。
时间序列数据有特别问题。时间序列可能非平稳。非平稳序列有趋势。趋势导致伪回归。伪回归显示有关系实际没有。研究者检验单位根。单位根检验判断序列是否平稳。如果不平稳需要差分。差分后序列可能平稳。研究者也检查自相关。自相关指残差相关。自相关时标准误需要调整。纽西-韦斯特标准误处理自相关。
研究者关心因果识别。相关不是因果。两个变量一起变化可能因为共同原因。因果识别需要严格设计。自然实验提供机会。自然实验是外部事件。外部事件像随机实验。比如政策变化影响部分人。政策变化类似随机分配。双重差分法利用自然实验。双重差分法比较处理组对照组。双重差分法比较政策前后。双重差分法估计政策效应。断点回归设计是另一种方法。断点回归利用阈值。阈值两侧个体相似。阈值两侧结果差异归因于处理。断点回归设计接近随机实验。
研究者进行稳健性检验。稳健性检验检查结果是否可靠。研究者更换变量度量。比如用不同指标衡量同一概念。研究者增加控制变量。研究者改变样本范围。研究者使用不同估计方法。如果结果基本不变结果稳健。如果结果变化大结果可能脆弱。
研究者报告结果。表格展示系数估计。表格包括标准误和显著性星号。星号表示显著性水平。一颗星表示百分之五显著。两颗星表示百分之一显著。三颗星表示千分之一显著。表格也展示样本数量。表格也展示R平方。文字解释结果大小。文字解释经济意义。文字讨论可能问题。文字提出政策建议。
计量经济学是工具。工具帮助理解经济世界。数据是基础。模型是桥梁。估计是手段。检验是保障。研究者保持谨慎。经济关系复杂。数据有限。方法有限。研究者不断改进。新数据出现。新方法发展。计量经济学持续进步。