计量经济学(大二下)期末复习资料
整理来源:课堂课件(第1/2/3/4/5/6/8/11/12章)、备忘录笔记、学习通作业汇总、课堂录音转写(W15最后理论课)、爵士瓜速通笔记、课本目录 教材:庞皓《计量经济学》(教材章节与课件对应) 授课重点:以课件与老师 W15 划重点为准
考试性质:闭卷笔试,可带计算器,考试时间 120 分钟(1 小时后可交卷),使用答题纸作答;卷面分须 ≥ 50 分。
一、考试题型与分值
| 题型 | 题量 | 分值 | 备注 |
|---|---|---|---|
| 名词解释 | 5题 | 10分(5×2) | 概念类,答准定义要点 |
| 单选题 | 15题 | 15分(15×1) | |
| 多选题 | 10题 | 20分(10×2) | 至少 2 个正确选项;少选得 1 分,多选/错选不得分 |
| 判断题 | 10题 | 10分(10×1) | |
| 简答题 | 4题 | 20分(4×5) | 答要点,分条作答 |
| 计算分析题 | 3题 | 25分(合计) | 需写完整过程:公式 + 中间步骤 + 结论;可带计算器 |
成绩构成:平时成绩 20%(含课堂表现、作业等)+ 课程论文 30% + 期末 50%
计算器使用说明:考试允许携带计算器,用于计算题中的均值、平方和、标准差、t 值、F 值、DW 值等数值运算;计算过程仍需书面展示。
二、目录(按教材章节,共 9 章在考范围)
| 章 | 章节名称 | 教材页码 | 考点类型侧重 |
|---|---|---|---|
| 第一章 | 导论 | p1-14 | 名词解释、选择、判断、简答 |
| 第二章 | 简单线性回归模型 | p15-63 | 名词解释、选择、判断、简答、计算 |
| 第三章 | 多元线性回归模型 | p64-92 | 选择、判断、简答、计算(F检验) |
| 第四章 | 多重共线性 | p93-114 | 名词解释、选择、判断、简答 |
| 第五章 | 异方差性 | p115-136 | 名词解释、选择、判断、简答 |
| 第六章 | 自相关 | p137-167 | 名词解释、选择、判断、简答、计算(DW/C-O) |
| 第八章 | 虚拟变量回归 | p193-220 | 名词解释、选择、判断、简答 |
| 第十一章 | 联立方程组模型 | p264-292 | 名词解释、选择、判断、简答 |
| 第十二章 | 实证项目的计量经济研究 | p293-305 | 了解为主(课程论文相关) |
不在考试范围:第七章(分布滞后模型与自回归模型)、第九章(设定误差与测量误差)、第十章(时间序列计量经济模型)——按教学进度未讲授。
三、各章考点总表(知识要点速览)
先按章节快速过一遍要点(红色标注为 W15 老师划重点),详细推导与例题见「第二部分 正文」。
第一章 导论
- 考点1.1 计量经济学的定义与学科性质(★p3,名解/简答)
- 计量经济学 = 经济理论 + 统计学 + 数学 三者的交叉学科,是实证经济学的核心。
- 它以经济理论为前提,用数学和统计方法,根据实际观测数据研究经济现象的数量关系。
- 考点1.2 计量经济学的研究步骤(★p5,简答高频) 1. 确定模型所包含的变量(依据经济理论) 2. 确定模型的数学形式(函数形式) 3. 收集样本数据并估计模型参数 4. 模型的检验(经济意义检验、统计检验、计量经济学检验、模型预测检验) 5. 模型的应用(结构分析、经济预测、政策评价、检验与发展经济理论)
- 考点1.3 计量经济模型的应用(p8)
- 结构分析(弹性、乘数等)、经济预测、政策评价、检验与发展经济理论。
- 考点1.4 变量与参数(★p10)
- 解释变量(自变量)与被解释变量(因变量);
- 内生变量与外生变量;
- 参数:模型中表示变量之间数量关系的常数(如回归系数)。
- 考点1.5 数据的四种类型(★p11,名解) 1. 截面数据:同一时点不同主体的数据(如某年各省 GDP); 2. 时间序列数据:同一主体不同时点的数据(如某国历年 GDP); 3. 面板数据(平行数据):截面数据 + 时间序列数据的结合; 4. 虚拟变量数据:取 0/1 的定性数据。
- 题型:名词解释、单选、判断、简答
第二章 简单线性回归模型
- 考点2.1 回归分析的含义:研究一个变量(被解释变量)对另一个或多个变量(解释变量)的统计依赖关系的方法,侧重因果关系。
- 考点2.2 总体回归函数 PRF(★p21,名解)
- $E(Y|X_i) = \beta_1 + \beta_2 X_i$,即给定 X 条件下 Y 的条件期望。
- 总体回归线 = 各 X 对应 Y 条件均值点的连线。
- 考点2.3 样本回归函数 SRF(★p23)
- $\hat Y_i = \hat\beta_1 + \hat\beta_2 X_i$,由样本估计得到的回归直线。
- 考点2.4 PRF 与 SRF 的区别(★p25,简答高频) 1. PRF 是未知的总体关系,SRF 是可估的样本关系; 2. PRF 反映总体条件均值,SRF 是它的估计; 3. 样本不同 SRF 不同,PRF 唯一; 4. SRF 随样本变化,是 PRF 的近似;残差 e 是总体扰动项 u 的估计。
- 考点2.5 随机扰动项(误差项)u:除 X 以外影响 Y 的所有因素的综合;引入后模型为 $Y_i = \beta_1 + \beta_2 X_i + u_i$。
- 考点2.6 普通最小二乘法 OLS(★p27,名解)
- 使残差平方和最小:$\min \sum e_i^2 = \sum (Y_i - \hat\beta_1 - \hat\beta_2 X_i)^2$;
- 求解得到 $\hat\beta_1、\hat\beta_2$(公式见正文)。
- 考点2.7 OLS 估计量的统计性质:线性、无偏性、有效性(最小方差)——BLUE,由高斯—马尔可夫定理保证(在古典假定下)。
- 考点2.8 拟合优度——可决系数 R²(★p36,计算题)
- $TSS = ESS + RSS$;$R^2 = ESS/TSS = 1 - RSS/TSS$,取值 [0,1];
- 与相关系数 r 关系:$r = \pm \sqrt{R^2}$。
- 考点2.9 回归系数显著性检验——t 检验(★p40,计算题)
- 原假设 $H_0: \beta_2 = 0$;$t = \hat\beta_2 / SE(\hat\beta_2)$;
- $|t| > t_{\alpha/2}(n-2)$ 拒绝原假设,X 对 Y 影响显著。
- 考点2.10 回归模型的预测:点预测($\hat Y_0$)与区间预测(均值/个值预测的置信区间)。
- 考点2.11 参数的经济意义:$\hat\beta_2$ 表示 X 每变动 1 个单位,Y 平均变动 $\hat\beta_2$ 个单位(会分析结果的经济含义)。
- 题型:名词解释、单选、判断、简答、计算分析
第三章 多元线性回归模型
- 考点3.1 多元回归模型的一般形式:$Y_i = \beta_1 + \beta_2 X_{2i} + \beta_3 X_{3i} + \cdots + \beta_k X_{ki} + u_i$。
- 考点3.2 偏回归系数:$\beta_j$ 表示在其他解释变量保持不变时,$X_j$ 每变动 1 个单位对 Y 平均变动的影响(控制变量思想)。
- 考点3.3 古典假定(多元)(★p66,简答高频)
- 在一元 5 条假定基础上增加第 6 条:解释变量之间不存在多重共线性。
- 即:各解释变量的观测值之间不存在严格的线性关系。
- 考点3.4 多元 OLS 估计:同样使 $\sum e_i^2$ 最小,得参数估计(矩阵形式 $Y = X\beta + U$)。
- 考点3.5 多重可决系数 R² 与调整的 R²(自由度修正)
- $\bar R^2 = 1 - (1-R^2)\dfrac{n-1}{n-k}$;调整 R² 可比较含不同解释变量个数的模型。
- 考点3.6 方程总体显著性检验——F 检验(★p74,计算题)
- $H_0: \beta_2 = \beta_3 = \cdots = \beta_k = 0$;
- $F = \dfrac{ESS/(k-1)}{RSS/(n-k)} = \dfrac{R^2/(k-1)}{(1-R^2)/(n-k)}$;
- $F > F_\alpha(k-1, n-k)$ 拒绝原假设,方程总体显著。
- 考点3.7 F 检验与 t 检验的区别与联系(★p75,简答)
- F 检验是整体(联合)显著性检验,检验所有解释变量对被解释变量的共同影响;
- t 检验是单个参数显著性检验;
- 一元回归中二者等价:$t^2 = F$。
- 考点3.8 自由度(老师强调口径):总 TSS 自由度 n-1;回归 ESS 自由度 k-1;残差 RSS 自由度 n-k。
- 考点3.9 σ² 的无偏估计:$\hat\sigma^2 = \dfrac{\sum e_i^2}{n-k}$。
- 题型:选择、判断、简答、计算分析
第四章 多重共线性
- 考点4.1 多重共线性的定义(★p94,名解)
- 解释变量之间存在线性相关关系(完全/不完全)。
- 完全多重共线性:某个解释变量是其余解释变量的精确线性组合,则 OLS 无法估计(无唯一解)。
- 不完全多重共线性:近似线性关系,OLS 仍可估计但性质变差。
- 考点4.2 多重共线性产生的后果(★p95-97,简答)
- 完全多重共线性:参数无法估计(矩阵不可逆),无法得到唯一估计量。
- 不完全多重共线性:
- 参数估计量仍无偏、一致,但方差增大;
- t 检验失效(可能不显著);
- 参数估计值不稳定、对样本变化敏感;
- 可决系数 R² 与 F 值可能很高,但个别参数 t 检验不显著(经典症状);
- 参数估计量符号可能与经济意义不符。
- 考点4.3 多重共线性的检验(★p99)
- 简单相关系数检验法:|r| 接近 1(经验上 >0.8)→ 严重多重共线性;
- 方差膨胀因子 VIF:$VIF_j = \dfrac{1}{1 - R_j^2}$,VIF ≥ 10 → 严重多重共线性;
- 经验判断:R²、F 高但 t 不显著;符号与预期相反;轻微改变数据估计结果变化大。
- 考点4.4 多重共线性的补救措施(★p100,简答) 1. 剔除变量(删去引起共线性的变量); 2. 增大样本容量; 3. 对模型进行对数变换(降低变量相关程度); 4. 截面数据与时间序列数据并用; 5. 逐步回归法(逐个引入变量,保留显著的); 6. 利用先验信息、差分法等。
- 题型:名词解释、单选、判断、简答
第五章 异方差性
- 考点5.1 异方差性的定义(★p116,名解)
- 随机误差项 u 的方差不再是一个常数,而是随解释变量 X 的变化而变化:$Var(u_i) = \sigma_i^2$。
- 同方差:$Var(u_i) = \sigma^2$(常数)。
- 考点5.2 异方差产生的原因:模型设定误差(遗漏重要变量、函数形式错误)、样本数据的观测误差、截面数据中个体规模差异大(如不同规模企业的利润)等。
- 考点5.3 异方差的后果(★p117,简答) 1. 参数估计量仍无偏、一致,但不再有效(方差不是最小); 2. 参数估计量方差估计有偏(通常被低估),使 t 检验、F 检验失效; 3. 预测精度下降,置信区间不可靠。
- 考点5.4 异方差的检验(★p118)
- 图示检验法:残差散点图(随 X 增大离散程度变化)。
- GQ 检验(戈德菲尔德—匡特检验):基本思想——把样本按 X 排序后分成两段,比较两段残差平方和构造 F 统计量;原假设为同方差。
- White 检验:基本思想——用残差平方对解释变量、解释变量的平方及交叉项作辅助回归,构造 $nR^2$,服从卡方分布,$nR^2$ 大则存在异方差。
- (补充了解:Glejser 检验、ARCH 检验)
- 考点5.5 异方差的补救(★p125)
- 加权最小二乘法 WLS:基本思路——对方差小的观测赋予较大权重,对方差大的观测赋予较小权重,消除异方差影响。权重取 $1/\sigma_i$,即把模型各项除以标准差后再做 OLS。
- 模型变换法(已知异方差形式时)、对数变换法(减弱异方差)。
- 题型:名词解释、单选、判断、简答
第六章 自相关
- 考点6.1 自相关的定义(★p138,名解)
- 随机误差项 u 的各期取值之间存在相关(不同期扰动项相关),最常见为一阶自回归 $u_t = \rho u_{t-1} + v_t$。
- 考点6.2 自相关产生的原因:经济变量本身的惯性(如 GDP)、模型设定遗漏了滞后变量、数据处理(插值/平滑)等。
- 考点6.3 自相关的后果(★p140,简答) 1. 参数估计量仍无偏、一致,但不再有效; 2. 严重低估参数估计量的方差(低估真实方差); 3. t 检验、F 检验失效,R² 检验不可靠; 4. 预测精度下降、置信区间不可靠。
- 考点6.4 自相关的检验(★p143-144)
- 图示检验法(e_t 与 t 散点图、e_t 与 e_{t-1} 散点图);
- DW 检验(德宾—沃森检验)(★重点):
- 统计量 $DW = \dfrac{\sum_{t=2}^n (e_t - e_{t-1})^2}{\sum_{t=1}^n e_t^2} \approx 2(1-\rho)$,取值范围 [0,4];
- 决策准则:查表得 $d_L$、$d_U$(样本量 n 与解释变量个数 k')
- $0 \le DW \le d_L$:存在正自相关;
- $4-d_L \le DW \le 4$:存在负自相关;
- $d_U \le DW \le 4-d_U$:无自相关;
- $d_L < DW < d_U$ 或 $4-d_U < DW < 4-d_L$:不能确定。
- LM 检验(拉格朗日乘数检验,了解)。
- 考点6.5 自相关的补救(★p148)
- 广义差分法:$Y_t - \rho Y_{t-1} = \beta_1(1-\rho) + \beta_2(X_t - \rho X_{t-1}) + v_t$;
- 科克伦—奥克特(C-O)迭代法:先用 OLS 得残差 → 估计 $\rho$ → 广义差分 → 反复迭代直至收敛。
- 题型:名词解释、单选、判断、简答、计算分析
第八章 虚拟变量回归
- 考点8.1 虚拟变量的含义与作用(★p194,名解/简答)
- 用 0/1 表示定性因素(性别、季节、地区、政策实施前后等)的变量;
- 作用:把定性因素引入回归模型,反映其对被解释变量的影响。
- 考点8.2 虚拟变量陷阱(★p195,重点)
- 有 m 个类别,只引入 m-1 个虚拟变量;若引入 m 个,会与截距项产生完全多重共线性,模型无法估计(这就是"虚拟变量陷阱")。
- 考点8.3 虚拟变量的引入方式:
- 加法方式:改变截距(模型上下平移),用于区分不同类别截距不同。
- 乘法方式(★p199):改变斜率;主要作用(简答):
- 对两个回归模型进行比较(重合/平行/共点/完全不同回归);
- 分析交互效应(因素间的相互影响);
- 进行分段线性回归(分 k 段引入 k-1 个虚拟变量)。
- 考点8.4 二项选择模型(LPM 线性概率模型):Y 取 0/1,$Y_i = \beta_1 + \beta_2 X_i + u_i$,$E(Y|X) = P(Y=1|X)$ 为概率,需用 WLS 处理异方差。
- 题型:名词解释、单选、判断、简答
第十一章 联立方程组模型
- 考点11.1 联立方程组模型的特点(★p265,名解/判断)
- 模型中出现互为因果:某变量在一个方程中是被解释变量,在另一方程中是解释变量。
- 变量分类:
- 内生变量:由模型系统内决定(求解结果);
- 外生变量:由模型外部给定(非随机、先决);
- 前定变量 = 外生变量 + 滞后内生变量。
- 解释变量既可以是内生变量,也可以是外生变量(★重点)。
- 考点11.2 三种结构形式:
- 结构型模型:每个方程含内生变量与前定变量,含参数的经济意义,$BY + \Gamma X = U$;
- 简化型模型:把每个内生变量表示为前定变量与随机项的函数,$Y = \Pi X + V$;
- 递归型模型:变量按顺序单向决定,可逐方程用 OLS 估计。
- 考点11.3 模型的识别:
- 不可识别 / 恰好识别 / 过度识别;
- 阶条件(必要条件):$(M+K) - (m+k) = M-1$ 恰好识别;$>$ 过度识别;$<$ 不可识别;
- 秩条件(充分条件,了解)。
- 考点11.4 估计方法:
- 递归型:OLS;
- 恰好识别:间接最小二乘法 ILS;
- 过度识别:二阶段最小二乘法 TSLS/2SLS(用工具变量替代内生解释变量)。
- 题型:名词解释、单选、判断、简答
第十二章 实证项目的计量经济研究(课程论文)
- 考点12.1 实证研究的一般步骤: 1. 选题(研究问题、理论依据、数据可得性); 2. 模型设定与数据处理(变量选择、数据收集、指标口径); 3. 计量经济分析(估计、检验、诊断、修正); 4. 结论与经济解释。
- 考点12.2 与课程论文相关:期末 30% 为课程论文,需按"选题—数据—模型—分析—结论"完整流程完成一篇实证研究。
- 题型:了解为主(一般不单独出题)
第二部分 正文:知识点详解(含公式、图表、例题)
本部分按教材章节顺序,将全部考点展开讲解:先给定义与公式,再给关键图表与例题,最后给"高频提醒"。公式中的变量含义统一见各章小节。
第一章 导论
1.1 什么是计量经济学(★p3)
计量经济学(Econometrics)是经济理论、统计学与数学相结合的交叉学科,用数学和统计方法,根据实际观测数据来研究经济现象的数量关系,验证与发展经济理论。
- 三要素:经济理论(前提)+ 统计方法(工具)+ 实际数据(依据)。
- 与数理经济学的区别:数理经济学用数学形式表述经济理论(给定参数),计量经济学侧重于根据数据估计和检验这些参数。
- 与统计学(数理统计)的区别:数理统计以一般变量为对象,计量经济学以经济变量为对象,强调经济意义。
1.2 计量经济学的研究步骤(★p5,简答高频)
- 确定模型所包含的变量:依据经济理论,确定被解释变量与解释变量;
- 确定模型的数学形式:确定变量之间的函数关系(线性或非线性);
- 收集样本数据并估计参数:收集合适的样本,用 OLS 等方法估计模型参数;
- 模型的检验: - 经济意义检验:参数符号与大小是否符合经济理论; - 统计检验:拟合优度 R²、t 检验、F 检验; - 计量经济学检验:多重共线性、异方差性、自相关等; - 模型预测检验:用样本外数据检验模型预测能力;
- 模型的应用:结构分析、经济预测、政策评价、检验与发展经济理论。
1.3 变量的分类(★p10)
| 分类方式 | 类型 | 含义 | 举例 |
|---|---|---|---|
| 因果关系 | 被解释变量(因变量 Y) | 被研究、被解释的变量 | 消费支出 |
| 解释变量(自变量 X) | 用于解释 Y 的变量 | 收入、价格 | |
| 模型内/外 | 内生变量 | 由模型系统内决定 | 均衡价格、均衡产量 |
| 外生变量 | 由模型外部给定 | 政策变量、天气 |
1.4 数据的四种类型(★p11,名词解释)
- 截面数据(Cross-section Data):同一时点上,不同总体单位的观测值所组成的数据。例:某年各省(市)的 GDP、消费。
- 时间序列数据(Time Series Data):同一总体单位在不同时点上的观测值所组成的数据。例:中国 1990—2020 年历年 GDP。
- 面板数据 / 平行数据(Panel Data):截面数据与时间序列数据结合的数据(多个个体 × 多个时期)。例:30 个省 × 20 年 GDP。
- 虚拟变量数据(Dummy Variable Data):取 0 或 1 的定性数据。例:性别(男=1,女=0)、季节、是否实施某政策。
高频判断:截面数据反映"同时点不同主体"的差异;时间序列反映"同主体不同时点"的变动;二者不要混淆。
1.5 本章小结
- 本章为概念章,重点记住:定义三要素、研究步骤五步、变量四分类、数据四类型。
- 老师 W15 明确:p3 定义、p5 研究步骤(简答)、p10 变量、p11 数据为考点。
第二章 简单线性回归模型
2.1 回归分析的基本概念
回归分析:研究一个被解释变量 Y 对一个或多个解释变量 X 的统计依赖关系的方法。
- 相关分析 vs 回归分析:相关分析只测度变量间关系的方向和强度(对称、不分因果);回归分析则假定因果关系(X 影响 Y),测度 X 变动对 Y 的影响程度。
总体回归函数(PRF,Population Regression Function)(★p21,名词解释)
$$E(Y|X_i) = \beta_1 + \beta_2 X_i$$
回归线示意图(观测点围绕总体回归线波动):
Y │ · · · · ← 观测点(Y实际值围绕回归线上下波动)
│ · · ·
│ · ·
│ ╱ E(Y|X) = β₁ + β₂X ← 总体回归线(条件均值连线)
│ ╱ · ·
│· · ·
└───────────────→ X
- 观测点 Y 分布在总体回归线两侧,其偏离程度即随机扰动项 $u_i$;
- 含义:给定 X_i 条件下 Y 的条件期望(条件均值);
- 总体回归线:各 X 值对应的 Y 条件均值的连线;
- $\beta_1$(截距)、$\beta_2$(斜率,回归系数)为总体参数(未知常数)。
样本回归函数(SRF,Sample Regression Function)(★p23)
$$\hat Y_i = \hat\beta_1 + \hat\beta_2 X_i$$
- 由样本数据估计得到,$\hat\beta_1、\hat\beta_2$ 是 $\beta_1、\beta_2$ 的估计量;
- 残差 $e_i = Y_i - \hat Y_i$,是总体随机扰动项 $u_i$ 的估计。
PRF 与 SRF 的区别(★p25,简答)
| 比较项 | 总体回归函数 PRF | 样本回归函数 SRF |
|---|---|---|
| 是否已知 | 未知(理论存在) | 可由样本估计得到 |
| 形式 | $E(Y\mid X_i)=\beta_1+\beta_2 X_i$ | $\hat Y_i=\hat\beta_1+\hat\beta_2 X_i$ |
| 个数 | 唯一 | 随样本不同而不同 |
| 扰动项 | 随机扰动项 $u_i$ | 残差 $e_i$ |
| 关系 | SRF 是 PRF 的估计/近似 | 样本无限增大时趋于 PRF |
2.2 随机扰动项 u 及其古典假定
随机扰动项 $u_i$:除解释变量 X 之外,影响被解释变量 Y 的所有其他因素的综合反映。引入后:
$$Y_i = \beta_1 + \beta_2 X_i + u_i$$
古典(经典)假定条件(一元回归):
- 零均值假定:$E(u_i) = 0$;
- 同方差假定:$Var(u_i) = E(u_i^2) = \sigma^2$(常数);
- 无自相关假定:$Cov(u_i, u_j) = 0,\ (i \ne j)$;
- 随机扰动项与解释变量不相关:$Cov(X_i, u_i) = 0$;
- 正态性假定:$u_i \sim N(0, \sigma^2)$。
速记口诀:随机扰动项最好"没有",有也给我 iid(独立同分布)——零均值、同方差、互不相关、与 X 不相关,且服从正态分布。
2.3 普通最小二乘法(OLS)(★p27,名词解释)
普通最小二乘法:选择参数 $\hat\beta_1、\hat\beta_2$,使残差平方和达到最小的参数估计方法。
$$\min_{\hat\beta_1,\hat\beta_2} \sum e_i^2 = \min \sum (Y_i - \hat\beta_1 - \hat\beta_2 X_i)^2$$
求解结果(OLS 估计量公式,必背):
$$\hat\beta_2 = \frac{\sum (X_i - \bar X)(Y_i - \bar Y)}{\sum (X_i - \bar X)^2} = \frac{\sum x_i y_i}{\sum x_i^2}$$
$$\hat\beta_1 = \bar Y - \hat\beta_2 \bar X$$
其中 $x_i = X_i - \bar X$,$y_i = Y_i - \bar Y$ 为离差形式。
OLS 估计量的性质: - 线性:$\hat\beta$ 是被解释变量 Y 的线性组合; - 无偏性:$E(\hat\beta) = \beta$; - 有效性(最小方差):在所有线性无偏估计量中方差最小。 - 三者合称 BLUE(最佳线性无偏估计量),由高斯—马尔可夫定理保证(在古典假定下成立)。
2.4 拟合优度检验——可决系数 R²(★p36,计算题)
总离差平方和分解:
$$TSS = ESS + RSS$$
- TSS(总离差平方和) $= \sum (Y_i - \bar Y)^2$,反映 Y 的总变动;
- ESS(回归/解释平方和) $= \sum (\hat Y_i - \bar Y)^2$,反映回归线解释的变动;
- RSS(残差平方和) $= \sum e_i^2 = \sum (Y_i - \hat Y_i)^2$,反映未被解释的变动。
可决系数:
$$R^2 = \frac{ESS}{TSS} = 1 - \frac{RSS}{TSS}$$
- 取值 $0 \le R^2 \le 1$;$R^2$ 越接近 1,模型拟合越好;
- $R^2 = 1$:完全拟合(残差为 0);$R^2 = 0$:完全不能解释。
与相关系数 r 的关系:$r = \pm \sqrt{R^2}$,r 的符号与斜率 $\hat\beta_2$ 一致。
计算题套路:给 TSS、RSS(或 ESS),直接代入 $R^2 = 1 - RSS/TSS$ 即可;若给相关系数 r,则 $R^2 = r^2$。
2.5 回归系数的显著性检验——t 检验(★p40,计算题)
目的:检验解释变量 X 对被解释变量 Y 的影响是否显著($\beta_2$ 是否显著不为 0)。
检验步骤: 1. 提出假设:$H_0: \beta_2 = 0$;$H_1: \beta_2 \ne 0$; 2. 构造 t 统计量:$t = \dfrac{\hat\beta_2}{SE(\hat\beta_2)} \sim t(n-2)$; 3. 查临界值 $t_{\alpha/2}(n-2)$(α 通常取 0.05); 4. 判断:若 $|t| > t_{\alpha/2}(n-2)$,拒绝 H0,X 对 Y 影响显著;否则不显著。
注意: - 也可用 P 值法:P < α → 拒绝 H0(显著); - 一元回归中 t 检验自由度 $n-2$(估计了 2 个参数); - $\hat\sigma^2 = \dfrac{\sum e_i^2}{n-2}$,$SE(\hat\beta_2) = \sqrt{\dfrac{\hat\sigma^2}{\sum x_i^2}}$。
计算题套路:给 $\hat\beta_2$ 与标准差 → 算 $|t|$ → 与临界值比较 → 下结论。
2.6 回归系数的区间估计(了解)
在 $(1-\alpha)$ 置信水平下,$\beta_2$ 的置信区间:
$$\hat\beta_2 \pm t_{\alpha/2}(n-2) \cdot SE(\hat\beta_2)$$
2.7 回归模型的预测(★了解)
- 点预测:$\hat Y_0 = \hat\beta_1 + \hat\beta_2 X_0$;
- 区间预测:均值预测 $E(Y|X_0)$ 与个值预测 $Y_0$ 的置信区间;个值预测区间比均值预测区间更宽。
- 预测区间宽度随 $X_0$ 远离 $\bar X$ 而增大。
2.8 参数经济意义的分析(★会写)
- $\hat\beta_2$ 的经济含义:在其他条件不变时,X 每增加 1 个单位,Y 平均增加(或减少)$\hat\beta_2$ 个单位。
- 例:$\hat C = 300 + 0.8\, Y$(C 消费,Y 收入)→ 收入每增加 1 元,消费平均增加 0.8 元(边际消费倾向 MPC = 0.8)。
2.9 本章小结
- 核心公式:$\hat\beta_2 = \dfrac{\sum x_i y_i}{\sum x_i^2}$;$R^2 = 1 - RSS/TSS$;$t = \hat\beta_2/SE(\hat\beta_2)$。
- W15 明确:p21 PRF(名解)、p23 SRF、p25 区别(简答)、p27 OLS 定义(名解)、p36 可决系数(计算)、p40 t 检验(计算)。
第三章 多元线性回归模型
3.1 多元线性回归模型的一般形式(★)
$$Y_i = \beta_1 + \beta_2 X_{2i} + \beta_3 X_{3i} + \cdots + \beta_k X_{ki} + u_i,\quad i = 1,2,\dots,n$$
- 矩阵形式:$Y = X\beta + U$;
- 其中 X 矩阵每一行对应一个观测 i(第 1 列为常数 1 表示截距项),β 为 $k\times1$ 参数向量。
偏回归系数(★概念):$\beta_j$ 表示在其他解释变量保持不变(控制变量)时,$X_j$ 每变动 1 个单位对被解释变量 Y 平均变动的影响。这是多元回归区别于一元回归的关键概念。
3.2 多元线性回归模型的古典假定(★p66,简答)
在一元回归五条假定的基础上,增加第六条:
- 零均值:$E(u_i)=0$;
- 同方差:$Var(u_i)=\sigma^2$;
- 无自相关:$Cov(u_i,u_j)=0$;
- 随机扰动项与解释变量不相关;
- 正态性:$u_i \sim N(0,\sigma^2)$;
- 解释变量之间不存在多重共线性:各解释变量的观测值之间不存在严格的线性关系(无完全共线性)。
记忆:多元 = 一元五条 + "无多重共线性"。
3.3 多元回归的参数估计(OLS)
- 同样使残差平方和 $\sum e_i^2$ 最小,得到参数估计量 $\hat\beta = (X'X)^{-1}X'Y$;
- 在古典假定下,OLS 估计量仍为 BLUE;
- 随机扰动项方差的估计:$\hat\sigma^2 = \dfrac{\sum e_i^2}{n-k}$(自由度 $n-k$)。
3.4 拟合优度:多重可决系数 R² 与调整的 R²(★)
多重可决系数(仍定义不变):
$$R^2 = \frac{ESS}{TSS} = 1 - \frac{RSS}{TSS}$$
问题:解释变量个数越多,$R^2$ 只增不减(至少不降),无法用于比较含不同解释变量个数的模型 → 引入调整的可决系数:
$$\bar R^2 = 1 - \frac{RSS/(n-k)}{TSS/(n-1)} = 1 - (1-R^2)\frac{n-1}{n-k}$$
- $\bar R^2$ 对解释变量个数作了"惩罚",可正可负(可小于 0);
- 比较不同模型(变量个数不同)时用 $\bar R^2$。
自由度(老师强调口径,必记):
| 平方和 | 自由度 |
|---|---|
| TSS 总离差平方和 | $n-1$ |
| ESS 回归平方和 | $k-1$ |
| RSS 残差平方和 | $n-k$ |
3.5 方程总体显著性检验——F 检验(★p74,计算题)
目的:检验所有解释变量对被解释变量的联合影响是否显著(整体是否显著)。
- 提出假设:$H_0: \beta_2 = \beta_3 = \cdots = \beta_k = 0$;$H_1:$ 至少有一个 $\beta_j \ne 0$;
- 构造 F 统计量:
$$F = \frac{ESS/(k-1)}{RSS/(n-k)} = \frac{R^2/(k-1)}{(1-R^2)/(n-k)} \sim F(k-1, n-k)$$
- 查临界值 $F_\alpha(k-1, n-k)$;
- 判断:若 $F > F_\alpha$,拒绝 H0,方程总体显著(所有解释变量联合对 Y 有显著影响);否则不显著。
计算题套路:给 ESS、RSS、n、k → 算 F → 与 $F_\alpha$ 比较 → 结论。若给 R² 也可直接用第二个公式。
3.6 F 检验与 t 检验的区别与联系(★p75,简答)
| 比较项 | F 检验 | t 检验 |
|---|---|---|
| 检验对象 | 所有解释变量的整体(联合)显著性 | 单个解释变量系数的显著性 |
| 原假设 | 所有 $\beta_j=0$($j\ge2$) | 单个 $\beta_j=0$ |
| 统计量 | $F \sim F(k-1,n-k)$ | $t \sim t(n-k)$ |
| 结论 | 拒绝→方程整体显著 | 拒绝→该变量显著 |
联系: - 一元回归($k=2$)时二者等价:$t^2 = F$; - 多元回归中 F 显著不代表每个 t 都显著(可能个别变量不显著,此时可能存在多重共线性等问题,需进一步检验)。
3.7 回归系数的 t 检验(多元)
- 对单个系数 $H_0: \beta_j = 0$;$t = \dfrac{\hat\beta_j}{SE(\hat\beta_j)} \sim t(n-k)$;
- $|t| > t_{\alpha/2}(n-k)$ → 拒绝 H0,该解释变量影响显著。
3.8 本章小结
- 核心:多元 OLS、偏回归系数、调整 R²、F 检验、t 检验、自由度口径。
- W15 明确:p66 古典假定(简答)、p74 F 检验(计算)、p75 F 与 t 关系(简答)。
第四章 多重共线性
4.1 什么是多重共线性(★p94,名词解释)
多重共线性(Multicollinearity):在多元线性回归模型中,解释变量之间存在较强的线性相关关系的现象。
- 完全多重共线性:某解释变量是其他解释变量的精确线性组合(如 $X_2 = 2X_3$)。此时 $X'X$ 不可逆,OLS 无法估计出唯一的参数。
- 不完全(近似)多重共线性:解释变量之间高度相关但非精确线性。此时 OLS 仍可估计,但估计性质变差。
4.2 多重共线性产生的后果(★p95-97,简答)
完全多重共线性: - 参数估计量不存在($X'X$ 奇异,无法求逆),无法估计。
不完全多重共线性(常见情形): 1. 参数估计量仍无偏且一致,但方差(标准差)增大; 2. t 检验失效:方差变大→t 值变小→原本显著的变量可能变得不显著(该显著的却不显著); 3. 参数估计值不稳定:对样本数据的变化非常敏感,增删观测值估计结果变化大; 4. 出现"R²、F 很高,但个别参数的 t 检验不显著"的经典症状; 5. 参数估计量的符号可能与经济理论不符(正号变负号等)。
一句话总结后果:无偏一致但方差大、t 检验失效、R²高而 t 不显著、估计不稳定。
4.3 多重共线性的检验(★p99)
- 简单相关系数检验法:计算解释变量两两之间的相关系数,若 |r| 接近 1(经验上 >0.8)→ 存在严重多重共线性。
- 方差膨胀因子法(VIF):
$$VIF_j = \frac{1}{1 - R_j^2}$$
其中 $R_j^2$ 是 $X_j$ 对其余解释变量回归的可决系数。$VIF_j \ge 10$ → 存在严重多重共线性。
- 经验判断法: - 重要解释变量的 t 检验不显著(但 R²、F 很高); - 参数符号与经济意义相反; - 轻微改变变量或观测值,估计结果变化很大; - 简单相关系数高。
4.4 多重共线性的补救措施(★p100,简答)
- 剔除引起共线性的变量(最常用);
- 增大样本容量(降低估计方差);
- 对模型作对数变换(降低变量之间的相关程度);
- 截面数据与时间序列数据并用;
- 逐步回归法:逐个引入变量,观察其对 R²、F、t 的影响,只保留显著且不引起共线性的变量;
- 其他:利用先验信息(已知参数关系)、差分法、主成分法等。
补充(逐步回归判断规则): - 引入新变量后 R²、F 改善,且该变量 t 显著 → 可保留; - 引入后 R²、F 无明显改善,t 也不受影响 → 该变量多余,剔除; - 引入后 R²、F 未改善且原变量 t 不再显著 → 出现多重共线性,需处理。
4.5 本章小结
- 定义(完全/不完全)、后果(5条)、检验(相关系数、VIF≥10、经验)、补救(剔除变量、增大样本、对数变换、并用数据、逐步回归)。
- W15 明确:p94/95/97 定义与后果、p99 检验 VIF、p100 补救。
第五章 异方差性
5.1 什么是异方差性(★p116,名词解释)
异方差性(Heteroscedasticity):随机误差项 $u_i$ 的方差不是常数,而是随解释变量(或观测个体)的变化而变化:
$$Var(u_i) = E(u_i^2) = \sigma_i^2 \ (\text{随 i 变化})$$
- 同方差:$Var(u_i) = \sigma^2$(常数);
- 异方差常见于截面数据(如不同规模企业、不同收入家庭的观测值离散程度不同)。
5.2 异方差产生的原因
- 模型设定误差:遗漏重要变量、函数形式错误;
- 样本数据的观测误差:测量误差随规模增大而增大;
- 截面数据中个体规模差异大(大企业与小企业的利润波动幅度差异大)等。
5.3 异方差的后果(★p117,简答)
- 参数估计量仍无偏且一致(不影响无偏性),但不再具有有效性(方差不是最小);
- 参数估计量的方差估计有偏(通常低估真实方差),导致: - t 检验失效(高估显著性); - F 检验失效; - 区间估计、假设检验结果不可靠;
- 预测精度下降,置信区间不可靠。
一句话:无偏一致、但方差估计有偏、检验失效、预测精度下降。
5.4 异方差的检验(★p118)
(1)图示检验法
- 绘制 $X$ 与 $Y$ 的散点图:随 X 增大,Y 的离散程度明显增大/减小 → 存在异方差;
- 绘制残差 $e$ 与 $X$(或 $\hat Y$)的散点图:残差"喇叭形"展开 → 异方差。
同方差 vs 异方差残差形态对比:
同方差(方差恒定) 异方差(方差随X增大而增大)
e│ · · · e│ · ·
│ · · · · │ · · ·
│ · · · │ · ·
│ · · · · │ · ·
└─────────────→ X └─────────────→ X
带状宽度基本不变 喇叭形张开(e的离散程度变大)
(2)GQ 检验(戈德菲尔德—匡特检验,★基本思想)
- 前提:大样本,除同方差外其他古典假定满足;
- 基本思想:把样本按解释变量 X 的大小排序,去掉中间 c 个观测(约 n/4~n/3),分为前段(小 X)与后段(大 X)两个子样本,分别做回归,得两段残差平方和 $RSS_1$、$RSS_2$,构造 F 统计量:
$$F = \frac{RSS_2/(n_2-k)}{RSS_1/(n_1-k)}$$
- 原假设:同方差;若 $F > F_\alpha$ → 拒绝 H0,存在异方差。
(3)White 检验(★基本思想)
- 前提:大样本,通常针对时间序列;
- 基本思想:用 OLS 求出残差 $e_i$,将 $e_i^2$ 作为被解释变量,对所有解释变量 X、X²、交叉项作辅助回归,得到辅助回归可决系数 $R^2$,构造统计量 $nR^2$($n$ 为样本容量),$nR^2 \sim \chi^2(自由度)$;若 $nR^2$ 大于临界值 → 拒绝同方差假设,存在异方差。
- 优点:不仅能判断有无异方差,还能大致判断哪个变量引起异方差。
(4)补充了解
- Glejser 检验:残差绝对值(或平方)对某个解释变量作回归;
- ARCH 检验:针对时间序列的条件异方差(残差平方对滞后残差平方回归)。
5.5 异方差的补救(★p125)
(1)加权最小二乘法(WLS,★基本思路)
- 核心思想:对方差小的观测赋予较大权重、方差大的观测赋予较小权重,使加权后的模型满足同方差,再作 OLS。
- 做法:把原模型各项除以标准差 $\sigma_i$(等价于权重 $w_i = 1/\sigma_i$):
$$\frac{Y_i}{\sigma_i} = \beta_1\frac{1}{\sigma_i} + \beta_2\frac{X_i}{\sigma_i} + \frac{u_i}{\sigma_i}$$
- 由于离散程度小的观测(方差小)在除以 $\sigma_i$ 后数值相对更大,从而"更受重视"。
- WLS 估计量去掉权数后即还原为原模型的最小二乘估计量。
(2)模型变换法
- 已知异方差形式 $\sigma_i^2 = \sigma^2 f(X_i)$ 时,将模型各项除以 $\sqrt{f(X_i)}$ 再回归。
(3)对数变换法
- 对变量取对数($\ln Y$、$\ln X$),可在一定程度上减弱异方差,但此时解释的是"弹性/增长率"关系而非原变量线性关系。
5.6 本章小结
- 定义、原因、后果、检验(图示/GQ/White)、补救(WLS 思路/变换/对数)。
- W15 明确:p116 定义原因、p117 后果、p118 检验(GQ、White 基本思想)、p125 WLS 基本思路。
第六章 自相关
6.1 什么是自相关(★p138,名词解释)
自相关(Autocorrelation):随机误差项 $u_t$ 的各期取值之间存在相关关系(当期扰动项受前期扰动项的影响),即 $Cov(u_t, u_s) \ne 0\ (t \ne s)$。
- 最常见形式——一阶自回归 AR(1):
$$u_t = \rho u_{t-1} + v_t$$
其中 $v_t$ 满足全部经典假定(零均值、同方差、无自相关),$\rho$ 为一阶自相关系数,$-1 \le \rho \le 1$: - $\rho = 0$:无自相关;$\rho > 0$:正自相关;$\rho < 0$:负自相关。 - 自相关常见于时间序列数据(经济变量的惯性:今年 GDP 受去年影响)。
6.2 自相关产生的原因
- 经济变量的惯性(如消费、GDP 的前后期关联);
- 模型设定误差:遗漏了重要的滞后变量;
- 数据处理(插值、平滑、季节调整)造成序列相关;
- 蛛网现象(供给对价格的滞后反应)等。
6.3 自相关的后果(★p140,简答)
- 参数估计量仍无偏且一致,但不再有效(方差不是最小);
- 严重低估参数估计量的方差(低估真实方差),使标准差偏小;
- 导致 t 检验失效(高估显著性)、F 检验与 R² 检验不可靠;
- 预测的置信区间不可靠、预测精度下降。
与异方差的后果对比记忆:都是"无偏一致但不有效、检验失效、预测精度下降";自相关还特别强调"严重低估方差"。
6.4 自相关的检验(★p143-144)
(1)图示检验法
- 绘制残差 $e_t$ 与时间 t 的散点图:连续几个正残差后连续几个负残差 → 正自相关;正负交替频繁 → 负自相关;
- 绘制 $e_t$ 与 $e_{t-1}$ 的散点图:点集中在第一、三象限 → 正自相关;第二、四象限 → 负自相关。
(2)DW 检验(德宾—沃森检验,★重点,考计算判断)
DW 统计量:
$$DW = \frac{\sum_{t=2}^{n}(e_t - e_{t-1})^2}{\sum_{t=1}^{n} e_t^2} \approx 2(1 - \rho)$$
- $DW$ 取值范围 $[0,4]$;$DW=2$ 时 $\rho=0$(无自相关);$DW<2$ 偏正自相关;$DW>2$ 偏负自相关。
DW 检验的前提条件: 1. $n > 15$; 2. 解释变量为非随机变量; 3. 随机误差项为一阶自回归形式; 4. 解释变量中不含被解释变量的滞后项 $Y_{t-1}$; 5. 模型含有截距项; 6. 样本数据无缺失。
判断准则:给定显著水平 α,按样本容量 n 与解释变量个数 k'(不含截距)查 DW 表得 $d_L$ 与 $d_U$:
| 条件 | 结论 |
|---|---|
| $0 \le DW \le d_L$ | 存在正自相关 |
| $d_L < DW < d_U$ | 不能确定 |
| $d_U \le DW \le 4 - d_U$ | 无自相关 |
| $4 - d_U < DW < 4 - d_L$ | 不能确定 |
| $4 - d_L \le DW \le 4$ | 存在负自相关 |
记忆口诀:和 d 沾 L → 正负自相关;只和 U 沾 → 无自相关;L、U 都沾 → 不确定。 即:$DW < d_L$ 正自相关;$DW > 4-d_L$ 负自相关;$d_U < DW < 4-d_U$ 无自相关;夹在 $d_L\sim d_U$ 或 $4-d_U\sim 4-d_L$ 之间不确定。
DW 检验决策区域示意图:
正自相关 不确定 无自相关 不确定 负自相关
|←──────→|←────→|←──────────→|←────→|←──────→|
0 d_L d_U 2 4-d_U 4-d_L 4 DW
(d_L、d_U 由样本容量 n 与解释变量个数 k' 查 DW 表获得)
(3)LM 检验(拉格朗日乘数检验,了解)
- 用残差 $e_t$ 对解释变量与 $u_t$ 的 p 阶滞后项作辅助回归,构造 $TR^2 \sim \chi^2(p)$,大则存在自相关。
6.5 自相关的补救(★p148)
(1)广义差分法
- 对 AR(1) 扰动 $u_t = \rho u_{t-1} + v_t$,作差分变换:
$$Y_t - \rho Y_{t-1} = \beta_1(1-\rho) + \beta_2(X_t - \rho X_{t-1}) + v_t$$
- 变换后扰动项 $v_t$ 满足经典假定,可用 OLS 估计。
(2)科克伦—奥克特(C-O)迭代法(★可能考计算/思路)
基本思路: 1. 用 OLS 估计原模型,得到残差 $e_t$; 2. 用残差对 $e_{t-1}$ 作回归(无截距),得到 $\rho$ 的估计 $\hat\rho = \dfrac{\sum e_t e_{t-1}}{\sum e_{t-1}^2}$; 3. 用 $\hat\rho$ 作广义差分,估计变换后的模型; 4. 用新模型再得残差,再估计 $\hat\rho$,反复迭代,直到 $\hat\rho$ 收敛(前后两次相差很小); 5. 还原原模型参数:$\beta_1 = \dfrac{b_1}{1-\hat\rho}$(b₁ 为差分方程截距)。
6.6 本章小结
- 定义(AR(1))、原因、后果(低估方差)、检验(图示/DW/LM)、补救(广义差分/C-O)。
- W15 明确:p138 定义原因后果、p144 DW 检验概念与判断准则、p148 C-O 迭代法。
第八章 虚拟变量回归
8.1 虚拟变量的含义与作用(★p194,名词解释/简答)
虚拟变量(Dummy Variable):取值为 0 或 1 的人工变量,用来表示定性因素(性别、季节、地区、学历、政策实施前后等)对被解释变量的影响。
$$D = \begin{cases} 1 & \text{具备某种属性/某时期} \\ 0 & \text{不具备某种属性/其他时期} \end{cases}$$
作用:把不能直接用数值度量的定性因素引入回归模型,使其对 Y 的影响得到定量估计。
8.2 虚拟变量陷阱(★p195,重点)
- 规则:一个定性变量若有 m 个类别(分类),只引入 m-1 个虚拟变量(选一个类别作为基准组/参照组,其虚拟变量全取 0)。
- 例:性别 2 类 → 只设 1 个 D(D=1 男,D=0 女);
- 例:一年四季 → 只设 3 个 D(春天、夏天、秋天,三个都取 0 即冬天)。
- 陷阱:若引入 m 个虚拟变量,则这些虚拟变量之和恒等于 1,与截距项(可视为恒为 1 的变量)产生完全多重共线性,导致模型无法估计。此即"虚拟变量陷阱"。
8.3 虚拟变量的引入方式
(1)加法方式引入(改变截距)
在模型中加入虚拟变量作为解释变量,只改变截距,使回归线整体上下平移。
例(比较男、女消费):
$$Y_i = \beta_1 + \beta_2 X_i + \beta_3 D_i + u_i,\quad D=\begin{cases}1 & 男\\0 & 女\end{cases}$$
- 女性(基准组):$E(Y) = \beta_1 + \beta_2 X$;
- 男性:$E(Y) = (\beta_1 + \beta_3) + \beta_2 X$;
- 检验 $\beta_3$ 是否显著 ≠0 → 判断男女截距是否有显著差异(若 $\beta_3$ 显著,男女平均消费水平有显著差异)。
(2)乘法方式引入(改变斜率,★p199)
将虚拟变量与某解释变量相乘引入,改变斜率,使回归线更陡或更缓。主要作用(简答):
- 比较两个回归模型(重合回归、平行回归、共点回归、完全不同回归);
- 分析交互效应:两定性变量(或定性×定量)之间的相互影响;
- 分段线性回归:变量在不同区间有不同的斜率,分 k 段引入 k-1 个虚拟变量。
若同时用加法与乘法引入,则可同时区分截距与斜率的差异(完整比较两个模型)。
8.4 二项选择模型(线性概率模型 LPM,了解)
- 被解释变量为 0/1 虚拟变量:$Y_i = \beta_1 + \beta_2 X_i + u_i$;
- $E(Y|X) = P(Y=1|X)$,即条件概率;
- 问题:LPM 存在异方差性(扰动项方差随 X 变化),需用 WLS(加权最小二乘法) 估计。
8.5 本章小结
- 含义作用、陷阱(m-1 规则)、加法(截距)、乘法(斜率,三作用)、LPM。
- W15 明确:p194 作用、p195 陷阱、p199 乘法引入的作用。
第十一章 联立方程组模型
11.1 联立方程组模型的基本概念(★p265)
联立方程组模型:由多个方程组成,模型中变量之间存在互为因果关系(某变量在一方程中是被解释变量,在另一方程中是解释变量)的模型。
变量分类(★重点): - 内生变量(Endogenous):由模型系统内部决定的变量(模型求解的结果); - 外生变量(Exogenous):由模型外部给定的变量(非随机、先决给定); - 前定变量(Predetermined) = 外生变量 + 滞后内生变量。
★ 关键结论:联立方程组中,解释变量既可以是内生变量,也可以是外生变量(老师 W15 明确考点)。
- 内生变量个数 = 方程个数 → 完备方程组。
11.2 联立方程组的三种结构形式
| 类型 | 特点 | 估计方法 |
|---|---|---|
| 结构型模型 | 每个方程都含内生变量与前定变量,参数有经济意义;$BY+\Gamma X=U$ | — |
| 简化型模型 | 把每个内生变量表示为前定变量与随机项的函数;$Y=\Pi X+V$ | OLS(对每个简化方程) |
| 递归型模型 | 变量按顺序单向决定(第1个 Y 只由 X 决定,第2个 Y 由第1个 Y 与 X 决定……),无互为因果 | OLS(逐方程) |
结构型参数与简化型参数的关系:$\Pi = -B^{-1}\Gamma$。
11.3 模型的识别(★)
问题:能否从简化型参数唯一地反解出结构型参数?
- 不可识别:结构参数无法由简化参数确定(信息不足);
- 恰好识别:结构参数可由简化参数唯一确定;
- 过度识别:结构参数可由简化参数确定,但有不止一种方式(约束过多)。
阶条件(必要条件): $$(M+K) - (m+k) = M-1 \Rightarrow \text{恰好识别}$$ $$(M+K) - (m+k) > M-1 \Rightarrow \text{过度识别}$$ $$(M+K) - (m+k) < M-1 \Rightarrow \text{不可识别}$$
其中 M、K 为整个方程组的内生变量数、前定变量数;m、k 为所考察方程含有的内生变量数、前定变量数。
秩条件(充分条件):从系数矩阵划去被考察方程的行后,其余方程中被排除变量的系数矩阵的秩 = M-1 → 可识别。
实际判断顺序:先用阶条件排除"不可识别";不是不可识别再用秩条件判断是否可识别;最后用阶条件确认"恰好"还是"过度"。
11.4 联立方程组的估计方法(★)
| 模型类型 | 估计方法 | 说明 |
|---|---|---|
| 递归型 | OLS | 逐方程直接用 OLS |
| 恰好识别 | 间接最小二乘法(ILS) | 先估简化型参数 $\Pi$,再由关系式反解结构参数 |
| 过度识别 | 二阶段最小二乘法(TSLS/2SLS) | 用工具变量替代内生解释变量,分两阶段估计 |
- 偏倚性:内生变量作解释变量时与随机误差项相关,直接 OLS 估计有偏且不一致,故一般不用 OLS 估计联立方程组中的内生解释变量(递归型除外)。
2SLS 思路: 1. 将结构型模型转化为简化型,用 OLS 估计出内生解释变量的拟合值 $\hat Y$; 2. 用 $\hat Y$ 替换原方程中的内生解释变量,再作 OLS。
11.5 本章小结
- 变量分类(内生/外生/前定)、三种形式、识别(阶/秩)、三种估计法。
- W15 明确:p265 联立方程中解释变量(内生、外生都可以)为重点。
第十二章 实证项目的计量经济研究(课程论文)
12.1 实证研究的步骤(了解)
- 选题:确定研究问题与经济理论依据,评估数据可得性;
- 模型设定:确定变量、函数形式(对数、线性等);
- 数据处理:收集、清洗、处理缺失值、单位与口径统一;
- 计量经济分析: - 参数估计(OLS); - 统计检验(R²、t、F); - 计量经济学检验:多重共线性、异方差、自相关诊断与修正;
- 结论与经济解释:参数的经济意义、政策建议、局限性。
12.2 与课程论文的对应
- 期末 30% 为课程论文,需按上述完整流程完成;
- 常见套路:建立一元/多元线性回归 → 报告回归结果(系数、R²、t/F 值)→ 诊断(VIF、DW、White/GQ)→ 修正(WLS、广义差分)→ 结论。
12.3 本章小结
- 本章偏"过程与方法",结合前面各章工具使用;W16 答疑课主要围绕课程论文展开。
第三部分 公式汇总表(必背)
一、简单线性回归(第二章)
| 名称 | 公式 |
|---|---|
| 总体回归函数 PRF | $E(Y\mid X_i)=\beta_1+\beta_2 X_i$ |
| 样本回归函数 SRF | $\hat Y_i=\hat\beta_1+\hat\beta_2 X_i$ |
| OLS 斜率估计量 | $\hat\beta_2=\dfrac{\sum x_i y_i}{\sum x_i^2}=\dfrac{\sum(X_i-\bar X)(Y_i-\bar Y)}{\sum(X_i-\bar X)^2}$ |
| OLS 截距估计量 | $\hat\beta_1=\bar Y-\hat\beta_2\bar X$ |
| 随机扰动项方差估计 | $\hat\sigma^2=\dfrac{\sum e_i^2}{n-2}$ |
| 总离差平方和分解 | $TSS=ESS+RSS$ |
| 可决系数 | $R^2=\dfrac{ESS}{TSS}=1-\dfrac{RSS}{TSS}$ |
| 相关系数与 R² | $r=\pm\sqrt{R^2}$ |
| t 统计量 | $t=\dfrac{\hat\beta_2}{SE(\hat\beta_2)}\sim t(n-2)$ |
二、多元线性回归(第三章)
| 名称 | 公式 |
|---|---|
| 多元模型 | $Y_i=\beta_1+\beta_2 X_{2i}+\cdots+\beta_k X_{ki}+u_i$ |
| 矩阵形式 | $Y=X\beta+U$,OLS:$\hat\beta=(X'X)^{-1}X'Y$ |
| 随机扰动项方差估计 | $\hat\sigma^2=\dfrac{\sum e_i^2}{n-k}$ |
| 多重可决系数 | $R^2=1-\dfrac{RSS}{TSS}$ |
| 调整的可决系数 | $\bar R^2=1-(1-R^2)\dfrac{n-1}{n-k}$ |
| F 统计量 | $F=\dfrac{ESS/(k-1)}{RSS/(n-k)}=\dfrac{R^2/(k-1)}{(1-R^2)/(n-k)}\sim F(k-1,n-k)$ |
| 自由度 | TSS:$n-1$;ESS:$k-1$;RSS:$n-k$ |
| t 统计量 | $t=\dfrac{\hat\beta_j}{SE(\hat\beta_j)}\sim t(n-k)$ |
三、多重共线性(第四章)
| 名称 | 公式 |
|---|---|
| 方差膨胀因子 | $VIF_j=\dfrac{1}{1-R_j^2}$,$VIF_j\ge10$ 严重共线性 |
| 简单相关系数 | $\lvert r\rvert>0.8$(经验)→ 严重共线性 |
四、异方差性(第五章)
| 名称 | 公式 |
|---|---|
| 异方差定义 | $Var(u_i)=\sigma_i^2$(随 i 变化) |
| GQ 检验 F 统计量 | $F=\dfrac{RSS_2/(n_2-k)}{RSS_1/(n_1-k)}$,$F>F_\alpha$ 有异方差 |
| White 检验统计量 | $nR^2\sim\chi^2(\text{辅助回归斜率个数})$,$nR^2>$ 临界值有异方差 |
| 加权最小二乘法 | 权重 $w_i=1/\sigma_i$,各项除以 $\sigma_i$ 后 OLS |
五、自相关(第六章)
| 名称 | 公式 |
|---|---|
| 一阶自回归 AR(1) | $u_t=\rho u_{t-1}+v_t$ |
| DW 统计量 | $DW=\dfrac{\sum_{t=2}^n(e_t-e_{t-1})^2}{\sum_{t=1}^n e_t^2}\approx2(1-\rho)$ |
| ρ 的估计(C-O 法) | $\hat\rho=\dfrac{\sum e_t e_{t-1}}{\sum e_{t-1}^2}$ |
| 广义差分模型 | $Y_t-\rho Y_{t-1}=\beta_1(1-\rho)+\beta_2(X_t-\rho X_{t-1})+v_t$ |
六、虚拟变量(第八章)
| 名称 | 公式 |
|---|---|
| 加法引入(截距) | $Y_i=\beta_1+\beta_2 X_i+\beta_3 D_i+u_i$ |
| 乘法引入(斜率) | $Y_i=\beta_1+\beta_2 X_i+\beta_3(D_i X_i)+u_i$ |
| 虚拟变量规则 | m 个类别只设 m-1 个虚拟变量(防陷阱) |
七、联立方程组(第十一章)
| 名称 | 公式 |
|---|---|
| 结构型 | $BY+\Gamma X=U$ |
| 简化型 | $Y=\Pi X+V$,$\Pi=-B^{-1}\Gamma$ |
| 阶条件 | $(M+K)-(m+k)=M-1$ 恰好;$>$ 过度;$<$ 不可识别 |
| 估计方法 | 递归→OLS;恰好→ILS;过度→TSLS |
第四部分 简答题高频考点汇总(重点背诵)
- 计量经济学的研究步骤(第一章 p5)
- 总体回归函数与样本回归函数的区别(第二章 p25)
- 随机扰动项的含义与古典假定(第二章 p27)
- 多元线性回归模型的古典假定(含"无多重共线性",第三章 p66)
- F 检验与 t 检验的区别与联系(第三章 p75)
- 多重共线性产生的后果(第四章 p95-97)
- 多重共线性的检验与补救措施(第四章 p99-100)
- 异方差性的后果(第五章 p117)
- 异方差性的检验方法(GQ、White 的基本思想)(第五章 p118)
- 加权最小二乘法的基本思路(第五章 p125)
- 自相关的后果(第六章 p140)
- DW 检验的概念与判断准则(第六章 p144)
- 自相关的补救方法(广义差分法、C-O 迭代法思路)(第六章 p148)
- 虚拟变量的作用(第八章 p194)
- 什么是虚拟变量陷阱,如何避免(第八章 p195)
- 乘法方式引入虚拟变量的主要作用(第八章 p199)
- 内生变量、外生变量、前定变量的含义(第十一章 p265)
- 联立方程组模型的三种结构形式及识别(第十一章 p271)
第五部分 计算分析题模板(考场可直接套用)
模板1:可决系数 R² 的计算(第二章 p36)
题干常给:$n$、$k$、$TSS$、$RSS$(或 $ESS$、或相关系数 r)
① 写出分解关系:TSS = ESS + RSS
② 代入:R² = ESS/TSS = 1 - RSS/TSS
③ 若给 r:R² = r²
④ 结论:R² = ___,越接近1拟合越好
模板2:回归系数 t 检验(第二章 p40)
题干常给:$\hat\beta_2$、$SE(\hat\beta_2)$、$n$、显著性水平 α
① H0: β2=0,H1: β2≠0
② t = β̂2 / SE(β̂2) = ___
③ 查临界值 t(α/2, n-2) = ___
④ 比较:|t| ___ t(α/2),拒绝/不拒绝 H0
⑤ 结论:X 对 Y 的影响显著/不显著
模板3:方程总体 F 检验(第三章 p74)
题干常给:$ESS$、$RSS$、$n$、$k$(或直接给 $R^2$、$n$、$k$)
① H0: β2=β3=…=βk=0
② F = [ESS/(k-1)] / [RSS/(n-k)] = ___ (或用 R² 公式)
③ 查临界值 Fα(k-1, n-k) = ___
④ 比较:F ___ Fα,拒绝/不拒绝 H0
⑤ 结论:方程总体显著/不显著
模板4:DW 检验判断自相关(第六章 p144)
题干常给:$DW$ 值、$n$、解释变量个数 k',并给 $d_L$、$d_U$(查表)
① 计算/给出 DW = ___
② 查表得 dL=___,dU=___
③ 对照区间:
0≤DW≤dL → 正自相关
dL<DW<dU → 不确定
dU≤DW≤4-dU → 无自相关
4-dU<DW<4-dL → 不确定
4-dL≤DW≤4 → 负自相关
④ 结论:___
模板5:C-O 迭代法求 ρ 与广义差分(第六章 p148)
① OLS 原模型得残差 e_t
② ρ̂ = Σe_t·e_{t-1} / Σe_{t-1}² = ___
③ 广义差分:Yt-ρ̂Yt-1 = β1(1-ρ̂) + β2(Xt-ρ̂Xt-1) + vt,OLS 估计
④ 反复迭代至 ρ̂ 收敛
⑤ 还原:β1 = b1/(1-ρ̂),β2 = b2
模板6:多重共线性 VIF 检验(第四章 p99)
① 对 Xj 关于其余解释变量回归,得 Rj²
② VIFj = 1/(1-Rj²) = ___
③ 判断:VIFj≥10 → 严重多重共线性
④ 结论 + 补救建议(剔除变量/增大样本/对数变换/逐步回归)
计算例题实战(含数值,考场照抄步骤)
例题1:可决系数 R² 计算(第二章) 已知:n=20,TSS=1000,RSS=120。 - ① TSS = ESS + RSS → ESS = 1000 - 120 = 880 - ② $R^2 = ESS/TSS = 880/1000 = 0.88$ - ③ 结论:R²=0.88,模型解释了 Y 变动的 88%,拟合较好。
例题2:回归系数 t 检验(第二章) 已知:$\hat\beta_2 = 0.5$,$SE(\hat\beta_2)=0.1$,n=20,α=0.05,临界值 $t_{0.025}(18)=2.101$。 - ① H0: β₂=0;H1: β₂≠0 - ② $t = 0.5/0.1 = 5.0$ - ③ $|t|=5.0 > t_{0.025}(18)=2.101$ → 拒绝 H0 - ④ 结论:X 对 Y 有显著影响。
例题3:方程总体 F 检验(第三章) 已知:n=20,k=3(1 截距 + 2 解释变量),ESS=800,RSS=200,α=0.05,$F_{0.05}(2,17)=3.59$。 - ① H0: β₂=β₃=0 - ② $F = \dfrac{ESS/(k-1)}{RSS/(n-k)} = \dfrac{800/2}{200/17} = 400/11.76 ≈ 34.0$ - ③ $F=34.0 > F_{0.05}(2,17)=3.59$ → 拒绝 H0 - ④ 结论:方程总体显著,两解释变量联合对 Y 有显著影响。
例题4:DW 检验判断自相关(第六章) 已知:n=20,解释变量个数 k'=1,查表得 dL=1.10,dU=1.54,算出 DW=0.80。 - ① 0 ≤ DW(=0.80) ≤ dL(=1.10) → 存在正自相关 - ② 处理建议:用广义差分法 / C-O 迭代法补救。 (若 DW=2.30,则 4-dU=2.46,dU=1.54 ≤ 2.30 ≤ 2.46 → 无自相关)
例题5:VIF 检验多重共线性(第四章) 已知:$X_2$ 对 $X_3$ 回归得 $R_2^2 = 0.85$。 - ① $VIF_2 = 1/(1-0.85) = 1/0.15 ≈ 6.67$ - ② 6.67 < 10 → 虽有较强共线性,但未达"严重"标准; 若 $R_2^2=0.92$,则 $VIF_2 = 12.5 ≥ 10$ → 严重多重共线性,需补救。
第六部分 重要缩写对照表
| 缩写 | 全称 | 含义 |
|---|---|---|
| PRF | Population Regression Function | 总体回归函数 |
| SRF | Sample Regression Function | 样本回归函数 |
| OLS | Ordinary Least Squares | 普通最小二乘法 |
| BLUE | Best Linear Unbiased Estimator | 最佳线性无偏估计量 |
| TSS | Total Sum of Squares | 总离差平方和 |
| ESS | Explained Sum of Squares | 回归(解释)平方和 |
| RSS | Residual Sum of Squares | 残差平方和 |
| R² | R-squared | 可决系数 |
| VIF | Variance Inflation Factor | 方差膨胀因子 |
| GQ | Goldfeld-Quandt | 戈德菲尔德—匡特检验 |
| WLS | Weighted Least Squares | 加权最小二乘法 |
| DW | Durbin-Watson | 德宾—沃森检验 |
| LM | Lagrange Multiplier | 拉格朗日乘数检验 |
| AR(1) | First-order Autoregression | 一阶自回归 |
| C-O | Cochrane-Orcutt | 科克伦—奥克特迭代法 |
| ILS | Indirect Least Squares | 间接最小二乘法 |
| TSLS/2SLS | Two-Stage Least Squares | 二阶段最小二乘法 |
| LPM | Linear Probability Model | 线性概率模型 |
| AIC | Akaike Info Criterion | 赤池信息准则 |
| SIC/BIC | Schwarz/Bayesian Info Criterion | 施瓦茨/贝叶斯信息准则 |
| iid | independent and identically distributed | 独立同分布 |
第七部分 复习策略与建议
- 先背概念:把各章名词解释、简答高频题先背熟(第四部分清单);
- 再练计算:套用第五部分模板,重点练 R²、t 检验、F 检验、DW 判断、VIF、C-O;
- 理解图表:回归线图、残差图(异方差/自相关诊断)、虚拟变量分段回归图;
- 回归软件结果解读:会看 OLS 输出表(系数、标准差、t 值、p 值、R²、F、DW),判断显著性与模型质量;
- 利用计算器:计算题中均值、平方和、t/F 值用计算器快速求,过程仍要写公式与代入步骤;
- 参数经济意义必写:计算分析题最后一步通常要求解释参数含义,别漏。
本复习资料基于课堂课件(第1/2/3/4/5/6/8/11/12章)、备忘录笔记、学习通作业、课堂录音转写(W15划重点)及课本目录综合整理。 建议复习顺序:先通读"考点总表"快速过框架 → 精读"正文"理解公式与检验步骤 → 背诵"简答高频" → 套用"计算模板"练题 → 考前过一遍"公式汇总表"与"缩写对照表"。