两个定量变量之间的图形表示
AP 统计学· 12 分钟阅读
1. 散点图构建核心规则★★☆☆☆⏱ 3 min
合格的散点图将解释变量(自变量)映射到水平x轴,将响应变量(因变量)映射到垂直y轴。每一个成对观测值都被绘制为独立的不相连点,除非专门针对时间序列数据追踪时间,否则不得用线连接连续的点。
散点图
成对数据点
一种二维可视化图形,展示全部双变量定量观测值的分布,揭示两个变量之间的关联模式。
为以下成对数据构建散点图:x为小测学习时长,y为满分10分的小测得分,共5名学生的数据:(1,3), (2,5), (3,7), (4,8), (5,9)
- 1
将x轴标注为「学习时长」,刻度范围设为0到6;将y轴标注为「小测得分」,刻度范围设为0到10。
- 2
在对应的x、y坐标处绘制每一个成对数据点,不要添加连接线或额外标记。
- 3
添加清晰的标题「学习时长与小测得分的关联」,完成绘图。
测试你对散点图构建的理解:
标准散点图的x轴上绘制的是哪一类变量?
响应变量
解释变量
分类变量
混淆变量
显示答案
解释变量 —标准双变量分析中,解释变量(自变量)始终被映射到水平x轴。
2. 散点图核心特征解读★★★☆☆⏱ 3 min
所有散点图解读都必须覆盖四个标准化特征:方向(正相关、负相关或无关联)、形态(线性、曲线、聚类)、强度(根据点贴合形态的紧密程度分为强、中等、弱)、离群点(与整体模式偏差极大的点)。
正相关:x增大时,y整体呈上升趋势
负相关:x增大时,y整体呈下降趋势
无关联:x和y的取值之间不存在稳定趋势
解读上一个示例中学习时长与小测得分的散点图
- 1
方向:正相关,学习时长增加时,小测得分整体呈上升趋势。
- 2
形态:完全线性,不存在可见的曲率或聚类。
- 3
强度:极强,所有点几乎完全贴合一条直线趋势。
- 4
离群点:不存在偏离整体线性模式的点。
Exam tip:
AP 考试阅卷人要求你在描述散点图时必须明确提及全部四个特征(方向、形态、强度、离群点),遗漏任意一项都无法获得满分。
3. 用于线性拟合评估的残差图★★★☆☆⏱ 3 min
残差图将残差(计算方式为 ,即观测y值减去预测y值)绘制在纵轴,将解释变量x绘制在横轴。拟合效果良好的线性模型会呈现出随机分散的点分布,所有点无可见模式,整体以残差=0为中心分布。
评估呈现明显向上开口U型形态的残差图对应的线性模型拟合效果
- 1
首先确认残差图的坐标轴:x轴为解释变量,y轴为残差值。
- 2
识别出在x的全部取值范围内都存在的清晰抛物线曲线模式。
- 3
结论:该线性模型拟合效果很差,使用二次曲线模型可以大幅提升数据拟合度。
4. 用于控制混淆变量的分层散点图★★★★☆⏱ 3 min
分层散点图使用不同的颜色、形状或标记大小,按第三类分类变量的不同水平区分数据点,能够揭示所有点合并绘制时被掩盖的隐藏关联,是消除混淆变量影响的常用工具。
使用分层散点图揭示辛普森悖论:原始数据整体呈现冰淇淋销量与溺水死亡人数的负相关关系,按月份分层后可得到不同结论
- 1
首先将所有点合并绘制,观察到虚假的负向趋势。
- 2
按季节(冬季、春季、夏季、秋季)使用不同的标记颜色对数据点进行分层。
- 3
可以观察到,在每一个季节内部,冰淇淋销量与溺水死亡人数都呈现极强的正相关,揭示出隐藏的混淆变量——户外温度。
5. 常见陷阱
错误做法:
仅凭呈现强关联的散点图直接得出因果关系结论
原因:
散点图仅能展示观测得到的关联,无法证明变量之间存在因果关系
正确做法:
明确描述观测到的关联,同时说明因果结论需要受控实验设计支撑
错误做法:
使用描述原始散点图的方向/强度术语来描述残差图
原因:
残差图的设计目的就是消除整体线性趋势,本身不存在可解读的固有方向或强度
正确做法:
仅通过识别可见模式(曲率、扇形分布、聚类)来判断线性模型是否适用
错误做法:
解读散点图时忽略x方向上的强影响点
原因:
远离x均值的单个极端离群点可以完全改变相关系数的符号和回归斜率
正确做法:
标记所有x方向的离群点,说明移除这些点后关联的强度和方向会发生怎样的变化
错误做法:
针对第三类定量变量使用分层散点图
原因:
按连续定量变量分层会生成大量难以区分、过度拥挤的标记组,导致图形无法读取
正确做法:
分层散点图仅适用于第三类分类变量,如有需要可使用标记大小区分连续第三类变量
错误做法:
在标准散点图中添加额外线条连接连续数据点
原因:
连接无关数据点会生成原始数据中不存在的人为视觉趋势
正确做法:
仅绘制独立的不相连点,仅当分析明确要求时才添加单条回归趋势线
6. 图形工具速查表
图形类型 | 核心用途 | 关键诊断特征 | 拟合效果差的警示信号 |
|---|---|---|---|
原始散点图 | 展示双变量关联 | 方向、形态、强度、离群点 | 无可见趋势、极端x方向离群点 |
残差图 | 评估线性模型拟合效果 | 以0为中心的随机分散点分布 | 曲线模式、残差分布呈扇形扩散 |
分层散点图 | 控制第三类分类变量 | 可识别分组专属趋势 | 标记重叠、分组无明确区分 |
叠加散点图 | 对比两组双变量数据集 | 两个独立趋势组清晰可辨 | 两组完全重叠无区分度 |
真题中的出现
AI 根据考纲规律估算的考点位置,请对照官方真题核实准确性。仅作复习重点参考。
- 2025 · 1
散点图解读自由作答题
- 2024 · 2
残差图分析选择题
- 2023 · 1
离群点识别自由作答题
下一步
熟练掌握这些图形工具是你计算正式回归统计量的关键前置步骤,在AP考试中你必须先通过图形验证模型适用性,再开展数值计算。跳过图形检查是考生丢失自由作答题分数的最常见原因之一,College Board阅卷人会明确为引用残差图模式支撑模型选择的作答分配分数。接下来你将在此基础上学习皮尔逊相关系数,构建最小二乘回归线,开展正式残差分析以量化模型拟合效果。
