刘合天 / 学习与记录
LEARNING JOURNAL / 学习日志

个人学习日志

记录概念,整理方法,在练习与复盘中加深理解。这里汇集概率统计、数据分析和学习方法的基础笔记。

01 / 描述统计

从均值与中位数开始认识数据

拿到一组数据,先了解变量含义、样本数量、缺失情况和计量单位,再计算汇总指标。均值利用了每个观测值的信息,但容易受到极端数值的影响;中位数表示排序后的中间位置,能帮助我们观察偏态数据的典型水平。

分析时应结合数据的分布形状。直方图帮助观察集中区域和尾部,箱线图便于比较不同组的分布。一个平均数并不能完整描述数据。

例题:数据 2、3、3、4、18 的均值是 6,中位数是 3。数值 18 明显拉高了均值,因此解释“典型水平”时,应同时考虑中位数和分布。
02 / 概率基础

期望与方差分别描述什么

期望描述随机变量在概率权重下的平均水平。对于离散随机变量,可将每个可能取值与其概率相乘,再将结果相加。方差衡量取值围绕期望的离散程度,标准差则与原变量保持相同单位。

期望不是对单次结果的承诺。只有理解可能取值及其概率,才能合理解释平均水平;比较方差时,也需要关注变量的单位与尺度。

例题:公平六面骰子的点数期望为 (1 + 2 + 3 + 4 + 5 + 6) ÷ 6 = 3.5,但一次投掷不会出现 3.5 点。这说明期望与单次实际结果是不同概念。
03 / 统计推断

样本估计需要保留不确定性

样本统计量会随着抽样变化。用样本均值估计总体均值时,应同时关注抽样方式、样本量以及估计的精度。扩大样本量通常可以减小随机误差,却不能自动消除样本选择造成的系统偏差。

置信区间的置信水平描述方法在重复抽样中的长期覆盖比例。解释单次结果时,应避免将它简单理解为某个固定参数在已算出的区间内具有相同数值的概率。

复盘提示:先写清研究总体和样本来源,再报告估计值与区间;如果样本来源有明显限制,也要说明结论适用的范围。
04 / 数据分析

回归结果要和研究问题一起解释

回归模型用于刻画变量之间的关系。建模前需要明确研究问题、变量定义及数据采集方式;建模后可以检查残差、异常观测和预测误差,判断模型是否适合当前数据。

相关关系不能直接证明因果关系。遗漏变量、样本选择和反向因果都可能影响解释。如果目标是预测,还应使用独立的验证数据评估效果,避免只依据训练数据上的拟合程度作判断。

复盘提示:把“发现关联”“作出预测”和“推断因果”分开表述,逐一检查自己的数据和方法是否足以支持结论。
05 / 学习方法

把一道例题整理成可复用的笔记

完成例题后,可以按“问题—条件—方法—结果—解释”五个部分整理。除了计算过程,还要写清使用方法的前提,以及结果如何回答最初的问题。

遇到错误时,区分概念理解、条件检查、计算步骤和结果解释中的问题。复习时尝试用自己的语言讲清原理,再换一组数据完成类似练习,检查是否真正理解。

笔记模板:这道题在问什么?已知条件有哪些?为何选择这个方法?结果说明什么?下次遇到类似问题,应先检查哪些条件?

以上内容为基础学习笔记。具体定义、推导和适用条件请结合教材及原始资料核对。