Summary tatistic
总体与样本
总体 population:包含所研究的全部个体(数据)的集合
样本 sample:研究中实际观测或调查的一部分个体
偏差
选择性偏差 selection bias
在研究过程中因样本选择的非随机性而导致得到的结论存在偏差,属于系统误差。
eg.在一项身高研究中,选择篮球运动员作为样本。
测量偏差 Measurement bias
属于系统误差
eg.在人体体温研究中,耳内体温始终高于口腔体温。
**响应偏差 Response bias **
当对调查的回应率很低时,就可能出现回应偏差。这是因为回应调查的人往往与不回应的人有不同的特点或态度。
**混淆 Confounding **
混淆器是一种变量,它扭曲(增加或减少)一个变量(决定因素)对另一个变量(结果)的明显影响
实验设计study design
观察性实验 observational study
研究者不进行任何处理,观察性实验可以得出两者之间的联系
实验性研究 experimental study
通过某种处理来对试验者进行控制
控制自变量,改变因变量了,可以得出因果关系
变量variables
数值型变量 Numerical Data
离散型 discrete eg.年份
连续型 continuous eg.年龄
类别型变量 Categorial Data
序数变量 ordinal eg.撞击种类
名义变量 nominal eg.性别
偏态 skewed
对称数据,平均数=中位数;
左偏,平均数<中位数;
右偏,平均数>中位数

四分位法
下限 LT = Q1- 1.5IQR;
上限 UT = Q3 + 1.5IQR;
四分位范围 IQR = Q3 -Q1.

基础R命令
| 指令 | 描述 |
|---|---|
| Dim(data) | 数据集的维度(行/列) |
| str(data) | 变量的存储形式 |
| Head(data,3) | 数据的首三行 |
| Summary(data) | 数值摘要 |
| mean(x) | 平均值 |
| Median() | 中位数 |
| Var(data) | 方差 |
| Sd(data) | 标准差 |
| Fivenum(data) | 四分位法(min,Q1,Q2,Q3,max) |
| fivenum(x)[4]-fivenum(x)[2] | IQR |
| quantile(x,probs) | 百分位数 |
| plot(x,y,col = group) | 分组画散点图 |
| tapply(x, group, mean) | 分组计算 |
| boxplot(x~group) | 分组画箱型图 |
| length | 数量 |
| Skewness(x) | 偏态 |
统计摘要&spm=1001.2101.3001.5002&articleId=112260109&d=1&t=3&u=c0fd54169f504e5b812eb13ecc01b5fc)
2423

被折叠的 条评论
为什么被折叠?



