数据分析 术语表

专有名词注释查阅表 | 1 个分类

数据分析 名词注释查阅表

A

术语英文释义
异常值Outlier显著偏离其他观测值的数据点,可能由测量误差或真实极端现象导致
A/B测试A/B Testing通过随机分组对比两种方案效果的实验方法,是因果推断的金标准
聚合Aggregation对数据按组计算统计量(均值、求和、计数等)的操作,Pandas中用groupby+agg实现

B

术语英文释义
广播BroadcastingNumPy中不同形状数组自动扩展以进行元素级运算的机制
条形图Bar Chart用矩形条的高度/长度表示分类数据数值的图表,适合类别比较
箱线图Box Plot展示数据分布五数概括(最小值、Q1、中位数、Q3、最大值)的统计图表

C

术语英文释义
分类变量Categorical Variable取值为有限个离散类别的变量,如性别、城市
置信区间Confidence Interval以给定概率(置信水平)包含总体参数真值的区间估计
相关分析Correlation Analysis衡量两个变量之间线性关系强度和方向的统计方法
交叉表Crosstab两个分类变量的频数统计表,Pandas中用pd.crosstab()生成

D

术语英文释义
DataFrameDataFramePandas的核心二维表格数据结构,由行索引、列索引和数据值组成
数据清洗Data Cleaning识别和修正数据中缺失值、异常值、格式错误等质量问题的过程
描述统计Descriptive Statistics用统计量(均值、标准差等)和图表总结描述已有数据的分支
诊断性分析Diagnostic Analysis解释”为什么发生”的分析层次,通过相关分析和假设检验建立因果逻辑
dtypeData TypeNumPy数组中元素的数据类型,如int64、float64、bool等
去重Deduplication删除数据集中重复记录的操作,Pandas中用drop_duplicates()实现

E

术语英文释义
探索性数据分析EDA在建模之前通过统计图表和摘要统计量了解数据分布特征和异常模式的过程
插值Interpolation用已知数据点的值估计未知位置值的数学方法,Pandas中用interpolate()实现

F

术语英文释义
FacetGridFacetGridSeaborn中按分类变量分面绘制多子图的网格系统
填充缺失值Fill Missing Values用特定值(均值、中位数、前向填充等)替代NaN的操作,Pandas中用fillna()实现
假阳性False Positive统计检验中原假设为真却被拒绝的错误,也称第一类错误
假阴性False Negative统计检验中原假设为假却未被拒绝的错误,也称第二类错误

G

术语英文释义
分组聚合Groupby Aggregation将数据按一个或多个变量分组后对每组计算统计量的操作

H

术语英文释义
直方图Histogram将连续数据划分为若干区间(bin)并统计各区间的频数或密度的图表
热力图Heatmap用颜色深浅表示矩阵数值大小的可视化图表,常用于相关系数矩阵展示
hue参数Hue ParameterSeaborn中将分类变量映射为不同颜色的语义映射参数

I

术语英文释义
索引IndexPandas中用于定位和对齐数据的标签,Series和DataFrame均支持行索引和列索引
插值法Imputation用估计值填充缺失数据的方法,包括均值插补、中位数插补、KNN插补等

J

术语英文释义
Jupyter NotebookJupyter Notebook数据分析标准交互环境,由代码单元格和Markdown单元格组成的.ipynb文档
连接Join根据键列将两个DataFrame合并的操作,包括内连接、左连接、右连接、外连接

K

术语英文释义
核密度估计KDE用核函数估计概率密度函数的非参数方法,Seaborn中用kde=True绘制
KernelKDE中用于平滑估计的窗口函数,常用高斯核

L

术语英文释义
线性回归Linear Regression用线性函数拟合自变量与因变量关系的统计方法,最小二乘法估计参数
线图Line Plot用线段连接数据点展示趋势变化的图表,适合时间序列数据

M

术语英文释义
MatplotlibMatplotlibPython底层绘图库,提供Figure/Axes面向对象接口和Pyplot函数式接口
中位数Median将数据从小到大排列后位于中间位置的值,对异常值比均值更稳健
缺失值Missing Value数据集中未被记录的值,在Pandas中表示为NaN(Not a Number)
多重共线性Multicollinearity回归模型中自变量之间高度相关的现象,会导致系数估计不稳定
Magic命令Magic CommandIPython/Jupyter提供的特殊指令,以%(行级)或%%(单元格级)开头

N

术语英文释义
ndarrayndarrayNumPy的核心多维数组对象,连续内存布局,固定数据类型,支持向量化运算
NumPyNumPyPython科学计算基础库,提供高效的多维数组对象和数值计算函数
正态分布Normal Distribution又称高斯分布,由均值mu和标准差sigma决定的钟形对称概率分布
非参数检验Non-parametric Test不假设数据服从特定分布的统计检验方法,如Mann-Whitney U检验、Kruskal-Wallis检验
零假设Null Hypothesis统计检验中默认成立的假设,通常表示”无效果”或”无差异”,记为H0

O

术语英文释义
OLSOrdinary Least Squares普通最小二乘法,通过最小化残差平方和估计线性回归参数
异常值检测Outlier Detection识别显著偏离正常模式的数据点的方法,包括IQR法、Z-score法、孤立森林等

P

术语英文释义
PandasPandasPython表格数据处理库,核心数据结构为Series和DataFrame
p值p-value在零假设成立下观察到当前或更极端结果的概率,p<alpha则拒绝零假设
透视表Pivot Table按多个维度对数据进行交叉汇总的表格,Pandas中用pivot_table()生成
预测性分析Predictive Analysis预测”未来可能发生什么”的分析层次,使用回归模型和时间序列等方法
总体Population研究对象的全体,如全校学生;参数是描述总体特征的数量
参数Parameter描述总体特征的数量,如总体均值mu、总体标准差sigma
参数估计Parameter Estimation用样本统计量推断总体参数的方法,包括点估计和区间估计
假设检验Hypothesis Testing通过样本数据判断关于总体的某个假设是否成立的统计方法
饼图Pie Chart用扇形面积表示各部分占整体比例的图表,适合展示构成关系

Q

术语英文释义
四分位数Quartile将排序数据四等分的值,Q1(25%)、Q2(中位数50%)、Q3(75%)
四分位距IQRInterquartile Range,Q3与Q1的差值,衡量数据离散程度,常用于异常值检测

R

术语英文释义
随机种子Random Seed控制随机数生成器初始状态以确保结果可复现的数值,NumPy中用np.random.seed()设置
重塑Reshape改变数组或DataFrame形状的操作,NumPy中用reshape(),Pandas中用melt()/pivot()
回归分析Regression Analysis研究自变量与因变量之间数量关系的统计方法,包括线性回归和逻辑回归

S

术语英文释义
散点图Scatter Plot用二维坐标点展示两个连续变量关系的图表
SeabornSeaborn基于Matplotlib的高级统计可视化库,提供面向DataFrame的API和美观默认样式
SeriesSeriesPandas的一维带标签数组,由索引和数据值组成
样本Sample从总体中抽取的子集,统计量是描述样本特征的数量
统计量Statistic描述样本特征的数量,如样本均值x-bar、样本标准差s
标准差Standard Deviation衡量数据离散程度的统计量,方差的正平方根
标准化Standardization将数据转换为均值为0、标准差为1的分布,z=(x-mu)/sigma
SciPySciPy基于NumPy的科学计算库,提供统计检验、优化、插值等高级算法
StatsmodelsStatsmodelsPython统计建模库,提供回归分析、时间序列分析、假设检验等功能
幸存者偏差Survivorship Bias只分析可见/存活数据而忽略缺失数据导致的系统性偏差
显著性水平Significance Level统计检验中拒绝零假设的阈值,通常取0.05或0.01,记为alpha
小提琴图Violin Plot结合箱线图和核密度估计的图表,同时展示数据分布和统计摘要

T

术语英文释义
时间序列Time Series按时间顺序排列的数据序列,Pandas中用DatetimeIndex支持时间序列操作
t检验t-test比较两组均值差异是否显著的参数检验方法,包括单样本、独立样本、配对样本t检验
类型转换Type Conversion将数据从一种类型转换为另一种类型的操作,Pandas中用astype()实现

U

术语英文释义
通用函数ufuncNumPy数组逐元素运算的函数支持广播和向量化,如np.add、np.sqrt
向量化Vectorization数组级运算替代显式循环编程模式,利用NumPy底层C实现获得性能

V

术语英文释义
方差Variance衡量数据离散程统计量,各观测与均之差的平方的平均
方差分析ANOVA比较两组及以上均差异是否显著统计方法,分为因素和双因素方差分析

W

术语英文释义
数据清洗Data Wrangling原始数据转换为适合分析格式的过程括清洗、转换重塑操作

Z

术语英文释义
Z-scoreZ-score标准化得分,表示观测偏离均多少个标准差,z=(x-mu)/sigma,常用于异常值检测
中心极限定理Central Limit Theorem样本量足够大时,样本的抽样分布近似服从正态分布,无论总体分布如何
专注模式