Knowledge Base & Mindmap
检索当前知识库中实际存在的 38 篇笔记
理解神经网络的基本计算单元,包括输入、权重、偏置、激活与输出之间的关系。
掌握数据字典建设规范,熟练进行 5 大数据质量审计(缺失、重复、类型错配、异常值 IQR 判定、标签质量),并生成标准化 EDA 报告。
掌握训练集、验证集与测试集的职责边界,灵活运用随机、分层、分组与时间序列切分策略防范信息泄漏。
掌握缺失值填补、特征缩放与类别编码,严守“所有 Transformer 的 fit 只能作用于训练集”防数据泄漏铁律。
掌握业务特征衍生、VIF 多重共线性诊断与类别不平衡处理,使用特征消融实验(Ablation Study)评估特征有效性。
掌握 ColumnTransformer 异构特征差异化预处理,使用 Pipeline 封装端到端流线,结合交叉验证与 Joblib 模型安全持久化。
掌握规范的数据科学仓库目录结构,使用 YAML 配置文件解耦模型超参数,并通过固定全局随机种子保证实验可复现性。
掌握项目代码模块化拆分与函数解耦,使用 pytest 编写 5 大有意义工程契约测试,建立数据与模型的质量防御网。
掌握结构化实验日志记录(runs/ 目录、Git Commit、数据哈希、超参数),并手写误分类错误分析 (Error Analysis) 提取诊断归因。
掌握在干净虚拟环境中从零一键复现实验,建立 Dummy, 线性与树模型多级基线对比,并撰写规范的项目总结报告。
掌握标量、向量、矩阵与张量的维度表达,理解 L1/L2/Linf 范数几何意义与余弦相似度计算,并通过 NumPy 实现向量化加速与数值校验。
深入矩阵代数性质(乘法、转置、迹、秩与逆矩阵),理清线性变换的几何含义,并手写旋转、缩放与剪切变换矩阵进行可视化演练。
掌握线性无关、子空间与基的定义,理解 Gram-Schmidt 正交化算法流程,推导正规方程并实现最小二乘直线拟合。
理解特征值与特征向量的几何拉伸本质,推导方阵对角化与对称矩阵谱定理,掌握正定矩阵二次型及协方差矩阵主方向。
掌握任意矩形矩阵的 SVD 几何分解与低秩逼近,从方差最大化推导 PCA,手写截断 SVD/PCA 降维并遵循防数据泄露工程规范。
掌握导数作为局部变化率的直觉,推导多变量偏导数与链式法则,理解计算图反向传播原理,并用中心差分实现梯度检查。
掌握梯度向量作为最陡上升方向的性质,理解 Jacobian 矩阵与 Hessian 矩阵曲率,判定函数凸性并绘制等高线与梯度剪头场。
厘清批量 BGD、随机 SGD 与 Mini-batch 梯度下降机制,理解学习率与特征缩放对损失面等高线条件数及收敛速度的影响。
掌握传统 SGD 在鞍点与病态条件数上的困境,理解 Momentum 动量、RMSProp 自适应学习率与 Adam 优化器机制并进行轨迹对比。
掌握损失函数 (Loss Function) 的几何本质与极小化目标,理解凸函数与非凸函数的优化地形特征。
掌握随机变量、联合/条件概率与独立性,严密推导贝叶斯公式,识别基础率谬误并用蒙特卡洛代码模拟 Bayes 更新。
掌握伯努利、二项、高斯与泊松四大分布,理解期望、方差与协方差的数字特征,对比理论矩与样本矩。
掌握弱大数定律与中心极限定理的严密含义,推导标准误 SE 公式,并手写 Bootstrap 非参数重采样估计经验置信区间。
掌握最大似然估计 MLE 与最大后验估计 MAP,严密推导高斯负对数似然到 MSE、伯努利到 BCE 的物理映射,理解正则化的先验本质。
掌握原假设与备择假设,澄清 p 值的真实含义,理解效应量与多重比较 Bonferroni 修正,手写 A/B 测试报告并与 SciPy 对照。
AI 学习所需的 Python 解释器、Anaconda/venv 隔离环境、Conda/pip 包管理与 Jupyter Notebook 交互界面。
强类型与动态类型机制、数值、布尔、字符串处理与运算符优先级。
用条件、循环和推导式把输入数据转换为可解释、可测试的处理流程。
掌握 list、tuple、dict、set 的选择、访问、修改、遍历、拷贝与 AI 数据组织方式。
位置/关键字参数、*args与**kwargs、LEGB作用域法则与可变默认参数陷阱、lambda与map/filter适用边界、docstring与类型标注,以及将 AI 流程拆分为可测试函数。
__init__.py 机制、绝对与相对导入、sys.path 搜索路径、类与继承基础(面向 AI 库 API 理解)、dataclass 与 argparse 配置解析,以及 if __name__ == '__main__' 规范入口。
pathlib 现代路径处理、文本/CSV/JSON UTF-8 健壮读写、with 上下文管理器、try-except-finally 异常拦截、logging 日志记录、pdb 调试与 pytest 单元测试基础。
掌握 NumPy 核心数组 ndarray、维度变换、广播机制 (Broadcasting) 与纯向量化矩阵计算,为机器学习与深度学习前向传播打下坚实基础。
深入掌握 Pandas 核心数据结构 Series 与 DataFrame,熟练运用数据导入导出、loc/iloc 显式切片、条件筛选、缺失值清洗、Groupby 分组聚合与表格 Merge 操作。
建立机器学习问题视角,掌握何时使用 ML、5 大学习范式对比、7 种任务类型与输出空间、统一 7 字段问题定义框架以及从数据到决策的标准流程。
掌握 Matplotlib 面向对象 Figure 与 Axes 架构模式、折线图/散点图/直方图/热图绘制,以及 AI 实验中损失曲线与混淆矩阵的可视化方法。
掌握标准 AI 实验工作流:数据集划分、分层抽样、特征归一化与标准化、数据泄露 (Data Leakage) 防范、Pipeline 构建与交叉验证。
阶段 0 综合大作业:端到端实现鸢尾花 (Iris) 数据集加载、EDA 观察、Pipeline 构建、模型训练、多指标评估与错判分析。