一、第一章知识地图
第一章围绕七个问题展开:
AI概念层级
↓
机器学习与传统科学计算的区别
↓
泛化:为什么能预测新样本
↓
数据划分:怎样检验泛化
↓
欠拟合与过拟合
↓
损失函数、评价指标与工程目标
↓
神经网络究竟学到了什么
这七个问题最终形成一套判断框架:
一个AI模型是否可信,不能只看模型大小或训练误差,而要同时检查任务、数据、泛化、模型、指标和适用边界。
二、七节核心概念速查
第一节:AI、机器学习、深度学习和大语言模型
四者关系是:
人工智能
└── 机器学习
└── 深度学习
└── 大语言模型
但这只是主要包含关系,不表示人工智能只有机器学习,或深度学习只有大语言模型。
需要记住:
- 人工智能是最宽泛的领域;
- 机器学习是实现人工智能的一类重要方法;
- 深度学习是机器学习的一类方法;
- 大语言模型通常建立在深度学习基础上;
- ChatGPT是基于大语言模型构建的AI产品,不等于人工智能的全部。
第二节:机器学习与传统电磁计算
传统电磁计算主要从物理方程和边界条件出发:
物理问题
→ Maxwell方程与材料模型
→ 数值离散
→ 求解
→ 电磁结果
机器学习主要从任务和数据出发:
输入输出定义
→ 训练数据
→ 参数优化
→ 输入输出近似映射
→ 预测
二者都会产生近似结果,但误差来源不同。
传统方法主要关注:
- 物理建模;
- 网格或基函数;
- 截断;
- 迭代收敛;
- 数值稳定性。
机器学习主要关注:
- 数据覆盖;
- 分布变化;
- 欠拟合与过拟合;
- 测试是否独立;
- 评价指标是否合理。
第三节:泛化
泛化是指模型在未参与训练、但属于目标任务范围的新样本上保持有效性能。
泛化不等于:
模型可以处理任意没有见过的数据。
真正决定泛化能力的是:
- 数据是否覆盖目标范围;
- 新样本与训练数据是否相关;
- 模型是否学到稳定规律;
- 应用数据是否发生分布变化;
- 模型是在插值还是外推。
第四节:训练集、验证集和测试集
三类数据的职责不同:
| 数据集 | 主要作用 |
|---|---|
| 训练集 | 调整模型参数 |
| 验证集 | 选择模型和超参数 |
| 测试集 | 在所有选择完成后进行最终评价 |
测试集必须保持独立。反复查看测试结果并据此修改模型,会使测试集逐渐失去独立性。
需要特别警惕数据泄漏:
- 相似样本被分到不同集合;
- 同一结构的不同扰动样本跨集合;
- 使用全部数据计算归一化参数;
- 输入中间接包含目标信息;
- 测试集参与模型选择。
第五节:欠拟合与过拟合
欠拟合:
- 训练误差高;
- 验证误差也高;
- 模型没有学到足够规律;
- 通常对应较高偏差。
过拟合:
- 训练误差低;
- 验证误差较高;
- 模型对训练样本适应得过于具体;
- 通常对应较高方差。
最基本诊断:
训练差、验证也差 → 倾向欠拟合
训练好、验证差 → 倾向过拟合
训练和验证都好、差距较小 → 可能较合理
但还必须检查测试独立性和数据泄漏。
第六节:损失函数、评价指标和工程目标
三者必须区分:
损失函数:模型训练时优化什么
评价指标:训练结束后如何衡量模型
工程目标:实际应用真正关心什么
例如,对天线响应曲线使用均方误差训练,并不意味着只报告均方误差就足够。
工程应用可能更关心:
- 谐振频率偏差;
- 带宽;
- 最大增益;
- 峰值位置;
- 最大误差;
- 是否超过设计容差。
平均误差小,不能证明最坏情况可接受。
第七节:神经网络究竟学到了什么
神经网络本质上是一类参数化函数:
输入 x
→ 参数化模型 fθ
→ 预测输出 ŷ
训练过程通过调整参数 θ,使模型逼近目标输入输出映射。
如果训练数据来自电磁仿真,模型学到的关系中包含物理规律的影响,但不能因此认为它获得了完整Maxwell方程和任意条件下的通用求解能力。
更准确的说法是:
神经网络学习的是特定任务和数据范围内的输入输出映射。
三、传统电磁计算与机器学习对照表
| 比较维度 | 传统电磁计算 | 机器学习 |
|---|---|---|
| 主要出发点 | 物理方程和边界条件 | 任务与数据 |
| 计算方式 | 针对当前问题离散并求解 | 使用已训练模型预测 |
| 主要成本 | 每次求解成本 | 数据生成、训练和验证 |
| 主要误差 | 建模、离散、截断、迭代 | 数据、模型、训练、分布变化 |
| 可信性证据 | 收敛性、算法对照、实验 | 独立测试、覆盖性、工程评价 |
| 适用边界 | 由物理模型和数值方法决定 | 由任务和数据分布决定 |
| 主要优势 | 物理基础明确、适用范围较广 | 重复预测快、可近似复杂映射 |
| 合理关系 | 作为可信求解和验证基础 | 作为代理、辅助或加速工具 |
四、常见问题快速诊断
情况一:训练集和验证集误差都很大
优先检查:
- 模型是否过于简单;
- 输入信息是否不足;
- 是否训练充分;
- 数据或标签是否错误;
- 任务是否可学习。
倾向判断:欠拟合。
情况二:训练误差很小,验证误差明显较大
优先检查:
- 模型是否过于复杂;
- 数据是否不足;
- 数据覆盖是否狭窄;
- 是否训练过久;
- 是否存在数据泄漏。
倾向判断:过拟合。
情况三:测试指标非常好,但实际使用失效
优先检查:
- 测试集是否真正独立;
- 是否随机拆分了高度相关样本;
- 实际数据是否超出训练范围;
- 是否发生分布变化;
- 评价指标是否掩盖关键错误。
情况四:平均误差很小,但工程设计仍然出错
优先检查:
- 最大误差;
- 关键频率点;
- 边界样本;
- 峰值或谷值位置;
- 工程容差;
- 是否使用了错误的评价指标。
情况五:模型使用仿真数据训练,是否可以认为学会了物理
不能直接这样判断。
模型学习了仿真数据中体现的特定响应关系,但是否获得更广泛物理能力,需要由任务范围、模型结构、物理约束和外部验证共同证明。
五、第一章自测题
判断题
-
ChatGPT、深度学习、机器学习和人工智能是四个并列概念。 错误。
-
训练误差很小,说明模型一定可靠。 错误。
-
随机划分数据一定可以保证训练集和测试集独立。 错误。
-
传统电磁计算也会受到建模、网格和迭代误差影响。 正确。
-
神经网络使用Maxwell方程求解结果训练后,就获得了通用Maxwell求解能力。 错误。
-
增加大量相似样本,未必能显著改善模型泛化。 正确。
-
均方误差小,不代表最大相对误差一定小。 正确。
-
测试集可以在模型开发过程中反复使用。 错误。
简答题
- 机器学习与传统电磁计算最核心的区别是什么?
- 为什么训练集、验证集和测试集不能互相混用?
- 欠拟合和过拟合在训练误差、验证误差上分别有什么表现?
- 为什么平均误差不能充分证明工程可靠性?
- 为什么神经网络在一个电磁任务上有效,不能自动迁移到另一个电磁任务?
- 物理约束的主要作用是什么?
六、电磁工程情境练习
某研究团队使用一万个微带天线仿真样本训练神经网络,输入是天线几何尺寸和介电常数,输出是谐振频率。训练集和测试集均采用随机划分,测试平均相对误差只有0.5%。
准备将模型用于一种新的天线结构时,研究人员声称:
模型精度很高,并且训练数据来自Maxwell方程求解,所以可以用于其他天线结构。
至少应提出以下审查问题:
- 新天线结构是否出现在原训练数据的结构类型中;
- 随机划分是否把高度相似样本同时放入训练集和测试集;
- 新结构是在原参数范围内插值,还是结构和分布外外推;
- 是否只报告平均误差,而没有检查最大误差;
- 谐振频率之外,模型是否需要预测其他输出;
- 新结构的关键结果是否由高精度求解器或实验验证。
合理结论是:
原测试结果只能证明模型在当前数据划分和任务范围内表现较好,不能自动证明它适用于新的结构类型。
七、必须记住的十句话
- ChatGPT不等于人工智能的全部。
- 机器学习是人工智能的一类方法,不等于神经网络。
- 深度学习是机器学习的一类方法。
- 神经网络主要学习特定任务的输入输出映射。
- 训练精度高不等于模型泛化好。
- 数据的覆盖性和相关性比单纯数量更重要。
- 测试集只有保持独立,才有最终评价意义。
- 欠拟合和过拟合需要采用不同的解决方法。
- 平均误差小不代表最坏情况可接受。
- AI能否产生工程价值,必须由明确任务和可靠证据证明。
八、第一章复习检查清单
完成复习后,应能够独立回答:
- 四个AI核心概念的层级关系;
- 传统电磁计算和机器学习的主要区别;
- 泛化的含义和边界;
- 三类数据集的职责;
- 数据泄漏的常见形式;
- 欠拟合与过拟合的判断方法;
- 损失函数与工程指标的区别;
- 神经网络为什么不等于完整物理理论;
- 如何审查一个AI电磁工程方案是否可信。