一、第一章知识地图

第一章围绕七个问题展开:

AI概念层级

机器学习与传统科学计算的区别

泛化:为什么能预测新样本

数据划分:怎样检验泛化

欠拟合与过拟合

损失函数、评价指标与工程目标

神经网络究竟学到了什么

这七个问题最终形成一套判断框架:

一个AI模型是否可信,不能只看模型大小或训练误差,而要同时检查任务、数据、泛化、模型、指标和适用边界。


二、七节核心概念速查

第一节:AI、机器学习、深度学习和大语言模型

四者关系是:

人工智能
└── 机器学习
    └── 深度学习
        └── 大语言模型

但这只是主要包含关系,不表示人工智能只有机器学习,或深度学习只有大语言模型。

需要记住:

  • 人工智能是最宽泛的领域;
  • 机器学习是实现人工智能的一类重要方法;
  • 深度学习是机器学习的一类方法;
  • 大语言模型通常建立在深度学习基础上;
  • ChatGPT是基于大语言模型构建的AI产品,不等于人工智能的全部。

第二节:机器学习与传统电磁计算

传统电磁计算主要从物理方程和边界条件出发:

物理问题
→ Maxwell方程与材料模型
→ 数值离散
→ 求解
→ 电磁结果

机器学习主要从任务和数据出发:

输入输出定义
→ 训练数据
→ 参数优化
→ 输入输出近似映射
→ 预测

二者都会产生近似结果,但误差来源不同。

传统方法主要关注:

  • 物理建模;
  • 网格或基函数;
  • 截断;
  • 迭代收敛;
  • 数值稳定性。

机器学习主要关注:

  • 数据覆盖;
  • 分布变化;
  • 欠拟合与过拟合;
  • 测试是否独立;
  • 评价指标是否合理。

第三节:泛化

泛化是指模型在未参与训练、但属于目标任务范围的新样本上保持有效性能。

泛化不等于:

模型可以处理任意没有见过的数据。

真正决定泛化能力的是:

  • 数据是否覆盖目标范围;
  • 新样本与训练数据是否相关;
  • 模型是否学到稳定规律;
  • 应用数据是否发生分布变化;
  • 模型是在插值还是外推。

第四节:训练集、验证集和测试集

三类数据的职责不同:

数据集 主要作用
训练集 调整模型参数
验证集 选择模型和超参数
测试集 在所有选择完成后进行最终评价

测试集必须保持独立。反复查看测试结果并据此修改模型,会使测试集逐渐失去独立性。

需要特别警惕数据泄漏:

  • 相似样本被分到不同集合;
  • 同一结构的不同扰动样本跨集合;
  • 使用全部数据计算归一化参数;
  • 输入中间接包含目标信息;
  • 测试集参与模型选择。

第五节:欠拟合与过拟合

欠拟合:

  • 训练误差高;
  • 验证误差也高;
  • 模型没有学到足够规律;
  • 通常对应较高偏差。

过拟合:

  • 训练误差低;
  • 验证误差较高;
  • 模型对训练样本适应得过于具体;
  • 通常对应较高方差。

最基本诊断:

训练差、验证也差 → 倾向欠拟合

训练好、验证差 → 倾向过拟合

训练和验证都好、差距较小 → 可能较合理

但还必须检查测试独立性和数据泄漏。

第六节:损失函数、评价指标和工程目标

三者必须区分:

损失函数:模型训练时优化什么

评价指标:训练结束后如何衡量模型

工程目标:实际应用真正关心什么

例如,对天线响应曲线使用均方误差训练,并不意味着只报告均方误差就足够。

工程应用可能更关心:

  • 谐振频率偏差;
  • 带宽;
  • 最大增益;
  • 峰值位置;
  • 最大误差;
  • 是否超过设计容差。

平均误差小,不能证明最坏情况可接受。

第七节:神经网络究竟学到了什么

神经网络本质上是一类参数化函数:

输入 x
→ 参数化模型 fθ
→ 预测输出 ŷ

训练过程通过调整参数 θ,使模型逼近目标输入输出映射。

如果训练数据来自电磁仿真,模型学到的关系中包含物理规律的影响,但不能因此认为它获得了完整Maxwell方程和任意条件下的通用求解能力。

更准确的说法是:

神经网络学习的是特定任务和数据范围内的输入输出映射。


三、传统电磁计算与机器学习对照表

比较维度 传统电磁计算 机器学习
主要出发点 物理方程和边界条件 任务与数据
计算方式 针对当前问题离散并求解 使用已训练模型预测
主要成本 每次求解成本 数据生成、训练和验证
主要误差 建模、离散、截断、迭代 数据、模型、训练、分布变化
可信性证据 收敛性、算法对照、实验 独立测试、覆盖性、工程评价
适用边界 由物理模型和数值方法决定 由任务和数据分布决定
主要优势 物理基础明确、适用范围较广 重复预测快、可近似复杂映射
合理关系 作为可信求解和验证基础 作为代理、辅助或加速工具

四、常见问题快速诊断

情况一:训练集和验证集误差都很大

优先检查:

  • 模型是否过于简单;
  • 输入信息是否不足;
  • 是否训练充分;
  • 数据或标签是否错误;
  • 任务是否可学习。

倾向判断:欠拟合

情况二:训练误差很小,验证误差明显较大

优先检查:

  • 模型是否过于复杂;
  • 数据是否不足;
  • 数据覆盖是否狭窄;
  • 是否训练过久;
  • 是否存在数据泄漏。

倾向判断:过拟合

情况三:测试指标非常好,但实际使用失效

优先检查:

  • 测试集是否真正独立;
  • 是否随机拆分了高度相关样本;
  • 实际数据是否超出训练范围;
  • 是否发生分布变化;
  • 评价指标是否掩盖关键错误。

情况四:平均误差很小,但工程设计仍然出错

优先检查:

  • 最大误差;
  • 关键频率点;
  • 边界样本;
  • 峰值或谷值位置;
  • 工程容差;
  • 是否使用了错误的评价指标。

情况五:模型使用仿真数据训练,是否可以认为学会了物理

不能直接这样判断。

模型学习了仿真数据中体现的特定响应关系,但是否获得更广泛物理能力,需要由任务范围、模型结构、物理约束和外部验证共同证明。


五、第一章自测题

判断题

  1. ChatGPT、深度学习、机器学习和人工智能是四个并列概念。 错误。

  2. 训练误差很小,说明模型一定可靠。 错误。

  3. 随机划分数据一定可以保证训练集和测试集独立。 错误。

  4. 传统电磁计算也会受到建模、网格和迭代误差影响。 正确。

  5. 神经网络使用Maxwell方程求解结果训练后,就获得了通用Maxwell求解能力。 错误。

  6. 增加大量相似样本,未必能显著改善模型泛化。 正确。

  7. 均方误差小,不代表最大相对误差一定小。 正确。

  8. 测试集可以在模型开发过程中反复使用。 错误。

简答题

  1. 机器学习与传统电磁计算最核心的区别是什么?
  2. 为什么训练集、验证集和测试集不能互相混用?
  3. 欠拟合和过拟合在训练误差、验证误差上分别有什么表现?
  4. 为什么平均误差不能充分证明工程可靠性?
  5. 为什么神经网络在一个电磁任务上有效,不能自动迁移到另一个电磁任务?
  6. 物理约束的主要作用是什么?

六、电磁工程情境练习

某研究团队使用一万个微带天线仿真样本训练神经网络,输入是天线几何尺寸和介电常数,输出是谐振频率。训练集和测试集均采用随机划分,测试平均相对误差只有0.5%。

准备将模型用于一种新的天线结构时,研究人员声称:

模型精度很高,并且训练数据来自Maxwell方程求解,所以可以用于其他天线结构。

至少应提出以下审查问题:

  1. 新天线结构是否出现在原训练数据的结构类型中;
  2. 随机划分是否把高度相似样本同时放入训练集和测试集;
  3. 新结构是在原参数范围内插值,还是结构和分布外外推;
  4. 是否只报告平均误差,而没有检查最大误差;
  5. 谐振频率之外,模型是否需要预测其他输出;
  6. 新结构的关键结果是否由高精度求解器或实验验证。

合理结论是:

原测试结果只能证明模型在当前数据划分和任务范围内表现较好,不能自动证明它适用于新的结构类型。


七、必须记住的十句话

  1. ChatGPT不等于人工智能的全部。
  2. 机器学习是人工智能的一类方法,不等于神经网络。
  3. 深度学习是机器学习的一类方法。
  4. 神经网络主要学习特定任务的输入输出映射。
  5. 训练精度高不等于模型泛化好。
  6. 数据的覆盖性和相关性比单纯数量更重要。
  7. 测试集只有保持独立,才有最终评价意义。
  8. 欠拟合和过拟合需要采用不同的解决方法。
  9. 平均误差小不代表最坏情况可接受。
  10. AI能否产生工程价值,必须由明确任务和可靠证据证明。

八、第一章复习检查清单

完成复习后,应能够独立回答:

  • 四个AI核心概念的层级关系;
  • 传统电磁计算和机器学习的主要区别;
  • 泛化的含义和边界;
  • 三类数据集的职责;
  • 数据泄漏的常见形式;
  • 欠拟合与过拟合的判断方法;
  • 损失函数与工程指标的区别;
  • 神经网络为什么不等于完整物理理论;
  • 如何审查一个AI电磁工程方案是否可信。