经过前六节,我们已经讨论了机器学习与传统电磁计算的区别、泛化能力、数据划分、欠拟合与过拟合,以及损失函数和评价指标。
现在需要回答一个更基础的问题:
神经网络在训练过程中,究竟学到了什么?
如果这个问题没有想清楚,就很容易把模型的高精度预测误认为它已经“理解了物理规律”,或者把某个任务上的成功错误地推广到其他问题。
从工程角度看,理解神经网络最直接的方式,是把它看成一种参数化函数逼近模型。
一、机器学习任务通常可以写成输入到输出的映射
许多监督学习问题,都可以表示为:
输入 x
↓
模型 f
↓
输出 y
例如,在天线问题中,可以定义:
输入:
几何尺寸、材料参数、馈电位置
输出:
谐振频率
于是,目标关系可以写成:
y = f(x)
这里的函数 f 表示:给定输入后,真实系统会产生怎样的输出。
但在复杂工程问题中,我们往往并不知道这个函数的显式表达式。即使知道控制方程,从输入参数到最终工程指标之间的计算也可能非常复杂。
机器学习的任务,就是利用已有样本,建立一个近似函数:
ŷ = fθ(x)
其中:
x是输入;ŷ是模型预测;θ是模型参数;fθ是由参数决定的近似映射。
训练过程的本质,就是不断调整 θ,使模型输出尽量接近真实输出。
二、神经网络是一类参数化函数
神经网络由多层计算组成。每一层通常进行线性变换和非线性变换,再把结果传递给下一层。
可以把一个简单神经网络概括为:
输入
↓
多层参数化变换
↓
输出
网络中的权重和偏置就是需要学习的参数。
训练开始时,这些参数通常没有明确意义。随着训练进行,优化算法根据损失函数不断调整参数,使网络逐渐形成适合当前任务的输入输出关系。
因此,神经网络中的“学习”并不是把一条明确公式直接写入网络,而是:
通过大量样本和优化过程,寻找一组参数,使网络能够近似目标映射。
网络规模越大,通常表示它可以表达更复杂的函数,但这并不意味着它一定能学得更好。表达能力还必须与数据规模、任务复杂度和训练方法相匹配。
三、函数逼近不等于简单记忆
把神经网络理解为函数逼近,并不等于认为它只是查表或机械记忆。
如果模型只记住训练样本,那么面对新输入时就无法产生可靠结果。真正有效的模型需要从有限样本中提取某些稳定结构,并将其用于新样本。
例如,训练数据中可能包含不同天线尺寸与谐振频率的对应关系。模型需要从这些离散样本中形成一个连续或近似连续的映射,而不是只记住每一个样本编号。
因此,函数逼近通常包含两部分:
- 对已有样本的拟合;
- 对未见样本的推广。
第一部分决定模型能否学会训练任务,第二部分决定模型是否具有泛化能力。
模型若只完成第一部分,就可能发生过拟合。
四、模型是否“学到了物理”
这是工程科研中最容易引起争论的问题。
假设神经网络的训练数据全部来自高精度电磁仿真。模型预测结果很好,是否可以说它学到了Maxwell方程?
更严谨的回答是:
模型可能学到了由Maxwell方程和具体任务共同决定的某些响应规律,但不能仅凭预测精度,就认定它获得了完整、通用的Maxwell方程求解能力。
原因在于,模型学到什么受到以下因素限制:
- 输入变量如何定义;
- 输出目标如何定义;
- 数据覆盖哪些结构;
- 材料和频率范围多大;
- 激励和边界条件是否固定;
- 损失函数强调哪些误差;
- 网络结构能够表达什么关系。
如果训练任务只是:
结构参数 → 谐振频率
那么模型主要学到的是这一特定映射。
它不一定能够输出完整电磁场,也不一定能够处理不同激励、不同边界条件或完全不同的物理任务。
所以,模型中可以包含物理规律的“结果痕迹”,但不能把这种现象直接等同于获得了完整物理理论。
五、数据规律与物理规律有什么区别
物理规律通常具有更广泛的适用范围。
例如,Maxwell方程能够统一描述大量经典电磁现象,但一个具体神经网络模型通常只覆盖某个任务和某段数据分布。
可以把二者区别概括为:
物理规律
- 以控制方程和基本假设表达;
- 适用范围由理论条件决定;
- 可以针对不同问题重新求解;
- 具有较强的可解释性和迁移基础。
数据规律
- 从有限样本中统计学习;
- 适用范围由数据和任务决定;
- 可能隐含复杂关系;
- 超出训练分布后缺少可靠保证。
需要注意,两者并不是完全割裂的。
如果数据来自真实物理系统,模型学到的数据规律必然受到物理规律影响。但数据只展示了物理规律在某些条件下的结果,而不是所有可能情形。
因此,更准确的说法是:
神经网络从数据中学习物理系统在特定任务和条件下的表现,而不是天然获得物理规律的完整表达。
六、物理约束为什么有价值
既然纯数据模型的适用范围有限,就可以把已知物理知识加入模型。
常见方式包括:
- 在损失函数中加入物理残差;
- 约束输出满足边界条件;
- 在网络结构中体现对称性;
- 限制预测满足守恒关系;
- 使用物理合理的数据表示;
- 在后处理中进行物理校验。
这样做的核心目的,不是让模型获得人的物理意识,而是:
减少模型可以选择的不合理映射。
可以把它理解为:
大量可能函数
↓
训练数据排除一部分
↓
物理约束再排除一部分
↓
保留更符合任务和物理条件的候选映射
物理约束可能带来几个好处:
- 减少数据需求;
- 改善物理一致性;
- 提高外推稳定性;
- 降低明显错误;
- 增强结果可信度。
但它也不能替代测试和验证。如果物理约束本身设置错误,模型仍然会被引向错误方向。
七、为什么模型的迁移能力有限
如果神经网络只是针对某个具体映射训练,那么它的迁移能力自然受到限制。
例如,一个模型学习:
天线结构参数 → 辐射方向图
另一个任务是:
散射目标与入射波 → 雷达散射截面
虽然两个任务都属于电磁学,但它们的:
- 输入不同;
- 输出不同;
- 激励不同;
- 数据分布不同;
- 任务目标不同。
因此,原模型不能仅凭“都服从Maxwell方程”就直接迁移。
迁移能否成功,取决于模型中是否形成了可复用的表示,以及源任务和目标任务是否共享足够结构。
所以,更准确的问题不是:
这个模型是不是电磁模型?
而是:
它学到的哪些表示可以复用,哪些映射必须重新建立?
八、神经网络为什么仍然有重要价值
强调神经网络没有天然掌握完整物理规律,不等于否定它的价值。
相反,函数逼近能力正是它在工程中的重要优势。
在明确任务和合理数据范围内,神经网络可以:
- 快速预测复杂系统输出;
- 替代高成本重复计算;
- 支持大规模参数扫描;
- 加速优化和反向设计;
- 提取高维数据中的复杂规律;
- 作为传统求解器的代理模型;
- 辅助发现传统方法难以表达的关联。
它的价值不在于“像传统求解器一样工作”,而在于:
以另一种方式近似复杂关系,并在特定场景中显著降低计算成本。
关键是不能把任务内的高性能,误解为任务外的普适能力。
九、学习者认识的修正
初步认识: 神经网络学习的是输入与输出之间的关系,而不是Maxwell方程。
这个判断抓住了核心,但还可以进一步精确。
更完整的表达是:
神经网络通过数据学习特定任务下的输入输出映射。若数据来自物理系统,这个映射中会包含物理规律的影响,但模型通常没有显式获得完整控制方程和任意条件下的通用求解能力。
这一区分既避免夸大神经网络,也避免把它简单贬低为机械记忆。
神经网络既不是完整物理理论,也不是普通查表工具。它是一类能够从数据中逼近复杂函数的参数化模型。
十、本节小结
理解神经网络,可以抓住五点:
- 神经网络本质上是一类参数化函数;
- 训练过程是在寻找合适参数,使模型逼近目标映射;
- 有效模型不仅拟合训练样本,还要对新样本泛化;
- 模型可以学习物理系统的响应规律,但不等于获得完整物理理论;
- 物理约束的作用,是减少不合理映射,提高结果可信度。
至此,第一章的七个核心问题已经形成完整闭环:
概念层级
→ 传统计算与机器学习的区别
→ 泛化
→ 数据划分
→ 欠拟合与过拟合
→ 损失函数与评价指标
→ 神经网络究竟学什么
下一步将对第一章进行系统总结,把这些分散知识重新组织成一套可用于判断AI工程方案的基础认知框架。