人工智能正在迅速进入科研、教学和工程实践。对高校教师、科研人员和工程技术人员来说,今天的问题已经不再是“要不要接触AI”,而是:
应该以什么方式理解AI,才能真正把它用于专业工作,而不是停留在表面使用?
很多人学习AI,往往从工具开始:使用ChatGPT写材料,用大模型查资料,让AI生成代码,或者尝试用神经网络预测某个工程结果。这些做法当然有价值,但如果缺少基本认知框架,很容易出现三个问题。
第一,把AI工具的流畅回答误认为可靠知识;第二,把神经网络的预测结果误认为对物理规律的真正理解;第三,在模型训练指标很好时,过早认为模型已经能够用于真实工程问题。
因此,对工程科研人员而言,学习AI的第一步,不应是掌握更多工具,而应是建立基本判断能力。
本章的任务,就是建立这样一套基础认知框架。
一、为什么工程科研人员不能只学会使用AI工具
人工智能工具的使用门槛越来越低。过去需要专业程序员完成的任务,现在可能通过自然语言就能交给AI处理。表面上看,这似乎意味着技术细节不再重要。
恰恰相反。
工具越容易使用,判断结果是否可信就越重要。
当AI帮助我们整理文献、生成程序、预测工程参数或提出研究方案时,真正困难的部分往往不是“怎样让AI给出结果”,而是:
- 这个结果依据什么产生;
- 它在哪些条件下成立;
- 它是否超出了训练数据覆盖范围;
- 评价指标是否反映真实工程目标;
- 模型是否把偶然规律当成了稳定规律;
- 结果是否违反已知物理约束;
- 一个任务上有效的方法,能否迁移到另一个任务。
这些问题无法仅靠熟练输入提示词解决。
AI工具可以降低执行门槛,却不会自动消除认识门槛。
工程科研人员真正需要掌握的,不是所有算法细节,而是能够判断:
这个模型究竟解决了什么问题,为什么可能有效,又为什么可能失败。
二、传统科学计算与机器学习的出发点不同
工程科研人员通常熟悉一种经典的问题求解方式:
- 明确物理对象;
- 建立数学模型;
- 写出控制方程和边界条件;
- 对方程进行离散;
- 使用数值方法求解;
- 验证计算结果。
以电磁计算为例,有限元法、时域有限差分法、矩量法等方法,虽然数值实现不同,但都以Maxwell方程及相应的边界条件为基础。
机器学习的出发点则不同。
它通常不是直接从控制方程开始,而是从数据开始。通过大量输入和输出样本,模型调整自身参数,寻找一种能够近似描述输入与输出关系的函数。
二者可以简化为:
传统科学计算:
物理规律 → 数学方程 → 数值求解 → 结果
机器学习:
训练数据 → 参数优化 → 输入输出映射 → 预测
这并不意味着机器学习与物理规律无关,也不意味着机器学习只能机械记忆数据。真正需要理解的是:
机器学习模型通常首先学习的是任务所定义的输入输出映射,而不是天然获得对物理方程的完整理解。
例如,一个利用天线结构参数预测辐射特性的神经网络,即使预测精度很高,也不能因此认定它已经“掌握了电磁学”。它学到的是特定输入、特定输出和特定数据分布下的近似关系。
当任务变成散射、传输或其他物理过程时,原模型不一定能够迁移。问题不只是数据数量够不够,还在于任务映射本身已经发生了变化。
这一点,是工程科研人员理解AI模型边界的起点。
三、模型在训练数据上表现好,并不等于真正有效
机器学习最容易造成误判的地方,是模型在已有数据上表现得很好。
模型可能在训练集上误差很小,图线高度吻合,甚至比传统方法快几个数量级。但真正决定模型价值的问题是:
当它面对没有见过的新样本时,是否仍然有效?
这就是泛化问题。
泛化不是一句“模型可以预测新数据”的口号,而取决于至少两个条件:
1. 数据的覆盖性
训练数据是否覆盖了未来应用中可能出现的重要变化?
例如:
- 几何参数是否覆盖足够范围;
- 材料参数是否覆盖实际变化;
- 工作频段是否完整;
- 是否包含关键边界情况;
- 是否遗漏少数但重要的极端样本。
数据数量很多,不代表覆盖充分。大量高度相似的数据,可能只是在狭窄区域内重复采样。
2. 数据的相关性
训练数据是否真正代表未来要解决的问题?
如果训练数据与目标任务之间的物理条件、输入定义、输出定义或数据分布差异很大,即使数据规模很大,也未必有帮助。
因此,不能简单地说“数据越多越好”。更准确的判断是:
有效数据需要同时具备覆盖性和相关性。
四、为什么必须区分训练集、验证集和测试集
为了判断模型是否具有泛化能力,数据不能全部用于训练。
通常需要把数据划分为:
- 训练集;
- 验证集;
- 测试集。
三者承担不同功能。
训练集用于调整模型参数;验证集用于选择模型结构、超参数和训练策略;测试集用于最终评价模型。
例如,可以用一个简单教学案例说明:
8000个训练样本
1000个验证样本
1000个测试样本
这个比例不是固定标准,真正重要的是三者的职责必须清楚。
尤其需要警惕测试集被反复使用。一旦研究者根据测试结果不断调整模型,测试集实际上已经参与了开发过程,也就不再独立。
工程数据中还存在更隐蔽的问题:如果高度相似的结构、同一对象的不同采样或强关联数据分别进入训练集和测试集,模型可能看似泛化良好,实际上只是识别到了近似重复样本。
这就是数据泄漏。
因此,数据划分不是简单随机抽取,而必须结合具体工程问题设计。
五、欠拟合和过拟合反映了两类不同失败
模型训练失败,不只有一种形式。
欠拟合
欠拟合意味着模型没有学到足够有效的规律。
常见表现是:
- 训练集误差较大;
- 测试集误差也较大;
- 模型表达能力不足;
- 输入信息不足;
- 训练过程不充分。
过拟合
过拟合意味着模型对训练数据适应得过于具体。
常见表现是:
- 训练集误差很小;
- 测试集误差明显增大;
- 模型记住了噪声或偶然特征;
- 数据不足以支撑模型复杂度;
- 模型在训练分布外迅速失效。
欠拟合和过拟合不能只靠增加模型规模解决。模型结构、数据规模、数据质量、噪声、任务定义和训练方法都会影响结果。
对工程科研人员来说,最重要的不是记住几个术语,而是形成诊断意识:
模型表现不好时,首先要判断它是没有学会,还是学得过于具体。
六、训练目标不等于工程目标
模型训练时需要优化一个损失函数,例如均方误差。
但训练损失只是算法优化的对象,不一定等于工程应用真正关心的目标。
例如,一个模型整体均方误差很小,可能只是说明大部分样本预测较好,却不能保证最坏样本可接受。平均误差很低,也可能掩盖少数严重失效情况。
在不同问题中,需要关注的指标可能包括:
- 均方误差;
- 平均绝对误差;
- 相对误差;
- 平均相对误差;
- 最大误差;
- 特定物理量偏差;
- 关键频率、峰值或临界点误差。
以谐振频率预测为例,仅考察平均偏差可能不够,还应关注最大偏差。因为少数严重错误可能直接影响设计判断。
因此,需要区分三个层次:
损失函数:模型训练时优化什么
评价指标:模型训练后如何评价
工程目标:最终应用真正关心什么
三者可以一致,但不应被默认视为同一件事。
七、神经网络本质上在学习什么
从最基本的角度看,神经网络是一类参数化函数。
训练过程通过调整大量参数,使它能够近似输入和输出之间的关系。
因此,神经网络首先是一种函数逼近工具。
这并不否认它可以学习复杂结构,也不否认它可以形成高度抽象的表示。问题在于,我们不能因为模型表现复杂,就自动把它解释成对物理规律的完整掌握。
如果训练数据来源于符合物理规律的数值计算或实验,模型学到的映射当然会包含物理规律留下的痕迹。但它获得的是数据中可辨识的规律,而不是自动拥有控制方程、边界条件和适用范围的完整知识。
物理约束机器学习的价值,也应在这个基础上理解。
物理约束不是赋予模型某种神秘的“物理意识”,而是通过损失函数、模型结构、数据生成方式或解空间约束,减少明显违反物理规律的候选结果。
它的作用可以理解为:
在大量可能的映射中,排除一部分不符合物理条件的映射,从而提高数据利用效率和结果可信度。
八、本章七节之间的关系
本章内容按照一条完整逻辑链展开:
AI、机器学习、深度学习与大语言模型
↓
机器学习与传统电磁计算的区别
↓
模型为什么需要泛化
↓
如何用数据划分检验泛化
↓
欠拟合与过拟合为什么发生
↓
如何选择损失函数和评价指标
↓
神经网络本质上学习什么
这七节最终服务于一个统一目标:
建立判断机器学习模型是否可信、是否适用于具体工程任务的基础框架。
九、学完本章应具备哪些能力
完成本章后,读者不需要马上会训练复杂神经网络,但应当能够对一个AI工程方案提出以下问题:
- 它解决的任务到底是什么?
- 输入和输出如何定义?
- 数据是否覆盖实际应用范围?
- 训练数据与目标任务是否相关?
- 模型是在插值还是外推?
- 测试集是否真正独立?
- 是否存在数据泄漏?
- 模型是欠拟合还是过拟合?
- 损失函数是否对应真实工程目标?
- 平均性能是否掩盖了最坏情况?
- 模型是否超出了适用边界?
- 是否有必要加入物理约束?
能够提出这些问题,比简单调用某个AI工具更重要。
因为工程科研人员使用AI的核心能力,不是让模型给出答案,而是判断:
哪些答案值得相信,哪些答案需要验证,哪些答案根本不应被采用。
十、从基础认知走向专业实践
本章结束后,我们将把这套认知框架用于两个实际方向。
第一个方向是专业迁移:
分析AI在电磁工业软件中的应用边界,以及代理模型、参数优化、软件开发辅助和专用大模型等不同方向。
第二个方向是AI协作实践:
从零建设《跟着ChatGPT学AI》网站,把学习内容转化为可以长期维护和公开传播的知识资产。
这两个方向分别回答:
- AI如何进入专业研究;
- AI如何进入真实工作流程。
第一章不是学习的终点,而是后续所有AI实践的判断基础。