人工智能正在迅速进入科研、教学和工程实践。对高校教师、科研人员和工程技术人员来说,今天的问题已经不再是“要不要接触AI”,而是:

应该以什么方式理解AI,才能真正把它用于专业工作,而不是停留在表面使用?

很多人学习AI,往往从工具开始:使用ChatGPT写材料,用大模型查资料,让AI生成代码,或者尝试用神经网络预测某个工程结果。这些做法当然有价值,但如果缺少基本认知框架,很容易出现三个问题。

第一,把AI工具的流畅回答误认为可靠知识;第二,把神经网络的预测结果误认为对物理规律的真正理解;第三,在模型训练指标很好时,过早认为模型已经能够用于真实工程问题。

因此,对工程科研人员而言,学习AI的第一步,不应是掌握更多工具,而应是建立基本判断能力。

本章的任务,就是建立这样一套基础认知框架。


一、为什么工程科研人员不能只学会使用AI工具

人工智能工具的使用门槛越来越低。过去需要专业程序员完成的任务,现在可能通过自然语言就能交给AI处理。表面上看,这似乎意味着技术细节不再重要。

恰恰相反。

工具越容易使用,判断结果是否可信就越重要。

当AI帮助我们整理文献、生成程序、预测工程参数或提出研究方案时,真正困难的部分往往不是“怎样让AI给出结果”,而是:

  • 这个结果依据什么产生;
  • 它在哪些条件下成立;
  • 它是否超出了训练数据覆盖范围;
  • 评价指标是否反映真实工程目标;
  • 模型是否把偶然规律当成了稳定规律;
  • 结果是否违反已知物理约束;
  • 一个任务上有效的方法,能否迁移到另一个任务。

这些问题无法仅靠熟练输入提示词解决。

AI工具可以降低执行门槛,却不会自动消除认识门槛。

工程科研人员真正需要掌握的,不是所有算法细节,而是能够判断:

这个模型究竟解决了什么问题,为什么可能有效,又为什么可能失败。


二、传统科学计算与机器学习的出发点不同

工程科研人员通常熟悉一种经典的问题求解方式:

  1. 明确物理对象;
  2. 建立数学模型;
  3. 写出控制方程和边界条件;
  4. 对方程进行离散;
  5. 使用数值方法求解;
  6. 验证计算结果。

以电磁计算为例,有限元法、时域有限差分法、矩量法等方法,虽然数值实现不同,但都以Maxwell方程及相应的边界条件为基础。

机器学习的出发点则不同。

它通常不是直接从控制方程开始,而是从数据开始。通过大量输入和输出样本,模型调整自身参数,寻找一种能够近似描述输入与输出关系的函数。

二者可以简化为:

传统科学计算:
物理规律 → 数学方程 → 数值求解 → 结果

机器学习:
训练数据 → 参数优化 → 输入输出映射 → 预测

这并不意味着机器学习与物理规律无关,也不意味着机器学习只能机械记忆数据。真正需要理解的是:

机器学习模型通常首先学习的是任务所定义的输入输出映射,而不是天然获得对物理方程的完整理解。

例如,一个利用天线结构参数预测辐射特性的神经网络,即使预测精度很高,也不能因此认定它已经“掌握了电磁学”。它学到的是特定输入、特定输出和特定数据分布下的近似关系。

当任务变成散射、传输或其他物理过程时,原模型不一定能够迁移。问题不只是数据数量够不够,还在于任务映射本身已经发生了变化。

这一点,是工程科研人员理解AI模型边界的起点。


三、模型在训练数据上表现好,并不等于真正有效

机器学习最容易造成误判的地方,是模型在已有数据上表现得很好。

模型可能在训练集上误差很小,图线高度吻合,甚至比传统方法快几个数量级。但真正决定模型价值的问题是:

当它面对没有见过的新样本时,是否仍然有效?

这就是泛化问题。

泛化不是一句“模型可以预测新数据”的口号,而取决于至少两个条件:

1. 数据的覆盖性

训练数据是否覆盖了未来应用中可能出现的重要变化?

例如:

  • 几何参数是否覆盖足够范围;
  • 材料参数是否覆盖实际变化;
  • 工作频段是否完整;
  • 是否包含关键边界情况;
  • 是否遗漏少数但重要的极端样本。

数据数量很多,不代表覆盖充分。大量高度相似的数据,可能只是在狭窄区域内重复采样。

2. 数据的相关性

训练数据是否真正代表未来要解决的问题?

如果训练数据与目标任务之间的物理条件、输入定义、输出定义或数据分布差异很大,即使数据规模很大,也未必有帮助。

因此,不能简单地说“数据越多越好”。更准确的判断是:

有效数据需要同时具备覆盖性和相关性。


四、为什么必须区分训练集、验证集和测试集

为了判断模型是否具有泛化能力,数据不能全部用于训练。

通常需要把数据划分为:

  • 训练集;
  • 验证集;
  • 测试集。

三者承担不同功能。

训练集用于调整模型参数;验证集用于选择模型结构、超参数和训练策略;测试集用于最终评价模型。

例如,可以用一个简单教学案例说明:

8000个训练样本
1000个验证样本
1000个测试样本

这个比例不是固定标准,真正重要的是三者的职责必须清楚。

尤其需要警惕测试集被反复使用。一旦研究者根据测试结果不断调整模型,测试集实际上已经参与了开发过程,也就不再独立。

工程数据中还存在更隐蔽的问题:如果高度相似的结构、同一对象的不同采样或强关联数据分别进入训练集和测试集,模型可能看似泛化良好,实际上只是识别到了近似重复样本。

这就是数据泄漏。

因此,数据划分不是简单随机抽取,而必须结合具体工程问题设计。


五、欠拟合和过拟合反映了两类不同失败

模型训练失败,不只有一种形式。

欠拟合

欠拟合意味着模型没有学到足够有效的规律。

常见表现是:

  • 训练集误差较大;
  • 测试集误差也较大;
  • 模型表达能力不足;
  • 输入信息不足;
  • 训练过程不充分。

过拟合

过拟合意味着模型对训练数据适应得过于具体。

常见表现是:

  • 训练集误差很小;
  • 测试集误差明显增大;
  • 模型记住了噪声或偶然特征;
  • 数据不足以支撑模型复杂度;
  • 模型在训练分布外迅速失效。

欠拟合和过拟合不能只靠增加模型规模解决。模型结构、数据规模、数据质量、噪声、任务定义和训练方法都会影响结果。

对工程科研人员来说,最重要的不是记住几个术语,而是形成诊断意识:

模型表现不好时,首先要判断它是没有学会,还是学得过于具体。


六、训练目标不等于工程目标

模型训练时需要优化一个损失函数,例如均方误差。

但训练损失只是算法优化的对象,不一定等于工程应用真正关心的目标。

例如,一个模型整体均方误差很小,可能只是说明大部分样本预测较好,却不能保证最坏样本可接受。平均误差很低,也可能掩盖少数严重失效情况。

在不同问题中,需要关注的指标可能包括:

  • 均方误差;
  • 平均绝对误差;
  • 相对误差;
  • 平均相对误差;
  • 最大误差;
  • 特定物理量偏差;
  • 关键频率、峰值或临界点误差。

以谐振频率预测为例,仅考察平均偏差可能不够,还应关注最大偏差。因为少数严重错误可能直接影响设计判断。

因此,需要区分三个层次:

损失函数:模型训练时优化什么
评价指标:模型训练后如何评价
工程目标:最终应用真正关心什么

三者可以一致,但不应被默认视为同一件事。


七、神经网络本质上在学习什么

从最基本的角度看,神经网络是一类参数化函数。

训练过程通过调整大量参数,使它能够近似输入和输出之间的关系。

因此,神经网络首先是一种函数逼近工具。

这并不否认它可以学习复杂结构,也不否认它可以形成高度抽象的表示。问题在于,我们不能因为模型表现复杂,就自动把它解释成对物理规律的完整掌握。

如果训练数据来源于符合物理规律的数值计算或实验,模型学到的映射当然会包含物理规律留下的痕迹。但它获得的是数据中可辨识的规律,而不是自动拥有控制方程、边界条件和适用范围的完整知识。

物理约束机器学习的价值,也应在这个基础上理解。

物理约束不是赋予模型某种神秘的“物理意识”,而是通过损失函数、模型结构、数据生成方式或解空间约束,减少明显违反物理规律的候选结果。

它的作用可以理解为:

在大量可能的映射中,排除一部分不符合物理条件的映射,从而提高数据利用效率和结果可信度。


八、本章七节之间的关系

本章内容按照一条完整逻辑链展开:

AI、机器学习、深度学习与大语言模型

机器学习与传统电磁计算的区别

模型为什么需要泛化

如何用数据划分检验泛化

欠拟合与过拟合为什么发生

如何选择损失函数和评价指标

神经网络本质上学习什么

这七节最终服务于一个统一目标:

建立判断机器学习模型是否可信、是否适用于具体工程任务的基础框架。


九、学完本章应具备哪些能力

完成本章后,读者不需要马上会训练复杂神经网络,但应当能够对一个AI工程方案提出以下问题:

  1. 它解决的任务到底是什么?
  2. 输入和输出如何定义?
  3. 数据是否覆盖实际应用范围?
  4. 训练数据与目标任务是否相关?
  5. 模型是在插值还是外推?
  6. 测试集是否真正独立?
  7. 是否存在数据泄漏?
  8. 模型是欠拟合还是过拟合?
  9. 损失函数是否对应真实工程目标?
  10. 平均性能是否掩盖了最坏情况?
  11. 模型是否超出了适用边界?
  12. 是否有必要加入物理约束?

能够提出这些问题,比简单调用某个AI工具更重要。

因为工程科研人员使用AI的核心能力,不是让模型给出答案,而是判断:

哪些答案值得相信,哪些答案需要验证,哪些答案根本不应被采用。


十、从基础认知走向专业实践

本章结束后,我们将把这套认知框架用于两个实际方向。

第一个方向是专业迁移:

分析AI在电磁工业软件中的应用边界,以及代理模型、参数优化、软件开发辅助和专用大模型等不同方向。

第二个方向是AI协作实践:

从零建设《跟着ChatGPT学AI》网站,把学习内容转化为可以长期维护和公开传播的知识资产。

这两个方向分别回答:

  • AI如何进入专业研究;
  • AI如何进入真实工作流程。

第一章不是学习的终点,而是后续所有AI实践的判断基础。