人工智能已经成为一个高度普及的概念。ChatGPT、大模型、机器学习、深度学习等术语经常同时出现,也常被混在一起使用。于是,初学者容易形成一种模糊印象:人工智能就是ChatGPT,机器学习就是神经网络,大语言模型代表了人工智能的全部。
这种理解并不准确。对工程科研人员而言,学习AI的第一步不是立即进入算法细节,而是先建立概念地图:这些概念分别处于什么层级,通过什么方式解决问题,彼此又是什么关系。
本节重点回答:
人工智能、机器学习、深度学习和大语言模型分别是什么,它们之间是什么关系?
一、人工智能是最上位的宽泛领域
人工智能通常是指让机器表现出某些通常需要人类智能才能完成的能力,例如感知、识别、推理、决策、控制和内容生成。图像识别、机器人控制、工业故障诊断、下棋程序和大语言模型都可以属于人工智能系统,但它们的任务和技术路线并不相同。
因此,人工智能不是某一种算法,也不是某一个软件,而是一个范围广泛的研究与应用领域。它更接近一个总目标:
如何让机器完成具有一定感知、学习、推理、决策或生成能力的任务。
不同人工智能系统实现这一目标的方式并不相同。有的系统根据人预先编写的规则进行推理,有的系统从数据中训练模型,还有的系统把规则、搜索、优化和学习方法结合起来。因此,判断一个系统属于人工智能,并不意味着它一定使用了神经网络。
由人编写规则的专家系统,也可以根据预设条件完成判断。机器学习是实现人工智能的重要方法,但不是唯一方法。
二、机器学习是实现人工智能的一类重要方法
规则系统依赖人明确写出判断条件,机器学习则让算法从数据中调整模型,形成预测或判断能力。
例如,要根据天线结构预测谐振频率,可以准备如下样本:
输入:天线尺寸、材料参数、馈电位置
输出:谐振频率
算法利用这些样本调整模型参数,使模型能够对新的输入给出预测。这个过程可以概括为:
数据
↓
学习算法
↓
模型
↓
预测或判断
这里的“学习”并不表示机器像人一样理解知识,而是指算法通过数据调整参数,使误差减小或任务表现提高。
机器学习可以解决不同类型的问题。例如,判断设备是否发生故障属于分类,预测设备剩余寿命属于回归,将相似实验样本自动归组属于聚类。任务不同,适用的模型和评价方式也会不同。
机器学习还包含线性回归、决策树、支持向量机和神经网络等多种方法。神经网络只是其中一类。在数据量有限、变量关系相对清楚或解释性要求较高时,简单模型可能更适合。
因此,机器学习的核心不是使用某种特定模型,而是利用数据和学习算法形成完成具体任务的模型。
三、深度学习是机器学习中的一类方法
深度学习主要指以多层神经网络为基础的一类机器学习方法。“深度”通常表示网络具有较多计算层次,能够把原始输入逐步转换为更抽象的内部表示。
以图像识别为例,多层网络可能从像素中逐步形成边缘、纹理、局部形状和物体类别等表示。这些表示不是由人逐条写入,而是在训练过程中形成的。
深度学习能够从复杂、高维数据中学习有效表示,因此在图像、语音和自然语言处理中得到广泛应用。它的发展也依赖大规模数据、较强计算能力、有效训练方法和成熟软件工具等条件。
这些能力伴随着相应代价:深度学习通常需要更多数据和计算资源,模型更加复杂,结果也更难解释。它是机器学习的重要分支,不是所有机器学习方法的统称,更不是适用于所有任务的通用答案。
四、大语言模型与ChatGPT处于什么位置
大语言模型是主要处理和生成自然语言的一类大型深度学习模型。现代大语言模型通常建立在Transformer架构上,通过大量文本训练,学习语言中的统计规律、结构关系和上下文关联。
模型训练中的一个基本任务,是根据已有上下文预测后续内容。当模型、数据和训练规模达到一定程度后,这种能力可以进一步支持问答、总结、翻译、写作和代码生成等任务。
“预测后续内容”并不意味着大语言模型只是简单地拼接文字。模型可以形成复杂的内部表示,处理上下文关系并表现出一定的分析和推理能力。但语言表达流畅仍不能自动证明事实、推理过程和最终结论可靠。
大语言模型属于深度学习模型,但深度学习还包括图像、语音、科学计算等许多其他模型;人工智能的范围则更加广泛。
ChatGPT也不等于大语言模型本身。它是基于大语言模型构建的AI产品,除底层模型外,还包括对话界面、系统指令、安全机制、工具调用和文件处理等产品能力。
可以作一个直观类比:
大语言模型类似发动机,ChatGPT类似围绕发动机建立的一套完整产品系统。
这个类比不是严格定义,但说明了模型与产品的区别。同一个底层模型可以服务于不同产品,一个产品呈现的能力也不完全等于底层模型本身的能力。人工智能则远不止ChatGPT。
五、用统一框架理解四者关系
四个核心概念可以用包含关系表示:
人工智能
├── 规则系统等其他技术路线
└── 机器学习
├── 线性模型、树模型等方法
└── 深度学习
└── 大语言模型
这一结构表达的是概念层级:人工智能是最上位领域;机器学习是实现人工智能的一类重要方法;深度学习是机器学习中的一类方法;大语言模型通常建立在深度学习基础上。
这张图并不表示人工智能只有机器学习这一条路线,也不表示深度学习只有语言模型。它只是从复杂技术体系中抽出一条与本节主题有关的包含关系。
ChatGPT是基于大语言模型构建的产品,不是与上述四个概念并列的算法类别。因而不能把它们写成彼此等价的关系:
ChatGPT = 大语言模型 = 深度学习 = 机器学习 = 人工智能
六、几个常见误区
第一个误区是把机器学习等同于神经网络。机器学习包含多种方法,在数据量不大、关系相对清楚或解释性要求较高时,线性模型、树模型等简单方法可能更合适。模型复杂不等于更适合具体任务。
第二个误区是把大语言模型视为人工智能的全部。语言模型主要面向语言及相关任务,而机器人控制、图像识别和电磁代理模型可能使用完全不同的数据、模型和系统架构。
第三个误区是根据技术名称判断方案先进性。“采用深度学习”或“使用大模型”不能自动证明方案有效。真正需要说明的是任务是什么、为什么需要这一方法、数据从哪里来、模型解决了哪个环节,以及结果如何验证。
第四个误区是把语言流畅等同于结果可靠。大语言模型能够生成结构完整的解释,但流畅表达不能证明事实、推理和结论一定正确。语言越自然,人越容易忽略核查,因此工程应用仍需要独立验证。
这些误区的共同问题,是用一个宽泛技术标签代替对具体任务和证据的分析。
七、工程科研人员的认识修正
初步认识:
AI主要就是ChatGPT;需要使用AI时,选择先进的大模型或神经网络即可。
这一认识把产品、模型、方法和领域混在了一起,也忽略了具体任务。
更准确的认识是:
ChatGPT是基于大语言模型构建的AI产品;大语言模型属于深度学习,深度学习属于机器学习,机器学习则是实现人工智能的一类重要方法。选择技术时,应从任务和证据出发,而不是从“AI”标签出发。
对工程科研人员而言,比追问“这是不是AI”更有价值的问题是:
- 系统具体完成什么任务;
- 输入和输出是什么;
- 为什么需要机器学习;
- 结果如何验证。
这套问题不是要求在本节提前讨论完整的模型评价方法,而是帮助我们把概念层级落实到具体工程任务中。只有明确系统解决什么问题,才有可能进一步讨论数据、模型和验证。
这样,人工智能就不再是一个模糊的宏大名词,而成为可以分析和验证的技术系统。
八、本节小结
本节需要记住五点:
- 人工智能是范围最广的上位领域;
- 机器学习是实现人工智能的一类重要方法;
- 深度学习是机器学习中以多层神经网络为基础的一类方法;
- 大语言模型通常建立在深度学习基础上;
- ChatGPT是基于大语言模型构建的AI产品,不等于人工智能的全部。
理解这些层级之后,下一个问题自然出现:机器学习依靠数据形成模型,而传统电磁计算从物理方程出发,二者得到结果的方式和可信性依据有什么不同?
这就是下一节要讨论的核心:
机器学习与传统电磁计算到底有什么本质区别?