勘误反馈
如果对本博客文章有任何问题(如探讨、建议、文字或逻辑错误等)都可以给我发邮件:
- 邮件标题:[wds博客问题反馈] - 希望在XXX文章增加一些细节的补充
- 邮件地址:8851970@qq.com
2026年在更新中的两篇长文
勘误反馈
如果对本博客文章有任何问题(如探讨、建议、文字或逻辑错误等)都可以给我发邮件:
2026年在更新中的两篇长文
系列文章见: 《回忆AI时代-从图灵机到人工智能》
假设你每天都会根据一些因素决定是否骑车,我们希望训练一个BP神经网络来学习你的决策习惯。
1 | import numpy as np |
整个训练过程:
1 | 训练开始 |
系列文章见: 《回忆AI时代-从图灵机到人工智能》
2023年发生了两件足以改变AI历史的大事“大模型进入多模态时代”和“图片生成进入全民时代”
多模态(Multimodality)顾名思义就是让人工智能能够理解和处理多种类型的数据,包括但不限于文本、图像、音频、视频等。换句话说,人类通过眼睛看图像、耳朵听声音、语言进行交流来获取信息,而AI也开始逐步具备类似的感知与理解能力,不再局限于处理单一的文本数据。
2023年被普遍认为是“大模型多模态时代”的起点,在2023年之前大多数大模型还是单模态,如:
2023年3月OpenAI发布了GPT-4,首次赋予大模型强大的视觉理解能力,使其能够同时处理文本与图像,标志着多模态能力正式进入大众视野。
同年Google发布了Gemini,从设计之初便采用原生多模态(Native Multimodal)架构,在训练阶段就将文本、图像、音频、视频等多种数据统一融合,而不是将多个单一模型简单拼接。这意味着AI开始能够像人类一样,对来自不同感官的信息进行综合理解与推理。
我们在使用大模型时,不只可以文本聊天,还可以与他语音对话、上传一些图片识别内容,这也带来了很多的应用场景,譬如:
系列文章见: 《回忆AI时代-从图灵机到人工智能》
2022年11月,一个名叫ChatGPT的产品上线,短短两个月,它突破一亿用户,成为互联网历史上增长最快的应用。许多人第一次感受到机器似乎真的开始“思考”了。
ChatGPT(GPT的全称是Generative Pre-trained Transformer,生成式预训练Transformer模型)是OpenAI公司的产品,目前ChatGPT迭代的版本:
| 时间 | 模型 | 主要突破 |
|---|---|---|
| 2018 | GPT-1 | 提出预训练 + 微调范式 |
| 2019 | GPT-2 | 参数大幅增长,生成能力显著提升 |
| 2020 | GPT-3 | 1750 亿参数,Few-shot Learning |
| 2022 | InstructGPT | 引入 RLHF,更好遵循人类指令 |
| 2022 | ChatGPT | 将大语言模型以对话形式带给大众 |
| 2023 | GPT-4 | 推理能力增强,支持图像理解 |
| 2024 | GPT-4o | 原生多模态,实时语音与视觉交互 |
| 2025 | GPT-4.1 | 提升编程、长上下文和开发者体验 |
| 2025 | GPT-5 | 综合推理、工具调用和多模态能力进一步提升 |
OpenAI成立于2015年总部位于美国旧金山,最初是一家人工智能研究机构,目标是推动人工智能技术的发展并让人工智能能够造福全人类
系列文章见: 《回忆AI时代-从图灵机到人工智能》
我们让计算机判断今天适不适合去七骑车?用感知机的案例。在之前的案例中,程序员把权重w = np.array([2.0, 0.8, 3.0])写到程序中,但实际这里不应该由程序员写到程序中,而是需要给计算机大量历史数据,让它自己学习,譬如:
| 天气 | 周末 | 身体 | 是否骑车 |
|---|---|---|---|
| 1 | 1 | 1 | 1 |
| 1 | 0 | 1 | 1 |
| 0 | 1 | 1 | 0 |
| 0 | 0 | 1 | 0 |
| 1 | 1 | 0 | 0 |
| 0 | 0 | 0 | 0 |
系列文章见: 《回忆AI时代-从图灵机到人工智能》
假如,我们让计算机判断今天适不适合去七骑车?用M-P神经元的案例,我们给神经元三个输入X1、X2、X3,如果神经元会输出0~1间,譬如0.95 非常适合汽车。以下为Python示例。
1 | import numpy as np |
案例解释:
| 输入 | 含义 | 当前值 |
|---|---|---|
| x1 | 天气晴 | 1 |
| x2 | 周末 | 1 |
| x3 | 身体状态好 | 1 |
结构:
1 | x1 ----\ |
| 输入 | 权重 | 含义 |
|---|---|---|
| x1 | 2.0 | 天气 |
| x2 | 0.8 | 周某 |
| x3 | 3.0 | 身体状态 |
1 | 1 × 2.0 |
1 | 加权和: 5.8 |
表示适合骑行。
骑行案例,条件越好,越适合骑车。这里符合一种规律好的因素越多,结果越偏向"适合骑车。
| 天气 | 周末 | 身体 | 是否适合骑车 |
|---|---|---|---|
| 晴 | 是 | 好 | ✅ |
| 晴 | 否 | 好 | ✅ |
| 雨 | 否 | 差 | ❌ |
所以通过神经元画一条分界线就能区分:
1 | 适合骑车 |
系列文章见: 《回忆AI时代-从图灵机到人工智能》
RNN(Recurrent Neural Network,循环神经网络)是一种专门用于处理序列数据的神经网络,它最大的特点就是具有记忆能力,能够利用之前的信息来理解当前的信息。
譬如,我们让计算机理解这句话今天天气很好,对于人来说我们按顺序阅读今天 → 天气 → 很好当看到”很好”时,我们的大脑已经记住了前面的”今天”和”天气”,因此能够理解整句话,如果只看到最后两个字很好你并不知道到底是什么很好。
因此语言的理解依赖上下文,而上下文本质上就是一种”记忆”,RNN正是为了解决这个问题而设计的。