前向传播本质是矩阵乘加与激活函数的组合。需确保输入与权重形状匹配、偏置正确广播、激活函数处理批量输入并保证数值稳定,且必须缓存中间变量供反向传播使用。

前向传播的核心就是矩阵乘加 + 激活函数
前向传播不是黑箱,它本质是层层套娃的 np.dot(X, W) + b 加上一个非线性函数。只要输入形状对得上、权重初始化合理、激活函数选得准,就能跑通。关键不是“能不能”,而是“哪一步容易错”。
输入和权重的 shape 必须严格匹配
常见错误是 X.shape 和 W.shape 维度不兼容,导致 ValueError: matmul: Input operand 1 has a mismatch in its core dimension 0。NumPy 的 np.dot 要求前一个数组的最后一个维度等于后一个数组的倒数第二个维度。
- 若输入一批样本:
X形状应为(batch_size, input_dim),W1应为(input_dim, hidden_size),结果z1才是(batch_size, hidden_size) -
b必须是行向量(如(1, hidden_size)),靠 NumPy 广播机制自动加到每行;用列向量(hidden_size, 1)会触发广播异常或计算错位 - 验证方法:打印
X.shape、W1.shape、b1.shape,三者相加前确保np.dot(X, W1).shape == b1.shape或可广播
激活函数必须处理批量输入,且注意数值稳定性
单个样本写的 relu(z) 直接套用到 batch 上没问题,但 softmax(z) 若不减去每行最大值,极易出现 exp(1000) → inf → 全输出 nan。
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
-
relu可直接用np.maximum(0, z),安全高效 -
sigmoid在z绝对值较大时会下溢/上溢,可用np.where(z >= 0, 1 / (1 + np.exp(-z)), np.exp(z) / (1 + np.exp(z)))避免 -
softmax务必加z - np.max(z, axis=1, keepdims=True)再算exp,否则训练中途就崩
缓存中间变量是反向传播的前提,但前向传播里常被忽略
前向传播函数如果只返回 y_pred,后续反向传播时就拿不到 z1、a1 等中间值——而这些是链式求导必需的。很多初学者卡在这儿,以为前向传播“做完就完事了”。
- 哪怕当前只做前向推理,也建议返回字典形式的缓存,如
{"z1": z1, "a1": a1, "z2": z2} - 缓存变量名要和公式一致(比如
z1是线性输出,a1是激活后输出),避免后期反向时混淆 - 如果用类封装网络,把
cache存为实例属性更稳妥,比每次函数返回再传参不易出错
真正麻烦的不是写对第一层,而是第 N 层的 W 和 b shape 是否与前一层 a 的输出维度咬合,以及 softmax 那行减最大值的代码有没有漏掉——这两处一错,整个前向就静默失效,输出全是 nan 或全零。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










