显式正则化与 AdamW

使用同一网络比较无显式参数惩罚、\(\ell_1\) 惩罚、\(\ell_2\) 惩罚和 AdamW。训练集用于学习参数,验证集用于比较方案,测试集只评价已经确定的方案。

\(\ell_1\) 与 \(\ell_2\) 惩罚直接加入训练目标,并且本应用只惩罚权重矩阵。AdamW 把权重衰减与 Adam 的自适应梯度更新分开,因此其“总目标”一栏与数据损失相同;权重衰减体现在参数更新中。所有偏置均不参与惩罚或衰减。
验证集 ROC 曲线
训练过程中的数据损失与总目标
训练集与验证集结果
权重汇总
测试集最终评价