直觉化深度学习教程——偏置与激活函数之间的关系

2024-01-23 21:18

本文主要是介绍直觉化深度学习教程——偏置与激活函数之间的关系,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

我们看到成熟的神经网络时,往往能看到偏置 b b b与激活函数Sigmoid或ReLU,但是它们是从何而来的呢?

通过探究,我们将获得更深刻的认识。

文章目录

    • @[toc]
  • 偏置的前世今生
    • 偏置的由来
    • 偏置有什么意义
  • 激活函数的放飞自我
    • 激活函数有什么意义
    • 为什么要用激活函数

偏置的前世今生

偏置的由来

用一张图就能说明白。来吧,少年,接图!
在这里插入图片描述

图1.偏置的前世今生

如果我的图做的有点杂乱,那咱们就稍微用用公式。

回忆一下我们之前讨论过的M-P模型,我们的激活函数 f ( z ) f(z) f(z)是一个以 h h h为阈值的阶跃函数,如公式(1)所示。
f ( z ) = { 1 z ≥ h 0 z < h f(z)=\begin{cases} 1&{z \ge h}\\ 0&{z < h} \end{cases} f(z)={10zhz<h
我们现在对它进行一点小小的变换,如公式(2)。
f ( z − h ) = { 1 z − h ≥ 0 0 z − h < 0 f(z-h)=\begin{cases} 1&{z-h \ge 0}\\ 0&{z-h < 0} \end{cases} f(zh)={10zh0zh<0
这样,我们可以用之前的加权和减去阈值的结果,令 Z Z Z表示新的加权和,代替 z − h z-h zh,则有:
f ( Z ) = { 1 Z ≥ 0 0 Z < 0 f(Z)=\begin{cases} 1&{Z \ge 0}\\ 0&{Z < 0} \end{cases} f(Z)={10Z0Z<0
我们回忆一下,
z = w 1 x 1 + w 2 x 2 + w 3 x 3 z=w_1x_1+w_2x_2+w_3x_3 z=w1x1+w2x2+w3x3
推导,由于 Z = z − h Z=z-h Z=zh,则有 z = Z + h z=Z+h z=Z+h,即新的加权和公式为
Z = w 1 x 1 + w 2 x 2 + w 3 x 3 − h Z=w_1x_1+w_2x_2+w_3x_3-h Z=w1x1+w2x2+w3x3h
由于我们习惯用小写 z z z表示带权和,因此我们就把小写 z z z代替大写 Z Z Z,符号而已,你懂的;另外,由于公式(6)是一个典型的线性变换(严格地说是仿射变换),我们习惯把常数项 h h h叫偏置,且习惯用 b b b表示,我们令 b = − h b=-h b=h。总之,我们把公式(3)和公式(6),放到一起,呈现如下:
z = w 1 x 1 + w 2 x 2 + w 3 x 3 + b f ( z ) = { 1 z ≥ 0 0 z < 0 z=w_1x_1+w_2x_2+w_3x_3+b\\ \\ f(z)=\begin{cases} 1&{z \ge 0}\\ 0&{z < 0} \end{cases} z=w1x1+w2x2+w3x3+bf(z)={10z0z<0
哦了。此时,相当于加权和里多了一个偏置 b b b,可以把它看做是一个恒为常数1的输入上的权重。这时,你再看看图1,是不是豁然开朗?

偏置有什么意义

我们可以总结一下:前世里,那个阈值称为 h h h,归属激活函数,决定了激活函数输出跳变的那个位置;今生里,它换了个反转(即取了个负号)马甲,称为 b b b,投奔到了带权和的麾下,但意义没变

至少有以下三条解读:

  • 偏置表示激活函数被激活的难易程度,偏置越小,带权和z中的 w i x i w_ix_i wixi项的求和结果必须变得非常大,才能使得激活函数输出为1(假设仍为阶跃激活函数),或者被激活(假设为别的激活函数,见后文)。
  • 也可以把偏置是理解为 w 0 w_0 w0,则偏置是最重要的权重!其他权重调得再好,没有好的偏置,都白搭。

激活函数的放飞自我

正是因为有了上面的过程,阈值没了,激活函数可以专注于进行非线性了,而不用再考虑阈值 h h h了。

但是,前面的激活函数 f ( x ) f(x) f(x)是一个阶跃函数,有两个问题:

  • 加权和的强度信息无法传递到下一层
  • 导数为0,反向传播时权重无法更新(个别点不能求导问题不大,只需要给个缺省导数值即可)

所以人们想出了sigmoid函数来近似阶跃函数,后来又发展出tanh函数,ReLU函数。如下面几个图所示。
在这里插入图片描述

图2.sigmoid函数

在这里插入图片描述

图3.tanh函数

在这里插入图片描述

图4.ReLU函数

这些函数的曲线一目了然,网上的公式很多,就不再罗列了。

sigmoid和tanh都会面临在输入加权和非常大、非常小时(即横坐标轴的两端),导数非常小,导致反向传播时的梯度消失问题;而ReLu克服了这一点,它的导数要么为1,不会出现梯度衰减,因此近些年ReLU几乎已经在隐层中全面取代了它的两个前辈。这部分我会在反向传播中详细解释。

看起来:所有的激活函数都是以0点为中心。事实是:在整个训练过程中,一直在随着偏置左右移动,直到训练结束才固定下来,最终也几乎不可能在0点处。

激活函数有什么意义

激活函数相当于对加权和输入的一种选择性投票,例如:

  • Sigmoid

    对所有带权h和,都投支持票。带权和越小,支持力度越小;带权h和越大,支持力度大。

  • Tanh

    对大于0的带权和,投支持票;对小于0的带权和,投反对票。

  • ReLU

    对大于0的带权和,投支持票;对小于0的带权和,弃权。

为什么要用激活函数

提供非线性,这是神经网络可以逼近任意函数的关键!

至于非线性的“扭曲形状”不必care,因为通过充分地训练,损失函数会用"梯度"这个指挥棒,将隐层的权重和输出层的权重”调教“到一组合适的数值,这些权重的组合效应,将会把这个扭曲的超平面,逼近到数据的分类面

这篇关于直觉化深度学习教程——偏置与激活函数之间的关系的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/637555

相关文章

Python中help()和dir()函数的使用

《Python中help()和dir()函数的使用》我们经常需要查看某个对象(如模块、类、函数等)的属性和方法,Python提供了两个内置函数help()和dir(),它们可以帮助我们快速了解代... 目录1. 引言2. help() 函数2.1 作用2.2 使用方法2.3 示例(1) 查看内置函数的帮助(

C++ 函数 strftime 和时间格式示例详解

《C++函数strftime和时间格式示例详解》strftime是C/C++标准库中用于格式化日期和时间的函数,定义在ctime头文件中,它将tm结构体中的时间信息转换为指定格式的字符串,是处理... 目录C++ 函数 strftipythonme 详解一、函数原型二、功能描述三、格式字符串说明四、返回值五

Nexus安装和启动的实现教程

《Nexus安装和启动的实现教程》:本文主要介绍Nexus安装和启动的实现教程,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、Nexus下载二、Nexus安装和启动三、关闭Nexus总结一、Nexus下载官方下载链接:DownloadWindows系统根

java Long 与long之间的转换流程

《javaLong与long之间的转换流程》Long类提供了一些方法,用于在long和其他数据类型(如String)之间进行转换,本文将详细介绍如何在Java中实现Long和long之间的转换,感... 目录概述流程步骤1:将long转换为Long对象步骤2:将Longhttp://www.cppcns.c

Go学习记录之runtime包深入解析

《Go学习记录之runtime包深入解析》Go语言runtime包管理运行时环境,涵盖goroutine调度、内存分配、垃圾回收、类型信息等核心功能,:本文主要介绍Go学习记录之runtime包的... 目录前言:一、runtime包内容学习1、作用:① Goroutine和并发控制:② 垃圾回收:③ 栈和

CnPlugin是PL/SQL Developer工具插件使用教程

《CnPlugin是PL/SQLDeveloper工具插件使用教程》:本文主要介绍CnPlugin是PL/SQLDeveloper工具插件使用教程,具有很好的参考价值,希望对大家有所帮助,如有错... 目录PL/SQL Developer工具插件使用安装拷贝文件配置总结PL/SQL Developer工具插

Java中的登录技术保姆级详细教程

《Java中的登录技术保姆级详细教程》:本文主要介绍Java中登录技术保姆级详细教程的相关资料,在Java中我们可以使用各种技术和框架来实现这些功能,文中通过代码介绍的非常详细,需要的朋友可以参考... 目录1.登录思路2.登录标记1.会话技术2.会话跟踪1.Cookie技术2.Session技术3.令牌技

Python中文件读取操作漏洞深度解析与防护指南

《Python中文件读取操作漏洞深度解析与防护指南》在Web应用开发中,文件操作是最基础也最危险的功能之一,这篇文章将全面剖析Python环境中常见的文件读取漏洞类型,成因及防护方案,感兴趣的小伙伴可... 目录引言一、静态资源处理中的路径穿越漏洞1.1 典型漏洞场景1.2 os.path.join()的陷

Python中bisect_left 函数实现高效插入与有序列表管理

《Python中bisect_left函数实现高效插入与有序列表管理》Python的bisect_left函数通过二分查找高效定位有序列表插入位置,与bisect_right的区别在于处理重复元素时... 目录一、bisect_left 基本介绍1.1 函数定义1.2 核心功能二、bisect_left 与

Android学习总结之Java和kotlin区别超详细分析

《Android学习总结之Java和kotlin区别超详细分析》Java和Kotlin都是用于Android开发的编程语言,它们各自具有独特的特点和优势,:本文主要介绍Android学习总结之Ja... 目录一、空安全机制真题 1:Kotlin 如何解决 Java 的 NullPointerExceptio