莫烦强化学习视频笔记:第一节 1.1 什么是强化学习

2024-01-23 18:38

本文主要是介绍莫烦强化学习视频笔记:第一节 1.1 什么是强化学习,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

目录

1. 如何学习?

2. 强化学习有哪些算法?


我们人类在进行学习时,总是从一开始什么都不知道,经过不断的尝试与纠错,最终获得正确解决问题方法的过程,这就可以看作一个强化学习过程
实际,强化学习的例子很多:

  • Alpha-Go在围棋场上战胜人类的高手 Alpha-Go 百度百科

Alpha-Go在围棋场上

  • 让计算机学习如何玩一些经典的游戏,如Atari游戏:

    Atari Break-Out 游戏

这些都是让计算机不断地尝试并学习行为准则,以赢得围棋棋局或者在打砖块游戏中得到高分。

1. 如何学习?

想象此刻有一个虚拟的老师正在教计算机如何学习,但是他只能够为你的行为打分。那么如何通过这些分数来学习呢?很简单,通过记住高分、低分分别对应的行为,在学习中避免低分行为,在行为中总结经验。此特性可以称为分数导向性

更进一步的,在监督学习中,我们在一开始就能够获得数据和标签。在强化学习中,我们也需要得到数据和标签,但是一开始并没有数据和标签,是通过一次次与环境交互产生行为,并获得对应的标签,再学习哪些数据能够对应上哪些标签,通过学习这种规律,来获取能够获得高分的行为。如下面这个例子:

强化学习过程 来自莫烦Python

  1. 实际上,一开始是一张空白的桌子(很像Windows纸牌游戏的桌子😅),只有数据和标签两个部分。我们的目的是尽量做一些开心的表情,以获得更高的分数。
  2. 我们不断做表情(假设我们不知道什么表情是开心的(高分)或伤心的(低分)),“虚拟老师”会告诉我们你的表情是低分还是高分(也就是标签),这样我们就会获得很多数据标签啦。
  3. 我们通过大量做表情得到标签并从中获取一定的规律,你经过惨痛教训后,会发现做🙂就会高分,做😟就会低分。
  4. 你为了获得高分,就会一直做🙂。

2. 强化学习有哪些算法?

强化学习的算法有很多种,例如:

  • 通过价值选行为:Q-Learning、Sarsa学习(这两种都是用表格的方式,也就是数据离散)、DQN(Deep Q Network 使用神经网络)
  • 直接选行为:Policy Gradients(策略梯度)
  • 想象环境并从中学习(这个真的🐂🍺了,环境都没有的):基于模型的强化学习(Model Based RL)

这篇关于莫烦强化学习视频笔记:第一节 1.1 什么是强化学习的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/637170

相关文章

Python+FFmpeg实现视频自动化处理的完整指南

《Python+FFmpeg实现视频自动化处理的完整指南》本文总结了一套在Python中使用subprocess.run调用FFmpeg进行视频自动化处理的解决方案,涵盖了跨平台硬件加速、中间素材处理... 目录一、 跨平台硬件加速:统一接口设计1. 核心映射逻辑2. python 实现代码二、 中间素材处

Vue3视频播放组件 vue3-video-play使用方式

《Vue3视频播放组件vue3-video-play使用方式》vue3-video-play是Vue3的视频播放组件,基于原生video标签开发,支持MP4和HLS流,提供全局/局部引入方式,可监听... 目录一、安装二、全局引入三、局部引入四、基本使用五、事件监听六、播放 HLS 流七、更多功能总结在 v

Unity新手入门学习殿堂级知识详细讲解(图文)

《Unity新手入门学习殿堂级知识详细讲解(图文)》Unity是一款跨平台游戏引擎,支持2D/3D及VR/AR开发,核心功能模块包括图形、音频、物理等,通过可视化编辑器与脚本扩展实现开发,项目结构含A... 目录入门概述什么是 UnityUnity引擎基础认知编辑器核心操作Unity 编辑器项目模式分类工程

Python学习笔记之getattr和hasattr用法示例详解

《Python学习笔记之getattr和hasattr用法示例详解》在Python中,hasattr()、getattr()和setattr()是一组内置函数,用于对对象的属性进行操作和查询,这篇文章... 目录1.getattr用法详解1.1 基本作用1.2 示例1.3 原理2.hasattr用法详解2.

Nginx禁用TLSv1.0 1.1改为TLSv1.2 1.3的操作方法

《Nginx禁用TLSv1.01.1改为TLSv1.21.3的操作方法》使用MozillaSSL配置工具生成配置,修改nginx.conf的ssl_protocols和ssl_ciphers,通... 目录方法一:方法二:使用 MoziChina编程lla 提供的 在线生成SSL配置工具,根据自己的环境填充对应的

Python使用OpenCV实现获取视频时长的小工具

《Python使用OpenCV实现获取视频时长的小工具》在处理视频数据时,获取视频的时长是一项常见且基础的需求,本文将详细介绍如何使用Python和OpenCV获取视频时长,并对每一行代码进行深入解析... 目录一、代码实现二、代码解析1. 导入 OpenCV 库2. 定义获取视频时长的函数3. 打开视频文

Go学习记录之runtime包深入解析

《Go学习记录之runtime包深入解析》Go语言runtime包管理运行时环境,涵盖goroutine调度、内存分配、垃圾回收、类型信息等核心功能,:本文主要介绍Go学习记录之runtime包的... 目录前言:一、runtime包内容学习1、作用:① Goroutine和并发控制:② 垃圾回收:③ 栈和

Android学习总结之Java和kotlin区别超详细分析

《Android学习总结之Java和kotlin区别超详细分析》Java和Kotlin都是用于Android开发的编程语言,它们各自具有独特的特点和优势,:本文主要介绍Android学习总结之Ja... 目录一、空安全机制真题 1:Kotlin 如何解决 Java 的 NullPointerExceptio

重新对Java的类加载器的学习方式

《重新对Java的类加载器的学习方式》:本文主要介绍重新对Java的类加载器的学习方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录1、介绍1.1、简介1.2、符号引用和直接引用1、符号引用2、直接引用3、符号转直接的过程2、加载流程3、类加载的分类3.1、显示

Java学习手册之Filter和Listener使用方法

《Java学习手册之Filter和Listener使用方法》:本文主要介绍Java学习手册之Filter和Listener使用方法的相关资料,Filter是一种拦截器,可以在请求到达Servl... 目录一、Filter(过滤器)1. Filter 的工作原理2. Filter 的配置与使用二、Listen