artificial-intelligence - 马尔可夫决策过程问题-6ren

artificial-intelligence - 马尔可夫决策过程问题

转载作者：行者123 更新时间：2023-12-04 12:25:38

31

4

关闭。这个问题需要debugging details .它目前不接受答案。

想改善这个问题吗？更新问题，使其成为 on-topic对于堆栈溢出。

7年前关闭。

Improve this question

alt text http://img693.imageshack.us/img693/724/markov.png

我对这里的一些观点有点困惑:

说他尝试给定 Action 的 70% 的时间都会成功是什么意思？这是否意味着每次他尝试执行 Action A 时，70% 的时间都会执行该 Action A，而另外 30% 的时间会执行导致相同状态的 Action ，或者就好像他一直都在做行动 A，但只有 30% 的时候他不这样做？我希望我说清楚:(

怎么可能有多个具有相同效用的连续状态？理论上，效用不应该总是减少，你离有奖励的状态越远？

只知道我上面提供的信息，
是否有可能推断出什么是
折扣因子( Gamma )？如果是，如何？

是否可以计算
国家的奖励？如何？

最佳答案

有一种处理大多数 MDP 问题的模式，但我认为您可能在问题描述中遗漏了一些信息，很可能与您试图达到的状态或一集结束的方式有关(什么如果你跑出网格的边缘，就会发生这种情况)。我已尽力回答您的问题，但我已附上有关我用来处理此类问题的过程的入门。

首先，效用是一个相当抽象的衡量你想要处于给定状态的程度。即使您使用简单的启发式方法(欧几里德距离或曼哈顿距离)来衡量效用，也绝对可以拥有具有相同效用的两个状态。在这种情况下，我假设效用值(value)和奖励是可以互换的。

从长远来看，这些类型问题的目标往往是，您如何最大化您的预期(长期)返回？学习率 gamma 控制您对当前状态的重视程度与您希望结束的位置 - 实际上，您可以将 gamma 视为一个范围，从“在此时间步中做对我最有利的事情”到在另一个极端“探索我所有的选择，然后回到最好的选择”。萨顿和巴托在那里预订 reinforcement learning有一些非常好的explanations这是如何工作的。

在开始之前，请回顾问题并确保您可以自信地回答以下问题。

什么是状态？有多少个州？

什么是 Action ？有多少 Action ？

如果您从状态 u 开始，并应用一个 Action a，那么到达新状态 v 的概率是多少？

那么问题的答案呢？

状态是向量 (x,y)。网格是 5 x 5，所以有 25 个状态。

有四种可能的操作，{E,N,S,W}

应用合适的 Action 后成功到达相邻状态的概率为0.7，不动的概率(保持在同一状态为0.3)。假设 (0,0) 是左上角的单元格，(4,4) 是右下角的单元格，下表显示了所有可能转换的一小部分。

开始状态 Action 最终状态概率
-------------------------------------------------- ——
(0,0) E (0,0) 0.3
(0,0) E (1,0) 0.7
(0,0) E (2,0) 0
...
(0,0) E (0,1) 0
...
(0,0) E (4,4) 0
(0,0) N (0,0) 0.3
...
(4,4) 宽 (3,4) 0.7
(4,4) 宽 (4,4) 0.3

我们如何检查这对这个问题是否有意义？

检查该表是否具有适当数量的条目。在 5 x 5 的网格上有 25 个状态和 4 个 Action ，因此该表应该有 100 个条目。

检查以确保对于开始状态/ Action 对，只有两个条目具有非零发生概率。

编辑。响应对目标状态的转移概率的请求。下面的符号假设

v 是最终状态

u 是源状态

a 是 Action ，如果没有提及，则暗示所应用的 Action 不相关。

关于artificial-intelligence - 马尔可夫决策过程问题，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/2148345/

31

4

0

文章推荐： Firefox 忽略图像上的百分比高度

文章推荐： SQL:搜索具有给定值的列列表(在一行中)

文章推荐： r - 使用 `subset` 函数按列名进行矩阵子集化

文章推荐： R CMD 检查 ggplot、子集等的注意事项

artificial-intelligence - 我应该为这个神经网络使用哪个激活函数？
我们正在为跳棋游戏开发神经网络。在我们的训练数据中， 0代表空白单元格，1代表白 block ，-1代表白王，2代表黑 block ，-2代表黑王因此，我们需要的是范围为 [-2, 2] 的激活函数
artificial-intelligence - 什么时候一种启发式比另一种更好？
我回答了一个问题，其中给出了两个启发式算法，要对其进行 A* 以找到从起始状态到目标状态的路径。其中一种启发式方法通过减少一个节点的扩展找到了一条路径 - 现在出于这个原因，我们可以说这种启发式方法
artificial-intelligence - 哪种是编写网络机器人的最佳编程语言？
就目前而言，这个问题不适合我们的问答形式。我们希望答案得到事实、引用资料或专业知识的支持，但这个问题可能会引发辩论、争论、投票或扩展讨论。如果您觉得这个问题可以改进并可能重新打开，visit the
artificial-intelligence - C中的逻辑编程
我正在尝试用 C 语言实现一些 AI 规划算法，但被基本概念困住了 :) 在跳到主要问题之前，我尝试实现一些支持命题逻辑的小框架: FORMULA f = PROPOSITION(a + 3 > 0)
artificial-intelligence - 决策树是试图最大化信息增益还是熵？
我知道决策树试图将具有高熵的分类器放在决策树上。然而，信息增益如何发挥作用呢？信息增益定义为: InformationGain = EntropyBefore - EntropyAfter 决策树是
artificial-intelligence - 如何应用梳子法？
我正在研究梳子方法，以减少模糊逻辑规则的“组合爆炸”。有一个示例，摘自“Programming Game AI from example”(由 Mat Buckland 撰写): The theory
artificial-intelligence - 我在哪里可以通过真实世界示例获得对所有人工智能技术的非常简单的介绍
我知道人工智能领域非常广阔，有很多关于它的书籍。但我只想知道我可以得到所有人工智能技术的简单介绍的任何资源，例如它希望有 1 或 2 页的介绍所有技术及其示例，说明如何应用它们或将它们用于什么目的。
artificial-intelligence - 当蒙特卡罗树搜索达到内存限制时该怎么办
我最近对游戏中应用的蒙特卡罗树搜索产生了兴趣。我读过几篇论文，但我使用“蒙特卡罗树搜索”Chaslot, G 的博士论文，因为我发现它更容易理解蒙特卡罗树搜索的基础知识我试图对其进行编码，但遇到了
artificial-intelligence - 学习概率图形模型的好资源
我最近开始在 coursera 上学习概率图形模型，开始后 2 周我开始相信我在概率方面不是那么好，因此我什至无法关注第一个主题(贝叶斯网络)。话虽如此，我想努力学习这门类(class)，所以您能否向
artificial-intelligence - 识别数字序列中的模式
我觉得这应该是AI的问题。是否有任何算法可以在给定任何数字序列的情况下找到模式？模式可以是抽象的，因为它可以是... 例如: 12112111211112 ... ( increasing num
artificial-intelligence - 确定神经网络感知器的偏差？
这是我了解神经网络开始的一件事，是我不太了解最初要设置“偏见”的原因吗？我了解Perceptron会根据以下内容计算其输出： P * W + b> 0 然后可以基于b = b + [G-O]计算学习
artificial-intelligence - 连续蛇游戏的神经网络帮助
我正在尝试为“连续蛇”游戏实现 AI。它与普通的蛇游戏非常不同，至少就 AI 而言。基本上，蛇的驾驶方式有点像汽车，两个玩家中第一个撞上他的踪迹或另一个人的踪迹输掉比赛。此外，屏幕环绕其边框。如果您
artificial-intelligence - 什么是启发式函数
有人可以用非常简单的词来解释它是什么。也提供一个例子。因此，例如，如果您必须找到某事物的启发式函数，它应该是什么样子的？以问题为例: 对于水壶问题http://www.math.tamu.edu/~
artificial-intelligence - 在文本中查找相关词的算法
我想要一个词(例如“Apple)并处理一个文本(或者更多)。我想提出相关的术语。例如:处理Apple的文档并发现iPod，iPhone，Mac是与“苹果”相关的术语。关于如何解决这个问题的任何想法？
artificial-intelligence - 用于人脑模拟的开源软件
关闭。这个问题不满足Stack Overflow guidelines .它目前不接受答案。想改善这个问题吗？更新问题，使其成为 on-topic对于堆栈溢出。 6年前关闭。 Improve thi
artificial-intelligence - 马尔可夫决策过程问题
关闭。这个问题需要debugging details .它目前不接受答案。想改善这个问题吗？更新问题，使其成为 on-topic对于堆栈溢出。 7年前关闭。 Improve this questio
artificial-intelligence - 权重初始化
我计划将 Nguyen-Widrow 算法用于具有的 NN多个隐藏层 .在研究的过程中，我发现了很多歧义，我想澄清一下。以下是 Nguyen-Widrow 算法的伪代码 Initial
artificial-intelligence - 有没有积极的强化学习竞赛？
我喜欢在强化学习方面做兼职研究。近年来(截至2009年)在rl-competition.org举办了强化学习竞赛。有一些非常有趣的问题，但这似乎已停止。我很想提高我的技能和知识，并与该领域的其他爱好者
artificial-intelligence - 如何确定在人工神经网络的层之间连接哪些神经元？
假设我的第一个输入层有 10 个输入节点/神经元。假设我的隐藏层也有 10 个神经元。我的第三层也是最后一层是一个输出神经元。如何连接层？有没有一种技术可以确定最好的方法来做到这一点，还是只是将每个
artificial-intelligence - 蒙特卡罗和马尔可夫链技术有什么区别？
我想开发 RISK 棋盘游戏，其中包括面向计算机玩家的 AI。另外，我看了两篇文章，this和 this ，关于它，我意识到我必须学习蒙特卡罗模拟和马尔可夫链技术。我认为我必须一起使用这些技术，但我想

首页

博学

6Ren·AI

商城

artificial-intelligence - 马尔可夫决策过程问题