东篱科研大数据发现系统（DRDS）

位置：成果数据库 > 期刊 > 期刊详情页

实时动态规划的最优行动判据及算法改进

ISSN号：1000-9825
期刊名称：《软件学报》
时间：0
分类：TP301[自动化与计算机技术—计算机系统结构;自动化与计算机技术—计算机科学与技术]
作者机构：[1]中国科学技术大学计算机科学与技术系,安徽合肥230027
相关基金：Supported by the National Natural Science Foundation of China under Grant No.60745002 （国家自然科学基金）; the National Basic Research Program of China under No.2003CB317002 （国家重点基础研究发展计划（973））

关键词：马尔可夫决策过程, 实时动态规划, 收敛判据, 增量求解, 启发式搜索, MDP （Markov decision process）, RTDP （real-time dynamic programming）, convergence criterion, incremental solving, heuristic search

中文摘要：

主要以提高求解马尔可夫决策问题的实时动态规划（real-time dynamic programming，简称RTDP）算法的效率为目的．对几类典型的实时动态规划算法所使用的收敛判据进行了对比分析，并利用值函数上界、下界给出了称为最优行动判据的收敛判据，以及一个更适合实时算法的分支选择策略．最优行动判据可以更早地标定当前状态满足精度要求的最优行动供立即执行，而新的分支选择策略可以加快这一判据的满足．据此设计了一种有界增量实时动态规划（bounded incremental RTDP,简称BI-RTDP）算法．在两种典型仿真实时环境的实验中，BI-RTDP均显示出优于现有相关算法的实时性能．

英文摘要：

This paper is primarily to improve the efficiency of real-time dynamic programming （RTDP） algorithm for solving Markov decision problems. Several typical convergence criteria are compared and analyzed. A criterion called optimal action criterion and a corresponding branch strategy are proposed on the basis of the upper and lower bound theory. This criterion guarantees that the agent can act earlier in a real-time decision process while an optimal policy with sufficient precision still remains. It can be proved that under certain conditions one can obtain an optimal policy with arbitrary precision by using such an incremental method. With these new techniques, a bounded incremental real-time dynamic programming （BI-RTDP） algorithm is designed. In the experiments of two typical real-time simulation systems, BI-RTDP outperforms the other state-of-the-art RTDP algorithms tested.

同期刊论文项目

慎思式适应的基本机制、框架和实验研究

期刊论文 8

同项目期刊论文

一种含间隙机械臂的在线校准方法

一种提高双足机器人机动性的步行模式规划方法

杂合启发式在线POMDP规划

面向智能服务机器人任务规划的行动语言扩展

行动驱动的马尔可夫决策过程及在RoboCup中的应用

一种支持个性化协调的服务机器人体系结构

使用零力矩点轨迹规划的四足机器人步态进化方法

期刊信息

《软件学报》
北大核心期刊（2011版）

主管单位:中国科学院
主办单位:中国科学院软件研究所中国计算机学会
主编：赵琛
地址：北京8718信箱中国科学院软件研究所
邮编：100190
邮箱：jos@iscas.ac.cn
电话：010-62562563

国际标准刊号：ISSN：1000-9825
国内统一刊号：ISSN：11-2560/TP
邮发代号:82-367

获奖情况:
2001年入选中国期刊方阵“双百期刊”,2000年荣获中国科学院优秀科技期刊一等奖

国内外数据库收录:
俄罗斯文摘杂志,美国数学评论（网络版）,波兰哥白尼索引,德国数学文摘,荷兰文摘与引文数据库,美国工程索引,美国剑桥科学文摘,英国科学文摘数据库,日本日本科学技术振兴机构数据库,中国中国科技核心期刊,中国北大核心期刊（2004版）,中国北大核心期刊（2008版）,中国北大核心期刊（2011版）,中国北大核心期刊（2014版）,中国北大核心期刊（2000版）

被引量:54609