AlphaGo之父揭开打败柯洁的秘密:强AI是人类的终极工具

5月24日,在新版本AlphaGo首战以1/4子微弱优势战胜中国围棋职业九段棋手柯洁之后,“AlphaGo之父”DeepMind创始人兼CEO Demis Hassabis、AlphaGo团队负责人David Silver在人工智能高峰论坛上详解了AlphaGo的研发并就“AlphaGo意味着什么?”的问题进行了详细解答。

“AlphaGo已经展示出了创造力,也已经可以模仿人类直觉了。在过去一年,我们继续打造AlphaGo,我们想打造完美的AlphaGo,弥补它知识方面的空白。因为在与李世石的比赛中,它是有缺陷的。”Demis Hassabis说:“在未来我们能看到人机合作的巨大力量,人类智慧将通过人工智能进一步放大。强人工智能是人类研究和探寻宇宙的终极工具。”

为什么计算机下围棋非常困难?

Demis Hassabis坦言围棋非常困难,因为其复杂程度让穷举搜索都难以解决。对于计算机来说,围棋有两项难题:“不可能”写出评估程序以决定谁赢,搜索空间太过庞大。

围棋不像象棋等游戏靠计算,而是靠直觉。围棋中没有等级概念,所有棋子都一样。围棋是筑防游戏,因此需要盘算未来。小小一子可撼全局,“妙手”如受天启。

AlphaGo如何进行训练?

David Silver从技术角度详细解释了AlphaGo如何进行训练。

围棋对于机器的难点之一是评估程序的撰写。而AlphaGo团队用两种卷积神经网络去完成:策略网络和估值网络。策略网络的卷积神经网络用于决定下一步落子可能的位置,价值网络用于评估当前棋局获胜的概率。

为了应对围棋的巨大复杂性,AlphaGo 采用机器学习技术,结合了监督学习和强化学习的优势。通过训练形成一个策略网络(policy network),将棋盘上的局势作为输入信息,并对所有可行的落子位置生成一个概率分布。

然后,训练出一个价值网络(value network)对自我对弈进行预测,以 -1(对手的绝对胜利)到1(AlphaGo的绝对胜利)的标准,预测所有可行落子位置的结果。这两个网络自身都十分强大,而 AlphaGo将这两种网络整合进基于概率的蒙特卡罗树搜索(MCTS)中,实现了它真正的优势。

最后,新版的AlphaGo 产生大量自我对弈棋局,为下一代版本提供了训练数据,此过程循环往复。

AlphaGo 如何决定落子?

在获取棋局信息后,AlphaGo会根据策略网络探索哪个位置同时具备高潜在价值和高可能性,进而决定最佳落子位置。在分配的搜索时间结束时,模拟过程中被系统最频繁考察的位置将成为 AlphaGo的最终选择。在经过先期的全盘探索和过程中对最佳落子的不断揣摩后,AlphaGo的搜索算法就能在其计算能力之上加入近似人类的直觉判断。

David Silver总结:策略网络减少宽度,价值网络减少深度。AlphaGo做出多种模拟,不断反复,最终形成判断哪种方案是获胜概率最高的。

今年的AlphaGo和去年的AlphaGo有什么区别?

David Silver透露,去年的AlphaGo Lee在云上有50TPUs在运作,搜索50个棋步为10000个位置/秒。而今年的AlphaGo Master是在单个TPU机器上进行游戏,它已经成为了自己的老师,从自己的搜索里学习,拥有更强大的策略网络和价值网络。

AlphaGo如何进行自我学习?

Demis Hassabis将AlphaGo归类为强人工智能,强人工智能和弱人工智能的区别在于弱人工智能是预设置的,例如IBM的“深蓝”就不能自我学习。

他提到强化学习框架的概念:智能体有一个特定目标要完成,它有两种方式和环境打交道,一是观察,智能体通过观察进行见面,这有可能不全面。二是行动。

David Silver称,AlphaGo先自己与自己对弈,策略网络以P预测AlphaGo的移动。

人工智能的元解决方案

Demis Hassabis表示,目前信息过载和系统冗杂是人类面临的巨大挑战。开发人工智能技术可能是这些问题的元解决方案。元解决方案的目标是实现“人工智能科学家”或“人工智能辅助科学”。“人工智能和所有强大的新技术一样,在伦理和责任的约束中造福人类。

原文发布时间为:2017年5月24日

时间: 2024-11-03 10:56:37

AlphaGo之父揭开打败柯洁的秘密:强AI是人类的终极工具的相关文章

2017年全球最热论文Top 100,AlphaGo Zero、AI超越人类等入选

伟大的科研结果往往引起大量的社会关注和实际影响.Altmetric score 是对基于引用数的传统论文计量方法的一种补充,是科研论文发表后的国际关注度的一个指标,衡量的因素包括新闻报道.博客.推特.Facebook.新浪微博.维基百科等.Altmetric的数据来源于互联网,提供了有关期刊论文和其他学术成果在世界各地探讨和应用情况的信息,目前已被应用于<自然>.<科学>.<柳叶刀> 等期刊网站,以及许多机构数据库和研究者个人网站中. 在过去的一年里,Altmetric

&quot;LSTM之父&quot;Jürgen Schmidhuber:我一直在努力实现三十年前的目标 “AI奴役人类”很愚蠢

9月12日上午,南京金秋洽谈会"2017中国人工智能峰会(CAIS 2017)"在南京国际博览会议中心盛大开幕.本次峰会以"创新.变革.突破"为主题,并设两大主题论坛,共吸引了30余位人工智能领域著名的科学家.企业领袖亲临现场,1500余名专业观众报名参会,雷锋网作为受邀媒体参加了本次峰会并进行了报道. 在大会上,瑞士人工智能实验室 IDSIA 主任."LSTM之父"Jürgen Schmidhuber发表了名为<True Artifica

揭开小米那些不为人知的秘密

雷军又摔手机了. 2011年8月19日,在北京车库咖啡的一个论坛上,面对网友"国产山寨货"的质疑,雷军掏出手机,当众示范了摔手机.另两位小米联合创始人黎万强.周光平坐在旁边,则是心惊肉跳."前两次摔手机一次是在小米发布会的台子上,铺了地毯,一次是雷军坐着演示的.但这回,车库咖啡可以实打实的大理石地,雷总个头又高,站着摔的,质量再好的手机也悬呀!" 命悬一线,是当时业界对小米的主流看法,也是小米七大创始人头上悬的一把看不见的剑.特别在2011年8月到10月份,可能是雷

PS揭开高效率修图的秘密

  今天要说的是如何才能减少无休止的修图时间,把更多的时间花在享受生活和拍摄上的小技巧. 让我们面对这个赤裸裸的事实吧,那就是我们都不喜欢修图!无论现在的软件多么人性化!其实我们喜欢的是把自己出色的照片和大家分享的时刻,为了这种分享的喜悦,我们才在电脑前花了那么多的时间和精力,但是,很少人真的热爱修图的过程.既然如此,我们今天就来说说如何减少图片编辑的时间,加快图片处理速度. 杜绝选择困难症 无论是在家庭日拍了许多有趣的照片,还是在婚礼上记录了许多感人的瞬间,往往会发现你拍的比你真正想要的,或者

揭开高效率修图的秘密 熬夜修图从此说拜拜

  今天要说的是如何才能减少无休止的修图时间,把更多的时间花在享受生活和拍摄上的小技巧. 让我们面对这个赤裸裸的事实吧,那就是我们都不喜欢修图!无论现在的软件多么人性化!其实我们喜欢的是把自己出色的照片和大家分享的时刻,为了这种分享的喜悦,我们才在电脑前花了那么多的时间和精力,但是,很少人真的热爱修图的过程.既然如此,我们今天就来说说如何减少图片编辑的时间,加快图片处理速度. 杜绝选择困难症 无论是在家庭日拍了许多有趣的照片,还是在婚礼上记录了许多感人的瞬间,往往会发现你拍的比你真正想要的,或者

百度开放研究食品助手APP 揭开配料表的“秘密

晚饭吃什么呢?吃什么才能既保证了营养,又能保持身材?吃的东西里含有的营养元素安全吗,适合自己吗?想必不少消费者都考虑过这些问题.当前,在食品包装袋上一般都会包含食品的成分和数量表格,并且要给出食品中的添加剂的名称和数量.实际上,消费者对于这些内容的理解是很粗浅的,不知道这些成分对身体有什么影响,所以往往这些食品成分和数量规格说明对消费者的作用也不大. 面对如此纠结的问题,我们该怎么办?显然,我们更需要一个工具,能够帮助人们了解食品包装袋上的配料表中成分的功能作用,解读这些成分的营养效果.以及身体

揭开零定价的秘密

免费.无偿.白送,越来越多的商品默认价格是零. 当然这并不是说,因为免费,企业就无法挣钱了. 免费也可以是桩不错的买卖. 不久前,一家媒体报道了"试吃"一族的出现.一名男子早晨用免费牙膏刷牙后,搭免费购物班车来到商场,吃了商场发放的免费牛奶和饼干解决了早餐:中餐就在超市的各种食品柜台解决了:解决晚餐时,他还顺便拿了一把厂家促销发放的雨伞. 看来在"体验"成为推销的一种强有力方式的今天,人们还真是能吃到"免费的午餐".曾提出著名的"长尾理

任天堂新3DS打败智能手机的秘密武器:物理按键

摘要: 新款3DS和3DS LL将加入新的肩按键,第二模拟摇杆和色彩鲜艳的按键. 北京时间9月1日早间消息, 任天堂 于8月29日发布了新款3DS掌机.相对于此前版本,新款3DS性能更强大,同时也对摄 新款3DS和3DS LL将加入新的肩按键,第二模拟摇杆和色彩鲜艳的按键. 北京时间9月1日早间消息, 任天堂 于8月29日发布了新款3DS掌机.相对于此前版本,新款3DS性能更强大,同时也对摄像头和屏幕等元件进行了改进. 目前,智能手机和平板电脑正吸引用户越来越多的关注.业内人士指出,任天堂目前正

苹果曝光首份AI论文,揭开滴滴人工智能调度系统真面目| AI科技评论周刊

雷锋网(公众号:雷锋网)按:过去一周,是"中国人工智能元年"的最后一周.这周里,苹果揭开其首份AI论文的面纱:美国启动全球首个深度学习加持的"癌症先进计算解决方案的联合设计":IBM在高性能计算上继续发力,提出数据中心计算(DCS )模型:2016年是三星饱受煎熬的一年,来年它将押注Galaxy S8,发力移动AI助手:滴滴研究院副院长叶杰平,为我们揭开滴滴AI调度系统的真面目. 苹果首份AI论文横空出世,提出SimGAN训练方法 12月27日,苹果的首份AI论文曝