至顶网软件频道消息:
DeepMind科技有限公司的阿尔法狗在古老的围棋游戏中超过了所有的人类玩家,但是这家Alphabet有限公司旗下的实验室还在继续改进其人工智能冠军。在今天发表的一篇新的研究论文中,DeepMind展示了阿尔法狗在过去两年中的进步情况:它现在已经如此聪明,可以在几乎完全没有人类资源的情况下学习。
DeepMind在《Nature》杂志上发表了一篇题为《不借助人类知识精通围棋游戏》的新论文,并介绍了新的AlphaGo Zero。与以前版本的阿尔法狗不同——之前版本的阿尔法狗是通过分析从人类玩家的真实围棋棋谱中提取的数据来进行学习,而AlphaGo Zero则完全是通过自行随机游戏,自主地学习游戏规则的。
AlphaGo Zero和之前的版本还有一些其他的不同。例如,新版本通过计算机视觉使用白色和黑色棋子作为输入,而不是依赖于定制设计的输入。AlphaGo Zero还只使用了一个神经网络而不是两个神经网络,它依靠该网络来评估位置,而不是针对可能的下法使用快速走子的方法。
Alphabet为了一个棋盘游戏投入了这么大量的研究看起来可能显得很奇怪,但是AlphaGo Zero的成功证明了未来人工智能可以在没有大量数据的情况下被训练的可能性。这在真实数据稀缺或难以收集的领域(如执法或医学领域)中将是一个主重大的优点。
事实上,对机器学习的一个一直存在的批评是,和儿童相比,它要想识别对象所需要的数据和能源要多得多。这表明在机器学习领域占据领导地位的深度学习神经网络近年来在图像和语音识别方面的突破远不能真正地模仿人类的大脑。
DeepMind认为,AlphaGo Zero代表了构建可以解决困难问题的人工智能的重大进步,同样的强化学习方法也可以应用于广泛的用例。
DeepMind首席执行官Demis Hassabis和研究科学家David Silver在一篇博文中表示,“在数百万局阿尔法狗与阿尔法狗对弈的过程中,系统从头开始逐渐学习了围棋的游戏,在短短几天内累积了人类数千年的知识。”他们表示,“AlphaGo Zero还发现了新的知识,开发非常规的策略和创新的下法,回应并超越了在同李世石和柯洁对弈时使用的技术。”
虽然研究人员表示虽然为时尚早,但AlphaGo Zero构成了迈向最终目标的“关键步骤”。他们表示:“如果类似的技术可以应用于其他结构化问题,如蛋白质折叠、减少能源消耗或寻找革命性的新材料,这些突破将有可能会产生积极的社会影响。”
好文章,需要你的鼓励
在“PEC 2025 AI创新者大会暨第二届提示工程峰会”上,一场以“AIGC创作新范式——双脑智能时代:心智驱动的生产力变革”为主题的分论坛,成为现场最具张力的对话空间。
人民大学团队开发了Search-o1框架,让AI在推理时能像侦探一样边查资料边思考。系统通过检测不确定性词汇自动触发搜索,并用知识精炼模块从海量资料中提取关键信息无缝融入推理过程。在博士级科学问题测试中,该系统整体准确率达63.6%,在物理和生物领域甚至超越人类专家水平,为AI推理能力带来突破性提升。
Linux Mint团队计划加快发布周期,在未来几个月推出两个新版本。LMDE 7代号"Gigi"基于Debian 13开发,将包含libAdapta库以支持Gtk4应用的主题功能。新版本将停止提供32位版本支持。同时Cinnamon桌面的Wayland支持持续改进,在菜单、状态小程序和键盘输入处理方面表现更佳,有望成为完整支持Wayland的重要桌面环境之一。
Anthropic研究团队开发的REINFORCE++算法通过采用全局优势标准化解决了AI训练中的"过度拟合"问题。该算法摒弃了传统PPO方法中昂贵的价值网络组件,用统一评价标准替代针对单个问题的局部基准,有效避免了"奖励破解"现象。实验显示,REINFORCE++在处理新问题时表现更稳定,特别是在长文本推理和工具集成场景中展现出优异的泛化能力,为开发更实用可靠的AI系统提供了新思路。