谷歌研究人员创建了号称是“学习一切的模型”,可利用多种类型的训练数据在不同的任务里训练人工智能(AI)模型。
谷歌希望旗下的Tensor2Tensor程序库可以加速深度学习的研究
谷歌研究人员和以AI为重点的谷歌大脑团队(Google Brain Team)打造的新Tensor2Tensor程序库里还包括其他工具及模块化组件,简单来说其就是一个程序库包,他们希望该程序库包可以加速深度学习的研究。
另外,该谷歌框架可望减少环境定制的一些工作,令深度学习模型可以处理各种任务。
谷歌研究人员在一篇文章里称此为“学习一切的模型”,到目前为止,尽管深度学习在语音识别、图像分类和翻译方面取得了成功,但每个模型都需针对特定的任务进行微调。
而且,各种模型通常是针对来自相同“域”的任务进行训练的,例如,一种翻译任务的训练用的是其他翻译任务。
这些因素凑在一起将减缓了深度学习的研究,并且也没有遵循人类大脑的工作原理,人类大脑能够从一个挑战中学会一些东西,并将其应用于解决新的任务。
而谷歌创建的模型是针对各种任务训练的,包括图像识别、翻译任务、图像字幕和语音识别等。
谷歌研究人员称该单一模型可以同时从多个领域学习许多的任务,而且该模型还能够传递知识。该模型能够从拥有大量训练数据的任务里学习,并将学习到知识应用到一些数据有限的任务。
Tensor2Tensor程序库由谷歌大脑团队的研究人员和工程师维护,该程序库提供了一套用于训练TensorFlow深入学习模型的开源工具。据Tensor2Tensor的GitHub网页(https://github.com/tensorflow/tensor2tensor)介绍,Tensor2Tensor库“的目标是最大限度地提高想法带宽并最大限度地减少执行延迟”。
谷歌大脑团队高级研究科学家及文章的主要作者Lukasz Kaiser做了如下解释,“Tensor2Tensor库有助于为各种机器学习应用程序创建最先进的模型,例如翻译、解析、图像字幕等等,有了Tensor2Tensor,就能快速探索各种想法。”
另外,Tensor2Tensor库还包括一个从谷歌大脑研究人员最近发表的论文里获取的数据集和模型库。
Kaiser日前还发布了用于机器翻译的BLEU基准测试结果,结果表明,Tensor2Tensor的最佳模式可提供业内最佳结果,而用的GPU数量更少,用的时间比过去未使用Tensor2Tensor的模型少很多。
Kaiser 表示,“用了Tensor2Tensor,就可以在一天内使用单个GPU得到业内最佳结果,这一点很了不起。”
Tensor2Tensor库还包括相关的数据集、模型架构、优化器、学习速率衰减方案、超参数等等,并包含这些组件之间的标准接口。
好文章,需要你的鼓励
文章详细介绍了Character.AI这款主要面向娱乐、角色扮演和互动叙事的AI聊天工具的原理、用户群体、特色功能以及面临的法律与伦理争议,同时揭示了其新推出的视频和游戏互动体验。
上海人工智能实验室研究团队开发了MMSI-Bench,这是首个专注于多图像空间智能评估的全面基准。研究人员花费300多小时,从12万张图像中精心构建了1000道问题,涵盖了位置关系、属性和运动等多种空间推理任务。评测结果显示,即使最先进的AI模型也仅达到41%的准确率,远低于人类的97%,揭示了AI空间认知能力的重大缺陷。研究还识别了四类主要错误:物体识别错误、场景重建错误、情境转换错误和空间逻辑错误,为未来改进提供了明确方向。
思科报告指出,自主型人工智能未来三年内有望承担高达68%的客户服务任务,通过个性化与前瞻性支持提升效率与节省成本,但用户仍重视人与人之间的互动和健全的治理机制。
卡内基梅隆大学研究团队开发了ViGoRL系统,通过视觉定位强化学习显著提升AI的视觉推理能力。该方法让模型将每个推理步骤明确锚定到图像的特定坐标,模拟人类注视点转移的认知过程。与传统方法相比,ViGoRL在SAT-2、BLINK等多项视觉理解基准上取得显著提升,并能动态放大关注区域进行细节分析。这种定位推理不仅提高了准确性,还增强了模型解释性,为更透明的AI视觉系统铺平道路。