ZD至顶网软件频道消息:神经网络可以为人工智能系统提供常识功能,到目前为止,只有人类才拥有常识的特质。
尽管人类里个体的常识也不尽相同,“常识”其实是个颇为模糊的概念,常识是指在一个复杂的情景中做出一个合理和好的决策,而做决策的基础是利用自己的经验和对世界的理解,而不是依靠结构化的信息;而人工智能要做到这一点是很麻烦的。
常识是一种直觉,是人类的一个概念,但据Facebook 人工智能(AI)研究团队的主管Yann LeCun介绍,神经网络和机器视觉的飞速发展有朝一日可以让软件拥有常识功能。
LeCun在接受《麻省理工学院技术评论》记者采访时表示,在神经网络这方面仍“有待”努力,机器视觉需用到神经网络。
神经网络是一个模拟人类大脑结构的人工系统,神经网络与先进机器视觉结合在一起,就可以从图像中提取数据并用于任务和决策,LeCun表示,其结果就是常识功能。
例如,如果一个图像里有一个主要物件,机器就可以利用足够多的物件类别数据识别一些特定的物件,如狗、植物或汽车。而现在有些AI系统还可以认识更抽象的分类,如婚礼、日落和风景。
LeCun表示,在五年前这是不可能的,而现在随着机器被赋予视觉后,机器的专业知识也在增长。
人工智能目前仍只局限于人类训练过的特定区域。一个婚礼上的一只狗的图像送给人工智能系统后,如果AI之前未见过这种图,AI就不能理解图像的内涵意义,其响应极有可能就是LeCun称之为 “垃圾”的东西。因此说AI缺乏常识。
Facebook希望改变这种现状。LeCun表示,你可以通过语言与智能系统互动,使其识别物件,但“语言是一种非常低带宽的信道”,人类因为有丰富的背景知识,可以帮助他们理解语言,而机器目前还不能实时联系上下文内容模拟常识功能。
解决该问题的方法大可以通过视觉学习和诸如图像和视频流等媒体达到。
LeCun 表示,“如果你告诉机器说”这是智能手机”,“这是压路机”,“有些东西可以推得动,也有些东西是推不动的”,或许这机器就可以学习世间万物运行的基础知识。这有点像婴儿的学习过程。”
LeCun 称,“在我们真正想做的事情里,其中有一条就是让机器获得大量代表现实世界限制的事实,其做法是通过视频或其他渠道观察这世界。如此,机器最后就可以获得常识。”
智能机器有能力观察世界后,上下文的缺口就可以堵上,人工智能就大有可能产生一个大飞跃,不再停滞在程序算法和答案集合的层次上。例如,Facebook想在有些领域有所突破,例如,AI系统查看了几个帧以后可以预测未来的事件。
LeCun表示,“如果我们能够训练出这样的系统,我们认为我们就已经开发出了无监督学习系统的核心。我认为,这一块极有可能大有可为。其应用不一定是视觉。我们推动人工智能发展工作的大头也在这一块。”
好文章,需要你的鼓励
邻里社交应用Nextdoor推出重新设计版本,新增本地新闻、实时警报和名为"Faves"的AI功能,用于发现本地商户和地点。该应用与3500家本地出版商合作提供新闻内容,通过Samdesk和Weather.com提供天气、交通、停电等实时警报。Faves功能利用15年邻里对话数据训练的大语言模型,为用户提供本地化AI推荐服务,帮助用户找到最佳餐厅、徒步地点等本地信息。
Skywork AI推出的第二代多模态推理模型R1V2,通过创新的混合强化学习方法,成功解决了AI"慢思考"策略在视觉推理中的挑战。该模型在保持强大推理能力的同时有效控制视觉幻觉,在多项权威测试中超越同类开源模型,某些指标甚至媲美商业产品,为开源AI发展树立了新标杆。
英国生物银行完成了世界上最大规模的全身成像项目,收集了10万名志愿者的超过10亿次扫描数据,用于研究人体衰老和疾病过程。该项目历时11年,每次扫描耗时5小时,投资6200万英镑。目前已有8万人的成像数据供全球研究人员使用,剩余数据将于年底前发布。项目已开发出能预测38种常见疾病的AI工具,并在心脏病、痴呆症和癌症诊断方面取得突破。
这项由北京大学等多所高校联合完成的研究,首次对OpenAI GPT-4o的图像生成能力进行了全面评估。研究团队设计了名为GPT-ImgEval的综合测试体系,从文本转图像、图像编辑和知识驱动创作三个维度评估GPT-4o,发现其在所有测试中都显著超越现有方法。研究还通过技术分析推断GPT-4o采用了自回归与扩散相结合的混合架构,并发现其生成图像仍可被现有检测工具有效识别,为AI图像生成领域提供了重要的评估基准和技术洞察。