至顶网软件频道消息: 人工智能模型首次在斯坦福大学(Stanford University)的阅读测试中超越人类,该阅读测试被用于衡量神经网络认知能力。
中国网络巨头阿里巴巴集团(Group Holding Ltd.)周一宣布,该公司研发部门开发的人工智能(AI)获得了82.44分的高分,这是创纪录的里程碑。与之相比较,人类参与者的成绩是82.304。在阿里巴巴的测试成绩最终确认后的第二天,微软公司用一个深度学习模型重复了这一壮举,并且获得了略微更高一点的成绩——82.65。
这个被称为斯坦福问答数据集(Stanford Question Answering Dataset)的测试包含了从500篇维基百科的文章中提取的超过10万个问题和答案。测试中所有的文字内容都是用自然语言写成,而不是使用了计算机更容易理解的结构化格式。因此,人工智能模型现在可以获得比人类更好的分数代表了一项重大的技术成就。
一个能够以类似于人类的准确程度理解书面材料的深度学习模型有很多潜在的应用。阿里巴巴研究团队的自然语言处理首席科学家司罗(音译:Luo Si)将客户服务和医疗保健列为该技术可能会被证明是特别有用的两大领域。
科技行业也正在其他方面努力地推进人工智能。8月份,微软的研究人员透露,他们已经开发了一个能够抄录文本的语音识别系统,错误率仅为5.1%,与人类的平均水平相当。
与此同时,阿里巴巴正在积极争取在人工智能军备竞赛中获得超越同行的优势。三个月前,该公司宣布计划在未来三年投资150亿美元用于工程技术。这项工作将特别重视深度学习等对其长期发展计划非常重要的技术。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。