Meta Platforms开发了一种人工智能(AI)系统,可以扫描维基百科的文章,分析文章引用来源,确定其中一些是否需要更改。
Meta今天详细介绍了这个AI系统,此外还根据开源许可发布了该系统的代码。
维基百科的编辑们通过检查检索信息的来源,来确保维基百科文章中某些信息是否准确,而检查文章所有引用来源是一个非常耗时的过程。维基百科有数百万页,其中一些页面包含多达数百条引文。
Meta此次发布的AI系统旨在通过对一部分论文引文审查工作实施自动化,来简化维基百科编辑们的工作。该系统可以扫描一篇文章并识别文章中是否存在有可疑引文的信息片段,此外还能够推荐相关性更高的来源,用这些来源替换有问题的引用。
例如,一篇关于某款Apple产品的维基百科文章,可能会意外引用Apple网站上讨论另外一个产品的页面,而Meta的这个新IA系统可以发现该引用是错误的,还可以推荐文章应该引用Apple网站上的准确页面。
Meta利用来自维基百科的400万条信息文本片段对该系统进行训练,使其可以检测出错误的引用。此外,Meta还创建了一个名为Sphere的数据集,其中包含来自开放网络的1.34亿个文档。当系统在维基百科文章中发现引用有问题的时候,系统就会搜索Sphere数据集中的文档,找到相关性更高的来源。
该系统找到可替换有问题的引用的新来源,这个过程涉及到多个步骤。
由于Sphere数据集包含1.34亿份文档,因此搜索相关引用可能需要大量时间。Meta研究人员开发了一系列专业指数加快了这个过程。在数据管理过程中,索引是快捷方式的集合,可以更快速地找到特定信息。
Meta的AI系统使用Meta开发的索引加快搜索Sphere数据集以查找引用,这比其他方法速度更快。当系统找到可能被引用为来源的文档时,就会从文档中提取出相关性最高的段落,还能够确定是否有多个文档可能被作为引用来源。
据Meta称,该系统可创建两个文本片段的数学表示,来确定来自Sphere的文档是否能够支持维基百科文章中的某个信息片段,然后对比这些数据表示以确定是否相关性最高。
“我们设计了一系列工具来对比这些数学表示,以确定一段陈述是支持还是反驳另一段陈述,”Meta研究人员在今天发表的一篇博客文章中详细说明称。如果该系统找到了多个可以作为来源引用的文档,就会根据相关可能性对这些文档进行排名。
研究人员详细介绍说:“该模型使用细粒度的语言理解,根据相关可能性对这些引用来源和检索到的替代方案进行排名。在现实部署环境中,该模型将提供相关性最高的链接作为预期引用来源,供编辑们进行审批。”
除了这个系统之外,Meta还开源了Sphere数据库,以及让该数据库更易于搜索的索引。此外,Meta还将公布一个名为distributed-faiss的内部工具代码,该工具可以跨多个服务器而不是在单个设备上运行索引,从而简化处理过程。
Meta相信这个AI系统、Sphere数据集等其他一系列Meta工程师开发的组件,未来可用于支持多个应用场景。Meta详细说明称:“未来可能还会推出一系列可以实时验证文档的编辑,而这次推出的模型将成为这些编辑器的首批组件。除了提出引文之外,该系统还可以根据网络上相关文件提供的信息,对自动完成文本提供建议,以及校对更正。”
好文章,需要你的鼓励
CIO们正面临众多复杂挑战,其多样性值得关注。除了企业安全和成本控制等传统问题,人工智能快速发展和地缘政治环境正在颠覆常规业务模式。主要挑战包括:AI技术快速演进、IT部门AI应用、AI网络攻击威胁、AIOps智能运维、快速实现价值、地缘政治影响、成本控制、人才短缺、安全风险管理以及未来准备等十个方面。
北航团队发布AnimaX技术,能够根据文字描述让静态3D模型自动生成动画。该系统支持人形角色、动物、家具等各类模型,仅需6分钟即可完成高质量动画生成,效率远超传统方法。通过多视角视频-姿态联合扩散模型,AnimaX有效结合了视频AI的运动理解能力与骨骼动画的精确控制,在16万动画序列数据集上训练后展现出卓越性能。
过去两年间,许多组织启动了大量AI概念验证项目,但失败率高且投资回报率令人失望。如今出现新趋势,组织开始重新评估AI实验的撒网策略。IT观察者发现,许多组织正在减少AI概念验证项目数量,IT领导转向商业AI工具,专注于有限的战略性目标用例。专家表示,组织正从大规模实验转向更专注、结果导向的AI部署,优先考虑能深度融入运营工作流程并产生可衡量结果的少数用例。
这项研究解决了AI图片描述中的两大难题:描述不平衡和内容虚构。通过创新的"侦探式追问"方法,让AI能生成更详细准确的图片描述,显著提升了多个AI系统的性能表现,为无障碍技术、教育、电商等领域带来实用价值。