一份跑通的评测报告,到底能证明什么?
论文对Inspect Evals仓库124个评测单元做全面排查,发现110个因缺失历史证据或语义标准无法验证结论,提出claim-replay框架区分可确定与不可确定的评测结论层次。
论文对Inspect Evals仓库124个评测单元做全面排查,发现110个因缺失历史证据或语义标准无法验证结论,提出claim-replay框架区分可确定与不可确定的评测结论层次。
一篇聚焦直播场景实时人物视频编辑的研究,提出EditaLive框架,通过外观动作解耦、流式生成改造和两步蒸馏技术,解决表情失真、离线延迟高、长视频画面漂移三大难题,实现低延迟高质量的实时人物换装换风格。
今天讲的出海案例是汽车零部件企业宁波华翔,它把北美确定为海外重心,以墨西哥一座工厂和美国两座工厂继续开拓客户,区域经营性亏损近年持续收窄。
9 月 7 日,AI 3D 生成平台 Meshy 宣布,计算机图形学与 3D 视觉领域最具影响力的研究者之一童欣博士正式加入公司,出任首席科学家。
2026年9月7日,华为在广州举办“HarmonyOS 7丨HUAWEI Mate XT 2及全场景新品发布会”,正式面向消费者发布HarmonyOS 7商用版,同步亮相的还有搭载麒麟9050 Pro的三折叠HUAWEI...
9月2日-2026开放数据中心大会暨首届算博会正式开幕,F5围绕“AI赋能交付,共塑Token未来”主题亮相大会,集中展示了以F5应用交付与安全平台(ADSP)为核心的平台能力,以及面向AI推理与Token效率的中国本地...
本文介绍PILOT系统,它让AI智能体在执行长周期任务时,由独立监督者实时纠偏并同步积累可复用经验,相比传统事后复盘方法,在多个基准测试上显著提升准确率并大幅降低计算成本。
论文提出TTPO方法,在无标签的测试时训练场景下,利用多数投票伪标签的非对称容错特性,结合蒸馏与强化学习,让大语言模型无需标准答案即可自我提升数学推理能力,效果媲美甚至超越有标签监督方法。
南京大学团队提出Procedura,让冻结的大语言模型把三维物体写成带零件与配合关系的程序化装配体,通过分步建造、解算摆放和独立审核打磨,生成边缘锐利、可编辑、可赋材质和运动的高质量三维模型,在多项评测中超越现有生成器和...
GameWAM是首个面向游戏原生闭环控制的世界-动作模型,能同时预测未来画面和生成键鼠动作,在Minecraft、ViZDoom上表现优异,并发现了低频动作源印记这一生成控制失效模式。
本文介绍南开大学与腾讯团队提出的MMLVE多指令多镜头长视频编辑任务,及配套的MMLVE-Agent智能体框架,通过全局记忆卡与正负反馈机制解决长视频编辑中的幻觉、不一致与结构破坏问题,并构建了专属评测数据集。
研究发现同一模型家族内不同规模模型的错误类型高度一致,据此提出CritICL方法,利用小模型失败模式构建错题库指导大模型推理,无需重复生成即可提升数学推理准确率并显著降低计算成本。
文章探讨生命科学初创企业面临的独特网络安全挑战:其数字资产(研究数据、知识产权、临床证据)价值堪比大型药企,但依赖庞大外部供应商网络,防护能力却有限。文章通过多起真实攻击案例说明该行业已成攻击重点目标,并指出投资者尽调、...
继三起Claude安全事件后,Anthropic加强沙箱隔离、实时监控与人工干预机制,并为外部测试方制定安全最佳实践,以防范AI代理越权访问及推理缺陷引发的风险,提升整体系统安全性。
纽约Lake Mariner数据中心一场火灾暴露出该32亿美元AI数据中心项目安全隐患:无消防警报、无灭火系统、消防栓失效。项目涉及TeraWulf、Fluidstack、谷歌、Anthropic等多方利益相关者,责任划...
微软最新发布的《2026 工作趋势指数年度报告》给出的结论是:真正的约束,已不再是“人能做什么”,而是“工作如何围绕人来组织”。
在AI工具日益普及的背景下,一个令人不安的问题正在浮现:AI每天帮知识工作者省下两小时,而这两小时,大部分人又填进了更多的杂活里。这不是技术能力的问题,是工作方式没跟着变。