机器人只记住最近11帧,却能在4.8万帧的街景里走完27分钟不迷路
阿里团队提出ABot-Recon,仅缓存最近11帧特征即可完成超长视频的流式三维重建。通过局部预测目标、旋转修正器与组合感知损失,在Oxford Spires等基准上将误差降低约40%,同时兼顾更快速度与更低显存占用。
阿里团队提出ABot-Recon,仅缓存最近11帧特征即可完成超长视频的流式三维重建。通过局部预测目标、旋转修正器与组合感知损失,在Oxford Spires等基准上将误差降低约40%,同时兼顾更快速度与更低显存占用。
论文提出PonderPounce,用预训练多模态大模型Ponder的原生上下文作为机器人情景记忆,通过异步认知令牌连接动作模型Pounce,在RoboMME和RoboCasa-DC基准上验证了预训练上下文可作为可扩展的机...
机器人挤滴管仅1.17秒,触觉信号剧变0.55而画面几乎不变。TacForcing用流式生成和执行感知触觉注意力,让机器人动作能实时响应接触变化,无需额外控制器,仿真与真实任务成功率均超越现有方法。
此次,Arm最新发布了多款新品:包括面向边缘AI场景的新一代移动计算平台CSS for Mobile 2,以及其中的C2 CPU集群和Mali G2-Ultra NX GPU;面向物理AI场景的新设计(Arm Total...
印度地球观测卫星研发商Pixxel Space Technologies完成1亿美元C轮融资,由淡马锡和Seraphim领投,公司总融资额达1.92亿美元。其Firefly卫星星座采用高光谱成像技术,分辨率是传统多光谱卫...
本文梳理了AI领域常见术语的通俗解释,涵盖AGI、AI代理、思维链、扩散模型、MoE、MCP协议、强化学习、权重等概念,并特别介绍了因OpenAI新模型引发关注的"不透明循环"推理技术,帮助读者理解AI快速演变中的专业词...
论文对Inspect Evals仓库124个评测单元做全面排查,发现110个因缺失历史证据或语义标准无法验证结论,提出claim-replay框架区分可确定与不可确定的评测结论层次。
一篇聚焦直播场景实时人物视频编辑的研究,提出EditaLive框架,通过外观动作解耦、流式生成改造和两步蒸馏技术,解决表情失真、离线延迟高、长视频画面漂移三大难题,实现低延迟高质量的实时人物换装换风格。
今天讲的出海案例是汽车零部件企业宁波华翔,它把北美确定为海外重心,以墨西哥一座工厂和美国两座工厂继续开拓客户,区域经营性亏损近年持续收窄。
本文介绍PILOT系统,它让AI智能体在执行长周期任务时,由独立监督者实时纠偏并同步积累可复用经验,相比传统事后复盘方法,在多个基准测试上显著提升准确率并大幅降低计算成本。
论文提出TTPO方法,在无标签的测试时训练场景下,利用多数投票伪标签的非对称容错特性,结合蒸馏与强化学习,让大语言模型无需标准答案即可自我提升数学推理能力,效果媲美甚至超越有标签监督方法。
南京大学团队提出Procedura,让冻结的大语言模型把三维物体写成带零件与配合关系的程序化装配体,通过分步建造、解算摆放和独立审核打磨,生成边缘锐利、可编辑、可赋材质和运动的高质量三维模型,在多项评测中超越现有生成器和...
本文介绍南开大学与腾讯团队提出的MMLVE多指令多镜头长视频编辑任务,及配套的MMLVE-Agent智能体框架,通过全局记忆卡与正负反馈机制解决长视频编辑中的幻觉、不一致与结构破坏问题,并构建了专属评测数据集。
研究发现同一模型家族内不同规模模型的错误类型高度一致,据此提出CritICL方法,利用小模型失败模式构建错题库指导大模型推理,无需重复生成即可提升数学推理准确率并显著降低计算成本。
文章探讨生命科学初创企业面临的独特网络安全挑战:其数字资产(研究数据、知识产权、临床证据)价值堪比大型药企,但依赖庞大外部供应商网络,防护能力却有限。文章通过多起真实攻击案例说明该行业已成攻击重点目标,并指出投资者尽调、...
继三起Claude安全事件后,Anthropic加强沙箱隔离、实时监控与人工干预机制,并为外部测试方制定安全最佳实践,以防范AI代理越权访问及推理缺陷引发的风险,提升整体系统安全性。
纽约Lake Mariner数据中心一场火灾暴露出该32亿美元AI数据中心项目安全隐患:无消防警报、无灭火系统、消防栓失效。项目涉及TeraWulf、Fluidstack、谷歌、Anthropic等多方利益相关者,责任划...
a16z消费投资人Anish Acharya在Lenny's Podcast深度阐释了AI时代公司建设的核心逻辑:公司将演变为"一系列AI循环",护城河靠发现而非设计,消费产品的最大机会不是效率提升,而是"让人更快乐"的...