给AI喂一张照片,它就能让照片里的人做出你指定的动作:这事到底靠不靠谱?
腾讯联合港科大推出OmniVBench评测基准和Omni-R2V数据集,针对AI视频生成中日益复杂的多参考控制能力,首次提出因子级细粒度评测方法,覆盖7大任务18个子任务,并公开34万条训练样本,揭示当前主流模型在多参考...
腾讯联合港科大推出OmniVBench评测基准和Omni-R2V数据集,针对AI视频生成中日益复杂的多参考控制能力,首次提出因子级细粒度评测方法,覆盖7大任务18个子任务,并公开34万条训练样本,揭示当前主流模型在多参考...
论文提出RiskChainBench基准,测试十个大模型破译网络伪装暗语并追踪调查可疑网站的能力,发现文字复原准确率与网页调查能力常常不匹配,入口识别错误会严重拖累端到端表现,执行失败是探案环节最大瓶颈。
论文提出JEPA-Anything框架,用正交预测因子分解统一视觉、生物、临床、控制、分子、物理场、天气七大领域的预测建模,实验覆盖十项动力学任务、千余临床事件预测及湿实验室生物验证。
本文介绍EvoSkill-GUI,一个训练免费的GUI智能体技能进化框架,通过结构化技能包、即时修订、信息隔离的批评诊断和元数据检索,让智能体从执行失败中自我反思并持续改进,在多个手机电脑基准测试上取得显著成功率提升。
研究团队用标准nnU-Net模型测试脑肿瘤分割在跨病种场景下的泛化能力,发现验证集表现比内部测试低7.47个百分点,集成与增强等技巧收效甚微,小体积且碎片化的肿瘤是主要失败原因。
在PEC 2026 AI创新者大会暨第三届提示工程峰会期间,《原点Talk》迎来了一场特别版,以“2027 出海的机遇和路径”为主题,把这些问题摆上了桌面。
本文介绍AutoArk团队的Edge0推理引擎,通过训练预路由器提前一步预测专家路由、结合可拆卸恢复LoRA补丁,让35B参数混合专家大模型能在24GB内存的普通电脑上流畅运行,速度提升超80%。
MIT 博士生 Alex Zhang 以 Recursive Language Models 和 GPU Mode 社区闻名,在 Latent Space 播客中回顾了自己从一次无聊实习误打误撞进入 GPU 编程社区的经...
Barrett Lyon 曾经历飞机引擎空中骤停的生死瞬间,如今他把同样的冗余思维用在了重建互联网协议上。这篇文章梳理了他创办 DoxxNet 的动机:协议层创新停滞、VPN 治标不治本、运营商级 NAT 扼杀应用潜力,...
论文提出全景接地式描述任务,构建人工标注数据集PanoCaps与gPQ评价指标,并提出PANORAMA模型,将短语接地转化为掩码候选选择,在多项分割与描述基准上取得领先表现,兼顾描述完整性与定位精确度。
本文解读Salesforce提出的四种显存优化技术,针对MoE长上下文训练中专家调度、词表投影、梯度检查点、优化器状态四大内存瓶颈逐一攻克,实现百万token上下文训练,吞吐量最高提升10.4倍。
RAND Corporation发布21页政策分析报告,指出AI驱动的变革、公众对专业知识信任的侵蚀及政治权威格局的转变,正动摇政策分析的制度基础,呼吁该领域回归基本原则,推动制度设计、培训与研究治理现代化。
北京人形机器人创新中心提出Pelican-Sim 1.0,一个通用世界模型模拟器,融合28维统一动作数值与URDF渲染动作视频,配合稀疏MoE架构,实现跨机器人型号的动作预测,并在数据生成、策略评估、动作选择等下游任务中...
本文解读ReMoMask与ReMoMask-2,一种检索增强的文本驱动人体动作生成方法,提出分层双向动量对齐、拓扑结构化掩码、语义时空注意力等模块,并将检索空间迁移至生成器潜变量空间,实现更高保真度与更快推理速度。
AI智能体在正式接任务前能否自主决定如何预习陌生环境?论文提出任务无关的环境预处理框架,用元智能体在六大基准上对比固定策略,发现开放式自主学习总体更优,且能省去测试时的重复尝试。
论文提出ActionSplice框架,通过反事实状态迁移技术,让交互式视频世界模型能在生成过程中即时响应新动作指令,无需等待或重复计算,大幅提升画面响应速度与准确度。