把每一块显存都榨干:训练超长上下文MoE模型的四个隐藏陷阱
本文解读Salesforce提出的四种显存优化技术,针对MoE长上下文训练中专家调度、词表投影、梯度检查点、优化器状态四大内存瓶颈逐一攻克,实现百万token上下文训练,吞吐量最高提升10.4倍。
本文解读Salesforce提出的四种显存优化技术,针对MoE长上下文训练中专家调度、词表投影、梯度检查点、优化器状态四大内存瓶颈逐一攻克,实现百万token上下文训练,吞吐量最高提升10.4倍。
RAND Corporation发布21页政策分析报告,指出AI驱动的变革、公众对专业知识信任的侵蚀及政治权威格局的转变,正动摇政策分析的制度基础,呼吁该领域回归基本原则,推动制度设计、培训与研究治理现代化。
北京人形机器人创新中心提出Pelican-Sim 1.0,一个通用世界模型模拟器,融合28维统一动作数值与URDF渲染动作视频,配合稀疏MoE架构,实现跨机器人型号的动作预测,并在数据生成、策略评估、动作选择等下游任务中...
本文解读ReMoMask与ReMoMask-2,一种检索增强的文本驱动人体动作生成方法,提出分层双向动量对齐、拓扑结构化掩码、语义时空注意力等模块,并将检索空间迁移至生成器潜变量空间,实现更高保真度与更快推理速度。
AI智能体在正式接任务前能否自主决定如何预习陌生环境?论文提出任务无关的环境预处理框架,用元智能体在六大基准上对比固定策略,发现开放式自主学习总体更优,且能省去测试时的重复尝试。
论文提出ActionSplice框架,通过反事实状态迁移技术,让交互式视频世界模型能在生成过程中即时响应新动作指令,无需等待或重复计算,大幅提升画面响应速度与准确度。
北大团队用591次训练实验严格测试了8种RLVR数据挑选方法和3种自适应策略,发现它们均未能稳定超越简单的均匀随机训练,同时揭示评测题库覆盖不全会导致排名结论截然相反。
本文解读了一份泰语语音合成技术报告,研究团队用大型声音克隆模型OmniVoice处理15秒参考音频生成合成语料,训练出仅82M参数的固定音色学生模型Wayu-Paxa-TTS-Edge,在关键词准确率和停顿精度上部分超越...
Benchmark Radar是一个每日更新的AI基准测试搜索引擎,整合1283条来自四大权威源的评测记录,揭示近四成基准无分数、分数量纲难比较等真实问题,帮研究者查清评测证据来源。
机器人操作模型在实验室里表现优异,但换个摄像头角度就大幅失效。本文提出的潜在接口训练方法,通过先无图像训练动作逻辑、再用姿态监督的窄通道引入视觉信息,在四种主流架构上均提升了泛化能力,真实机器人实验成功率提升超60个百分...
视觉文档检索靠“后期交互”实现高精度,但每页要存上千个向量,存储代价巨大。KAUST团队发现向量分布其实只有五六维自由度,提出GLIE,仅存4个向量即可复原全部信息,压缩比大幅提升且无需重训模型。
研究者发现视频AI能看懂视频"发生了什么",却分不清"什么时候发生"。TempCloze通过让AI从视频片段中挑选正确的缺失中段,揭示了当前视频大模型在时间对齐能力上的系统性短板,远逊于其内容识别能力。
这篇论文提出EvoSafeHarness框架,针对不同AI模型和应用场景自动搜索定制化安全护栏,而非套用统一方案。在四个测试集上验证,攻击成功率大幅下降且不影响正常任务完成率,同一防御方案在不同模型场景下效果差异显著。
西湖大学团队提出World in World,一种无需训练的接口,让冻结的视频世界模型通过原生注意力机制读取多种视觉证据,实现对已录制视频的自由视角探索和事件同步重渲染,性能超越现有方法。