知识蒸馏教出了会推理的学生,却教丢了它的常识
论文发现知识蒸馏在中期训练阶段会让语言模型推理能力提升但事实记忆下降,研究者提出按教师预测熵路由的开关蒸馏方法,在保留推理增益的同时几乎完全保住事实记忆,效果延续到后训练阶段。
论文发现知识蒸馏在中期训练阶段会让语言模型推理能力提升但事实记忆下降,研究者提出按教师预测熵路由的开关蒸馏方法,在保留推理增益的同时几乎完全保住事实记忆,效果延续到后训练阶段。
近日,在华大集团2026全球新品发布会期间,华大集团首席执行官尹烨来到生态合作伙伴金山办公的展位,展开新一轮合作交流。
企业私有云选型看似是在比较计算、存储和网络功能,实际决定项目成败的往往是另一组问题:存量硬件能否利旧,多套资源池能否统一管理,虚拟机与容器是否需要两套平台,服务目录和审批能否落地,以及三年后扩建数据中心时是否需要重新建设...
Arm AI Portal 将超过 2,200 万开发者及其智能体连接至 Arm 计算平台上的优化 AI 软件,覆盖云、边缘和物理 AI。
9 月 9 日至 13 日,2026 年中国国际服务贸易交易会在北京首钢园举办。作为会议专题活动,由中国信息协会主办的,以「智启未来 应用无界——从模型创新到场景落地」为主题的“2026中国AIGC创新应用交流会”于 9...
Pera是复旦大学等机构提出的持久AI智能体架构,主张智能体不仅要完成单次任务,还需持续感知环境变化,主动维护和更新自身服务能力,实现真正的长期陪伴式智能服务。
本文介绍StudentSim框架,通过池化训练与个体特化两阶段方法,训练出既能复现真实学生答题习惯又能响应老师指导的AI学生模拟器,在国际象棋、英语写作、数学三大领域超越GPT-5.4等闭源模型,并可反哺AI辅导老师的强...
多跳问答里,问题和证据的颗粒度常常对不上。Hi-Q提出让证据说了算,先测试查询能否被解决,不能才拆解,还能保证子问题按依赖顺序执行,在多个基准上超过图检索和迭代检索方法。
统一多模态模型能否让视觉理解和生成互相促进?论文从表征、任务、系统三层面揭示:架构设计决定协同或冲突,共享知识的任务能双向提升,端到端模型在复杂任务上优于分步流水线。
ZimaBlue是一个从超12万小时第一视角视频中学习机器人操作能力的世界动作模型,通过三阶段训练和Slow-Fast双系统架构,将零样本任务成功率从36.1%提升到77.8%,同时把控制延迟压缩到33毫秒。
IBM与Lockheed Martin联合苏黎世联邦理工建立瑞士量子创新中心,将于2026年底部署瑞士首台IBM Quantum System Two,搭载120量子位Nighthawk r2处理器,服务化学、材料、优化...
Google、Meta等发现服务器芯片存在静默数据错误(SDE),即使通过传统测试仍会产生计算错误。业界正通过深度功能测试、系统级监测及舰队级筛查等多层手段应对该问题。
随着制程迈向2nm以下,晶体管尺寸缩小、良率余量收窄,测试、量测、检测与制造环节日益交织。先进检测可发现数百万潜在缺陷,区分真实良率风险与正常工艺波动愈发困难,行业需构建跨环节数据流动与冗余设计应对挑战。