一个企业级AI模型如何吃下50%的内部流量
一家企业面对200多个内部应用抢占同一批GPU资源,通过分析生产流量找出指令遵循、工具调用、任务分布三大短板,分别训练强化学习专家再合并权重,最终用320亿参数模型吃下50%流量,超越七倍参数量的大模型,成本降低数倍。
一家企业面对200多个内部应用抢占同一批GPU资源,通过分析生产流量找出指令遵循、工具调用、任务分布三大短板,分别训练强化学习专家再合并权重,最终用320亿参数模型吃下50%流量,超越七倍参数量的大模型,成本降低数倍。
论文提出递归再生数RAI,衡量AI辅助AI研发何时从普通加速转变为自我放大的临界状态,发现该转变取决于反馈结构而非智能水平本身,并揭示多机构网络可能比单一机构更早触发这一临界点。
论文提出SMELT架构,在训练算力、参数量、KV缓存三项预算严格对齐的前提下,让循环中间层两次的MoE Transformer持续跑赢普通模型,最高省下18%训练算力,并揭示第二次循环通过降低注意力沉没提升长文本与上下文...
Arm 开发者关系副总裁 Shantu Roy上台,抛出了一个直击痛点的产业判断:“AI应用的构建,正在从‘以模型为中心(model-centric)’转向‘以系统为中心(system-centric)’。”
上海AI实验室提出Safin-1,通过MARCH架构让循环模型能检索历史状态记忆,并首次将安全能力做成可插拔的持久状态,与上下文记忆共用路由机制,在4B与35B规模上实现能力提升与更优的安全过度拒绝平衡。
论文发现知识蒸馏在中期训练阶段会让语言模型推理能力提升但事实记忆下降,研究者提出按教师预测熵路由的开关蒸馏方法,在保留推理增益的同时几乎完全保住事实记忆,效果延续到后训练阶段。
近日,在华大集团2026全球新品发布会期间,华大集团首席执行官尹烨来到生态合作伙伴金山办公的展位,展开新一轮合作交流。
企业私有云选型看似是在比较计算、存储和网络功能,实际决定项目成败的往往是另一组问题:存量硬件能否利旧,多套资源池能否统一管理,虚拟机与容器是否需要两套平台,服务目录和审批能否落地,以及三年后扩建数据中心时是否需要重新建设...
Arm AI Portal 将超过 2,200 万开发者及其智能体连接至 Arm 计算平台上的优化 AI 软件,覆盖云、边缘和物理 AI。
9 月 9 日至 13 日,2026 年中国国际服务贸易交易会在北京首钢园举办。作为会议专题活动,由中国信息协会主办的,以「智启未来 应用无界——从模型创新到场景落地」为主题的“2026中国AIGC创新应用交流会”于 9...
Pera是复旦大学等机构提出的持久AI智能体架构,主张智能体不仅要完成单次任务,还需持续感知环境变化,主动维护和更新自身服务能力,实现真正的长期陪伴式智能服务。
本文介绍StudentSim框架,通过池化训练与个体特化两阶段方法,训练出既能复现真实学生答题习惯又能响应老师指导的AI学生模拟器,在国际象棋、英语写作、数学三大领域超越GPT-5.4等闭源模型,并可反哺AI辅导老师的强...