1月30日消息,千问C端应用团队的四篇人工智能领域研究论文入选2026国际学习表征会议(ICLR 2026),论文聚焦扩散模型训练、多轮对话决策、信息验证及模型价值观对齐等关键问题,部分成果已有实际应用,推动AI助手在复杂场景下更加聪明、可靠、实用。
ICLR与NeurIPS、ICML并称为机器学习和人工智能领域三大顶级国际会议。本届会议投稿量接近19000篇,接收率创下近年来新低。
本次四篇论文在多个前沿领域取得创新突破。在扩散语言模型(Diffusion Models)研究方面,千问C端应用团队针对dLLM独特的掩码训练不稳定性,将其系统分解为了三种不同的噪声来源,并相应提出帕累托最优的无偏训练算法。该算法显著降低了dLLM的训练波动、进而提升其图文生成质量。这意味着在内容生成、创作辅助等应用中,AI输出将更加稳定。
围绕医疗多轮对话中的复杂推理任务,团队提出了自适应树策略优化(ATPO)方法,使AI能够根据对话中的不确定性动态调整决策路径。当信息不足时,AI会主动追问关键问题;当线索清晰时,则快速给出判断。这一能力可帮助AI助手在医疗咨询等专业场景学会“主动问诊”,让AI像经验丰富的医生一样,只问最关键的问题,避免无用的来回对话。
在信息检索与验证方面,研究团队构建了“提问—解答—验证”的自博弈强化学习框架,使AI在无需人工标注的情况下不断自我验证与进化。这一机制有助于提升AI在复杂问题下的检索与核验能力,在学习辅助、研究支持等知识密集型场景中表现更为可靠。
此外,在模型价值观对齐研究中,团队引入信息论偏见消除方法,引导奖励模型关注真正与人类偏好相关的信号,减少冗长、格式化但信息密度不高的输出。这使得AI在训练过程中真正关注能够帮助到用户的核心要点,降低模型输出中出现“表面迎合但缺乏实质内容价值”的情况。
业内专家指出,当前大模型竞争正从“参数规模”转向“算法深度与工程实效”。千问C端应用团队在生成稳定性、多轮对话决策和模型对齐等方向上的系统性探索,体现了其在基础算法与应用导向研究上的持续投入。
值得一提的是,此次千问C端应用团队入选 ICLR 2026 的四篇论文相关代码均已开源。通过开放核心实现细节,将为行业在提升AI可用性、可靠性方面提供有益参考。
好文章,需要你的鼓励
企业AI搜索公司Glean宣布年度经常性收入(ARR)达3亿美元,较15个月前的1亿美元增长三倍。尽管谷歌、微软、OpenAI等科技巨头纷纷入局企业AI搜索市场,Glean凭借"上下文图谱"技术深度理解企业业务需求,并帮助客户显著降低AI计算成本。该公司提供按用量计费和混合定价两种模式,客户涵盖Databricks、Reddit、Pinterest及三星等企业。Glean上轮融资后估值达72亿美元。
香港中文大学与MiniMax提出ClaimDiff-RL框架,将图像描述的AI训练从整体打分升级为逐条核查,有效解决了传统方式导致AI"少说保平安"的问题,同时在多项基准测试上超越Gemini-3-Pro-Preview。
杰夫·贝索斯旗下的蓝色起源公司在佛罗里达卡纳维拉尔角进行静态点火测试时,新格伦重型火箭发生爆炸。这是美国历史上最大规模的火箭爆炸之一,也是蓝色起源公司遭遇的最严重失败。所有人员安全,但该事故可能导致新格伦火箭项目长期暂停。此前该火箭已成功完成三次发射,并实现了助推器回收和重复使用。
ParaVT是一个由南洋理工等多校联合提出的并行视频工具调用框架,通过让AI同时分析多段视频并引入PARA-GRPO算法解决训练中的格式崩溃与工具跳过问题,在六项长视频理解测试中平均提升约7.9%。