LIVE INDEX / 最新文章
没有标签能让模型考完试却不知道自己考的题是对是错,这听起来是个悖论。但这正是"测试时训练"要解决的怪事:让一个大语言模型在做题过程中自我提升,而全程没有人告诉它答案对不对。

没有标签能让模型考完试却不知道自己考的题是对是错,这听起来是个悖论。但这正是"测试时训练"要解决的怪事:让一个大语言模型在做题过程中自我提升,而全程没有人告诉它答案对不对。

论文提出TTPO方法,在无标签的测试时训练场景下,利用多数投票伪标签的非对称容错特性,结合蒸馏与强化学习,让大语言模型无需标准答案即可自我提升数学推理能力,效果媲美甚至超越有标签监督方法。