北京大学校徽SEKE研究组
登录

SEKE研究组

EvoCoT论文解读——ACL 2026
SATURN论文解读——NeurIPS 2025 Spotlight paper
NEXT论坛
毕业聚餐

EvoCoT论文解读——ACL 2026论文 Blog

RLVR已成为提升大语言模型推理能力的重要方法,但在困难问题上,由于模型初始采样准确率较低,奖励信号稀疏,导致模型难以有效探索。现有方法通常依赖教师模型生成推理轨迹或过滤困难样本,…

最新论文全部 →

arXiv 论文

已发表论文

最近组会全部 →