AI论文略读

注意:下文含有较多AI生成内容.

2604.02721 GrandCode击败了所有人类选手荣获LGM

这篇论文的意思是,他们通过SFT和RL(agent强化的GRPO)做了一个能打败所有人类的编程高手.
这个高手是基于Qwen3.5开发的.

这个AI的工作流很像正常人类做题的手段:
首先整一个小模型把问题输进去推测可能的做法(假设生成),然后用暴力快速验证,如果真了就继续,如果假了就重新推,直到每步都正确,然后把思维链和做法注入进来给负责写代码的大模型,然后用暴力验证假设正确,然后再优化算法.

这个系统的样例使用了其他论文的样例生成系统(2506.05817)
这个团队还做了一个小型分类器,大致把问题分成5类.

然后AI接入了OEIS,能在线搜索数列.
然后介绍了一下问题,对于图像敏感型题目,尝试把图像转成文字描述不如直接让AI阅读图片(Qwen3.5是多模态的)

后训练

用其他的比如claude或者gemini生成语料库作为训练材料.

SFT 监督微调

(problem,thinking,solution) 三元组

test-time RL

这篇文章也提到了test-time,这是什么东西???

训练

训练的源代码并没有公开,只有这个系统的提交记录.

2604.24827 不可压缩知识(IKP):估测大模型参数量

这篇论文的意思是,事实性知识是不能压缩的(比如中国的首都是北京),而且也不可能推理出来.
所以对于模型大小的评估可以通过这些事实性知识做成探针去大致推测,不管开源还是闭源.

作者首先对各种新模型提问:你对hackergame了解多少?(hackergame已经完结力)

然后引用:transformer一般在前馈网络存储信息,且一个参数大致能存储2-3.6bit的信息.
然后做一个实验:用研究员和引用数,测试模型能不能认出来研究员.
结果是引用多的不一定能认出来,但是引用少的很大概率就认不出来…
而且名字很普遍的不容易认出来(很像搜索引擎,噪声大一些)

然后有下面的观点:

  • Densing Law 认为:模型能力密度每3.5个月翻倍(例如2026年的7B模型可达2023年70B模型的MMLU水平),因此单纯扩大参数规模已不重要。
  • 论文的核心反驳(第2-3页,第17页):Densing Law 只适用于“可压缩的程序性能力”(推理、指令遵循等),不适用于“不可压缩的事实性知识”
  • 评估MoE模型的知识容量时,应该按总参数算,而不是按激活参数算。这也意味着,如果按此标准,很多MoE架构的前沿模型的“有效大小”会比其激活参数所暗示的要大得多。
  • 论文提出了一种仅通过API回答即可判断模型之间关系的方法(第6.9节,第20-22页),称为“知识指纹”。核心指标是 “幻觉相似度”(Hallucination Similarity, HSS):当两个模型都答错同一个冷门问题时,它们给出相同错误答案的比例。
  • 安全对齐:越追求安全的模型IKP得分越低,不代表真实参数量(点名claude sonnet)

相关链接:IKP仓库

2411.04368 SimpleQA测试模型基础短事实能力

这是OpenAI发的比较古早的文章,大意是通过基础短事实去测试模型大小.

  1. 高正确性:每道题由两名独立的 AI 训练员独立作答,答案一致才保留;要求提供网页来源支持
  2. 研究者友好:问题答案都很短,运行和评分速度快(可用 GPT API 自动评分),方差低
  3. 对前沿模型有挑战性:题目是对抗性收集的——针对 GPT-4 的回答来设计难题。GPT-4o 和 Claude 的得分都低于 50%
  4. 多样性:涵盖历史、科技、艺术、地理、影视等多个领域
  • 必须有唯一、无可争议的答案(如问”哪个城市”而非”在哪里”)
  • 答案不会随时间变化(如影视问题需指定季数)
  • 必须有网页证据支持
  • 至少有一个 GPT-4 模型答错
  • 以 2023 年 12 月 31 日前的知识为限

每道题的模型回答分为三类:

  • Correct(正确):包含参考答案的关键信息,无矛盾
  • Incorrect(错误):包含与参考答案矛盾的事实陈述
  • Not Attempted(未尝试):未包含关键信息,但也没有矛盾

然后大概测了一下召回和精确率,用F-score设计了一个惩罚(如果蒙对的概率大的情况下,模型倾向于蒙会更赚).
然后让模型自己给自己打一个置信分,结果普遍过于自信.
和IKP的区别在于,当时的 A\ 还没那么畜生,安全策略不是首要的东西,所以claude只是未尝试的概率高一些.

相关链接:
SimpleQA仓库,因为年代过于古早,新AI早就把测试集加进训练中,所以25年7月就被弃用了.

2402.14762 MT bench:评估LLM多轮对话的综合表现

这个bench主要测的是LLM多轮对话的能力,主要有以下特征:

  • Perceptivity(感知力) 准确理解上下文 上下文记忆、指代消解、分离输入、话题转移、内容混淆
  • Adaptability(适应力) 根据用户反馈调整 内容重述、格式重述、数学推理、一般推理、自我纠正、自我坚持
  • Interactivity(交互力) 主动引导对话 指令澄清、主动交互

然后得出了几个结论:

  • 适应力和交互力是现有LLM的短板 —— 模型在”重述”和”抗干扰”上还行,但推理和提问能力明显不足
  • 对话轮次增加后,性能趋势因任务而异:重述类任务:越往后越差(遗忘/理解偏差),推理类任务:越往后越好(但这是因为用了golden context,模型在”抄”历史对话的风格,不是真变强了)
  • RLHF等对齐技术和chat专用设计,对多轮能力提升不明显

当时流行的有alpacaeval测试对话表现的,但只是一轮对话表现.
相关链接:
TextVQA 一个测试数据集.

2501.16084 TTRL:无监督RL,效果拔群

大意是说通过让同一个模型多次投票,然后取众数作为truth(估计标签)进行训练,最后用GRPO/PPO去更新模型参数.

  • TTRL 仅使用无标注的测试数据就能实现自我进化,性能提升巨大。
  • 尽管 TTRL 只使用 Maj@N(多数投票准确率)作为训练信号,但它能超越自身的训练上限,甚至接近使用真实标签直接训练的模型性能。
  • 模型越大,TTRL 的效果越好(从1.5B到7B参数,提升更明显),展现出良好的扩展性。
  • TTRL 具有良好的泛化能力:在某一任务上训练后,在其他任务上也能提升。
  • 与不同 RL 算法(GRPO、PPO)兼容。

  • 模型容量不足时会失效:如 LLaMA-3.1-8B-Instruct 和 Qwen2.5-Math-1.5B 在 AIME 2024 上无法获得有效提升,可能因为模型本身能力不足以生成可靠的多数投票结果。

  • 对于过于困难或分布偏移过大的任务,多数投票的估计可能不够准确。

关于开销:作者认为性能高效的,时间是值得的.
这个故事告诉我们,学霸才能够自学,学渣还是老老实实听课…

2503.01840 EAGLE3: Spec decoding又一力作

EAGLE是 Extrapolative A Generative Language Engine (外推式A生成语言引擎)的简称.

Spec Decoding是为了加快推理速度而使用小模型预测,然后大模型检查,然后EAGLE是不使用小模型,而是对大模型的表层做一个神秘处理然后直接得到token的过程.
decoding就是token预测.

然后作者本来以为无条件堆量让模型大起来就可以增加EAGLE的表现,结果效果不明显.
然后作者推出EAGLE3,让模型采用了好几层特征,丢掉什么损失,最后总一起,用更多信息更多性能换表现.

  • EAGLE 在特征层面做自回归:它预测的是 target model 的顶层特征(hidden states),然后通过 LM head 得到 token
  • 这种”特征预测”对 draft 模型构成了额外约束,限制了其表达能力,导致增加数据无法有效提升接受率

直接预测 token,而非特征

  • 去掉特征预测损失 $l{fea}$​ ,只保留 token 预测损失 $l{token}$​
  • 这样 draft 模型直接输出下一个 token,而不是先预测特征再转换
  • 在训练过程中模拟测试时的多步生成过程——即把 draft 模型上一步的输出 $a_{t+1}$​ 作为下一步的输入,进行反馈训练。这样模型在训练时就适应了”自己的输出作为下一步输入”的情况。

2507.20534 Kimi-K2横空出世