扰动敏感度当 reward:TaRO 与 RL post-training 里 self-critique 的一种新范式

DeepSeek-R1 之后 RL post-training 有一条被反复强调的假设:任务必须有可判定的正确性。数学题答案对错可算、代码 unit test 可跑、编译器可判——只有在这些"verifiable reward"存在的任务上,纯 RL 才能把 reasoning 能力推到 emergence。我在 Chinchilla → 2026 的 §9.5 里把这条论断当作 R1 范式的核心承诺。 ...

2026年7月6日 · 14 分钟 · LexHsu

ATLAS:视觉推理的动作词表

引言:模型什么时候需要画一条线 几何题里的辅助线很少出现在题目里,却经常决定整道题能不能解出来。计数题里,先把候选目标圈出来,再逐个排除,比直接在自然语言里说“左边那个、上面那个、旁边那个”稳定得多。空间关系题也类似:判断猫有没有碰到杯子,视线会自然落到猫爪和杯脚之间那一小块接触区域。 ...

2026年5月21日 · 12 分钟 · LexHsu
访客 4315 人次 · 访问 5714 次