扰动敏感度当 reward:TaRO 与 RL post-training 里 self-critique 的一种新范式
DeepSeek-R1 之后 RL post-training 有一条被反复强调的假设:任务必须有可判定的正确性。数学题答案对错可算、代码 unit test 可跑、编译器可判——只有在这些"verifiable reward"存在的任务上,纯 RL 才能把 reasoning 能力推到 emergence。我在 Chinchilla → 2026 的 §9.5 里把这条论断当作 R1 范式的核心承诺。 ...