Kimi K3 技术报告精读:2.8T 开源前沿,与一个 VLA 工程师的读法

Kimi K3 的引言把话说得很直白:过去两年开源生态在 test-time scaling 这条轴上追得很快(RL、长 CoT、agent 并行),但在预训练这条轴上几乎停滞——最近的开源模型大多还挤在 1T 参数量级附近。当越来越精巧的 RL 方法被反复施加到规模相近的预训练底座上,开源的进步会收敛,而与最强闭源系统的差距会继续拉大。K3 的回答是两条轴一起推:把底座做到 2.8T 总参数 / 104B 激活参数,同时在 1M 上下文下做长程 agentic RL[1]。 ...

2026年7月27日 · 38 分钟 · LexHsu

扰动敏感度当 reward:TaRO 与 RL post-training 里 self-critique 的一种新范式

DeepSeek-R1 之后 RL post-training 有一条被反复强调的假设:任务必须有可判定的正确性。数学题答案对错可算、代码 unit test 可跑、编译器可判——只有在这些"verifiable reward"存在的任务上,纯 RL 才能把 reasoning 能力推到 emergence。我在 Chinchilla → 2026 的 §9.5 里把这条论断当作 R1 范式的核心承诺。 ...

2026年7月6日 · 14 分钟 · LexHsu

MiniT2I:把文生图拉回 ImageNet 实验台

一、一个被默认接受的复杂性 文生图(Text-to-Image,T2I)在过去三年里逐渐变成一个让人觉得"高不可攀"的研究方向。SD3、FLUX.1-dev、DALL·E 3、Show-o2、BAGEL、Tuna-2 这些工作做得漂亮,但门槛也写得很清楚——多十亿参数的模型、十亿级图文对、上千卡的训练预算、VAE + DiT + RL + cascade 的工程流水线。学术组想做一篇 T2I 论文,第一反应是:先攒卡。 ...

2026年6月23日 · 14 分钟 · LexHsu

训练大模型的 Scaling Law:科学、工程与边界

2026-06-25 更新:本文从原"训练大模型的工程学:从 Chinchilla 到 2026"全面升级——前半段(§1-§4)补齐 Lilian Weng 在 Scaling Laws, Carefully 中梳理的 scaling law 完整科学叙述(前史、Why power law、数据约束、拟合脆弱性),并增加一个交互式 D3 拟合 playground;后半段(§5-§10)保留原文的越界训练、训练基建、Post-training、VLA 工程清单,但每节都加上前半段科学结论在 VLA 场景的具体投影。Lilian 原文是这次升级的主要参考来源——我做的是把她的科学叙述与本博客原有的工程落地视角融合。 ...

2026年6月7日 · 43 分钟 · LexHsu

Qwen-VLA 解读:T2A 解压先验、流匹配 PPO、跨形态零样本

Qwen-VLA(Qwen Team,arXiv:2605.30280,2026-05-28 v1)把 Qwen3.5-4B 的多模态骨干扩展到机器人操作 + 视觉语言导航 + 自我中心人类轨迹三类任务。架构上是 Physical Intelligence π₀ 系谱的 VLM + DiT 流匹配动作专家组合;真正想清楚的设计在训练侧:四阶段 recipe 把"语言→动作先验"从"视觉→动作接地"中分离出来,T2A 阶段冻住 VLM、屏蔽全部图像、只用文本和 embodiment prompt 训练 DiT,让动作分布的语言索引在视觉介入之前就学完。 ...

2026年5月28日 · 16 分钟 · LexHsu

VLA 加几何 backbone 的负结果:GR00T × VGGT 三架构对照

NVIDIA + MIT + UT Austin 团队(Yang et al., arXiv:2605.24642)把 GR00T-N1.5(manipulation VLA)跟 VGGT(geometric foundation model)拼起来,做了 Early Fusion / Late Fusion / Spatial Forcing 三种几何注入架构的 controlled 对照实验。主结果是一个负结果:standard finetune 下没有一种几何 VLA 在 RoboCasa average 上显著(p < 0.05)超过 GR00T baseline。 ...

2026年5月28日 · 14 分钟 · LexHsu

HiF-VLA:把 codec 副产品当成 VLA 的时间记忆

CVPR 2026 的 HiF-VLA(项目页 / 代码),西湖 + 浙大 + 港科广 + 南大那拨人做的。架构上是 OpenVLA 之上挂两件事:往前用 VLM 直接预测未来 motion vectors,往后用一组历史 motion vectors 经 AdaLN 调制动作流。LIBERO-Long multi-view 刷到 96.4%,比堆 4 帧历史的方案显存少 1/2、延迟少 2/3。 ...

2026年5月27日 · 10 分钟 · LexHsu

ATLAS:视觉推理的动作词表

引言:模型什么时候需要画一条线 几何题里的辅助线很少出现在题目里,却经常决定整道题能不能解出来。计数题里,先把候选目标圈出来,再逐个排除,比直接在自然语言里说“左边那个、上面那个、旁边那个”稳定得多。空间关系题也类似:判断猫有没有碰到杯子,视线会自然落到猫爪和杯脚之间那一小块接触区域。 ...

2026年5月21日 · 12 分钟 · LexHsu

代码即感知:当大模型「看得懂代码」才是攻克理科题的钥匙

引言 多模态大语言模型(MLLM)在 STEM 视觉推理上的表现长期不尽如人意。面对一张立体几何截面图或函数图像,模型往往能给出看似合理的推理步骤,却在关键的空间关系、数量属性上犯下低级错误——根本没"看准"图。 ...

2026年5月2日 · 11 分钟 · LexHsu

凯明的方法论:从 ResNet 到 iMF —— 一个本质追问者的研究路径

一、辨识度从何而来 何恺明(Kaiming He)的论文有一种一眼能认出的辨识度。 这种辨识度并非来自文风。他的论文写作并不华丽,公式不多,章节短,图也常常只有一两张关键示意。真正"凯明味"的来源是方法本身的朴素的极致——把方法削减到几乎不能再简化的程度,但每一次削减都站在一个更深的先验(prior)上,因此不构成 cheating。 ...

2026年4月18日 · 21 分钟 · LexHsu
访客 4315 人次 · 访问 5714 次