Kimi K3 技术报告精读:2.8T 开源前沿,与一个 VLA 工程师的读法

Kimi K3 的引言把话说得很直白:过去两年开源生态在 test-time scaling 这条轴上追得很快(RL、长 CoT、agent 并行),但在预训练这条轴上几乎停滞——最近的开源模型大多还挤在 1T 参数量级附近。当越来越精巧的 RL 方法被反复施加到规模相近的预训练底座上,开源的进步会收敛,而与最强闭源系统的差距会继续拉大。K3 的回答是两条轴一起推:把底座做到 2.8T 总参数 / 104B 激活参数,同时在 1M 上下文下做长程 agentic RL[1]。 ...

2026年7月27日 · 38 分钟 · LexHsu

训练大模型的 Scaling Law:科学、工程与边界

2026-06-25 更新:本文从原"训练大模型的工程学:从 Chinchilla 到 2026"全面升级——前半段(§1-§4)补齐 Lilian Weng 在 Scaling Laws, Carefully 中梳理的 scaling law 完整科学叙述(前史、Why power law、数据约束、拟合脆弱性),并增加一个交互式 D3 拟合 playground;后半段(§5-§10)保留原文的越界训练、训练基建、Post-training、VLA 工程清单,但每节都加上前半段科学结论在 VLA 场景的具体投影。Lilian 原文是这次升级的主要参考来源——我做的是把她的科学叙述与本博客原有的工程落地视角融合。 ...

2026年6月7日 · 43 分钟 · LexHsu
访客 4315 人次 · 访问 5714 次