Kimi K3 技术报告精读:2.8T 开源前沿,与一个 VLA 工程师的读法

Kimi K3 的引言把话说得很直白:过去两年开源生态在 test-time scaling 这条轴上追得很快(RL、长 CoT、agent 并行),但在预训练这条轴上几乎停滞——最近的开源模型大多还挤在 1T 参数量级附近。当越来越精巧的 RL 方法被反复施加到规模相近的预训练底座上,开源的进步会收敛,而与最强闭源系统的差距会继续拉大。K3 的回答是两条轴一起推:把底座做到 2.8T 总参数 / 104B 激活参数,同时在 1M 上下文下做长程 agentic RL[1]。 ...

2026年7月27日 · 38 分钟 · LexHsu

Wan2.2 and the Boundary of Video World Models

Wan2.2 架构概览:14B MoE DiT + Flow Matching + 3D VAE,详见 Wan2.2 GitHub 1. 承诺:视频生成即世界模拟 当 OpenAI 在 2024 年初发布 Sora 时,其叙事框架经过了精心设计:这不仅仅是一个视频生成器,而是一个"世界模拟器"。模型生成了数字生物在物理环境中导航的长达一分钟的视频片段,物体以合理的方式碰撞和变形,镜头运动遵循三维空间的几何约束。潜台词非常明确——一个能够预测世界下一刻模样的模型,在某种层面上,必然理解世界是如何运作的。 ...

2026年3月14日 · 27 分钟 · LexHsu

Qwen3.5 vs Qwen3: A Deep Architectural Comparison

Figure from Qwen3.5-Omni Technical Report 本文基于 Qwen3.5 官方技术文档及代码结构分析,系统梳理 Qwen3.5 相较于 Qwen3 在架构层面的代际演进。两者之间的差异远非简单的参数调优,而是在注意力机制、多模态融合方式、稀疏化策略和位置编码等多个维度上进行了根本性的设计重构。 ...

2026年3月7日 · 12 分钟 · LexHsu
访客 4315 人次 · 访问 5714 次