DINOv3:自监督视觉基模的规模化困局与 Gram Anchoring 破局

一个被忽视的现象:规模越大,特征越差 自监督视觉学习的叙事长期以来被一个乐观的假设驱动:更大的模型、更多的数据、更长的训练,必然带来更好的表征。DINOv2 验证了这个假设的前半段——1.1B 参数的 ViT-g 在 ImageNet linear probing 上达到 86.5%,在 ADE20K 语义分割上达到 49.5 mIoU,证明了自监督学习的可扩展性 [1]。 ...

2026年1月24日 · 11 分钟 · LexHsu

V-JEPA 2.1: When Self-Supervised Vision Learns to See Every Pixel

核心问题:全局语义与局部定位的断裂 Yann LeCun 将联合嵌入预测架构(JEPA)视为通向自主机器智能的核心路径 [3],其基本假设优雅而有力:预测应当在潜在空间中进行,而非像素空间。与其耗费模型容量去重建每一个像素——其中大量细节与预测目标无关——JEPA 选择预测缺失输入的表征。V-JEPA 2 [2] 将这一思想引入视频领域,取得了令人瞩目的成果,在动作识别(Kinetics-400: 87.3%)和视频-文本检索任务上均达到了当时的最佳水平。 ...

2026年1月10日 · 20 分钟 · LexHsu

CORAL:面向开放式发现的自主多Agent进化

引言 图片来自 CORAL: Autonomous Multi-Agent Evolution for Open-Ended Discovery 开放式发现(Open-Ended Discovery)——在解空间缺乏清晰结构、评估可能代价高昂或信号稀疏的领域中搜索新颖且高质量的解——仍然是自动科学推理中最困难的挑战之一。与梯度或凸性可以引导搜索方向的约束优化不同,开放式问题要求持续的探索、部分洞察的积累,以及在进展停滞时重新调整方向的能力。数学猜想证明、系统级代码优化、组合设计等问题都属于这一范畴。 ...

2025年11月22日 · 16 分钟 · LexHsu

扩散模型与自动驾驶规划:从去噪的数学到轨迹的生成

为什么自动驾驶需要扩散模型? 自动驾驶规划的核心难题在于"找到正确的轨迹分布",而非仅仅是"找到一条轨迹"。 考虑一个简单场景:自车接近一个无信号灯的 T 字路口。存在三种合理选项——左转、右转、直行通过。传统回归模型(L1/L2 损失)训练后面对此场景会输出三条轨迹的平均值:一条斜向路口中央的无意义曲线。这是损失函数的结构性局限,而非模型的能力缺陷——L2 回归在多模态分布上的最优解恰好是条件均值,而条件均值在物理上可能根本不可行。 ...

2025年11月8日 · 26 分钟 · LexHsu

ReconVLA:用 gaze-crop 重建给 VLA 视觉接地

OpenVLA 一线 VLA 把 vision token + text token + action token 全部 concat 给 LLM,用 next-token cross-entropy 监督,推理时 LLM 直接吐离散化 action token。这套 pipeline 训出来的 attention map 有一个反复出现的问题:散。VLA 看场景跟看哪个具体物体之间没区分,attention 几乎均匀铺在整个 frame 上。 ...

2025年10月27日 · 11 分钟 · LexHsu

InSpatio-World: Real-Time 4D World Simulation via Spatiotemporal Autoregressive Modeling

Figure from InSpatio-World: Real-Time 4D World Simulation via Spatiotemporal Autoregressive Modeling 模拟一个随时间演化且可从任意视角观察的 4D 世界,是自动驾驶、机器人和具身 AI 的基础能力。现有的视频生成模型能够产生视觉上连贯的序列,但在相机移动时缺乏空间一致性。3D 重建方法实现了几何保真度,却在动态场景和实时性能方面捉襟见肘。InSpatio-World 通过时空自回归(STAR)架构弥合了这一鸿沟,融合了两种范式的优势。 ...

2025年10月25日 · 7 分钟 · LexHsu

Reinforcement Learning for End-to-End Autonomous Driving: From Offline DPO to Iterative Self-Improvement

引言 将强化学习(Reinforcement Learning, RL)集成到端到端自动驾驶系统中,已成为突破监督学习轨迹规划能力天花板的可行方向。然而标准 RL 算法在驾驶任务上的直接应用面临三重基本挑战:日志回放环境中难以弥合的 sim-to-real gap、在线仿真造成的计算瓶颈,以及为连续轨迹生成定义稠密 reward signal 的固有困难。 ...

2025年9月20日 · 12 分钟 · LexHsu

Multi-Head Latent Attention: DeepSeek V2/V3 工程视角

本文聚焦工程视角。 MLA 的数学推导(从 RoPE 出发到 latent 投影、partial RoPE 的兼容性证明、权重吸收的代数推导)详见 https://xuquant.com/posts/mathematics/position-encoding/mla-from-rope/。本文不重复这些数学内容,只讨论 DeepSeek V2/V3 实际部署中关心的工程数字与设计取舍。 ...

2025年9月13日 · 5 分钟 · LexHsu

Alpamayo:面向自动驾驶的推理-动作对齐 VLA 系统

引言 端到端自动驾驶近年来取得了显著进展,然而在真实驾驶场景中部署视觉-语言-动作(Vision-Language-Action, VLA)模型仍面临挑战。基本困难有四。其一,多帧时序理解要求模型从高度冗余的连续观测中提取决策相关的变化,而非仅处理静态快照。其二,驾驶决策必须是因果性的:模型必须建模为何采取某动作,而非仅学习场景与动作之间的统计相关性。其三,预测轨迹必须在满足运动学和动力学约束的同时保持多模态性,且足够高效以实现实时推理。其四,推理过程必须与动作输出紧密对齐——推理不应是事后合理化,而必须可被实际执行的动作验证和约束。 ...

2025年8月30日 · 8 分钟 · LexHsu

Policy Optimization for End-to-End Autonomous Driving: From REINFORCE to GRPO

1. 为什么端到端驾驶需要强化学习 Figure from AlphaDrive: GRPO-based RL for Autonomous Driving 监督学习——无论是通过模仿学习(imitation learning)还是行为克隆(behavior cloning)——只能将自动驾驶系统带到一定水平。其根本局限在于分布性:训练数据来自专家演示,训练与部署之间的任何分布偏移都会导致误差累积。更关键的是,监督目标与驾驶的真正目标存在错位。最小化与真实轨迹的 L2 距离会同等严厉地惩罚安全偏差和危险偏差,且没有机制让模型发现比数据集中更好的轨迹。 ...

2025年8月9日 · 17 分钟 · LexHsu
访客 4315 人次 · 访问 5714 次