Inertia-1: An Open Exploration to a Unified Motion Foundation Model2 months agohttps://yang-ai-lab.github.io/Inertia-1/Inertia-1引入了一种统一的运动基础模型,它克服了数据采样率和传感器位置不一致等问题,使单一表征无需重新训练即可适应不同设置。该模型利用超过1800万小时的加速度计数据进行自监督学习,并在不同身体位置和传感器类型(如陀螺仪、磁力计)下保持性能,多流输入提高了准确性和聚类效果。关键实践洞察包括:任务的最佳窗口为30-60秒、三轴输入优于矢量幅度输入、时域建模可保留步态线索,以及在低至1 Hz的采样率下仍具有稳健的活动识别能力。
The Annotated JEPA3 months agohttps://elonlit.com/scrivings/the-annotated-jepa/JEPA(联合嵌入预测架构)是Yann LeCun提出的自监督学习方法,通过在表示空间中进行预测来训练模型理解世界,无需标签,同时避免琐碎解和不相关细节。I-JEPA作为JEPA的图像实例化,训练上下文编码器来预测掩码目标区域的表示,使用通过指数移动平均(EMA)更新的目标编码器以防止坍塌,并通过预测器最小化嵌入空间中的均方误差。I-JEPA的关键设计选择包括:基于补丁的标记化、上下文和目标块无重叠的掩码策略,以及在目标编码器输出中应用掩码以确保高级语义表示。V-JEPA将JEPA扩展至视频领域,通过掩码时空三维块,学习捕捉运动和内容的表示而无需像素重建,从而在视频理解任务中实现强大性能。V-JEPA 2进一步证明,JEPA可通过学习到的表示支持分类、未来潜在状态预测以及机器人中的动作条件规划,从而实现理解、预测和规划。LeJEPA引入了一种理论基础的变体,使用草图各向同性高斯正则化(SIGReg)来强制各向同性高斯嵌入分布,旨在消除如EMA教师之类的启发式方法,并提供稳定的训练。JEPA被构建为基于能量的模型,其中表示空间中的预测误差定义能量,并作为世界模型的核心组件,通过搜索抽象潜在状态而非像素来实现规划。该架构与自回归语言模型形成对比,专注于原始感官数据(如图像、视频)以学习物理世界结构,将JEPA定位为涉及预测和行动的自主智能系统的基础。