This dataset is a collection of first-person (egocentric) human-object interaction videos captured in everyday environments to support training for Physical AI models. Along with raw video feeds, it provides structured metadata, including Embodied Chain-of-Thought (ECoT) annotations, 3D hand keypoints and skeleton visualizations, and movement trajectories.
Potential Use Cases
- Training Embodied AI & Robotic Manipulation Models: Serves as high-quality demonstration data to train robotic agents in learning human-like object manipulation, hand-eye coordination, and precise trajectory planning in unstructured daily environments.
- Reasoning via Embodied Chain-of-Thought (ECoT): Enables the development of Multimodal Large Language Models (MLLMs) capable of step-by-step spatial reasoning, intent understanding, and planning action sequences from egocentric visual inputs.