Pre-training DataVideo

Physical AI: Human-Object Interaction Egocentric Dataset

Type
Video
Domain
Lifestyle

Overview

This dataset is a collection of first-person (egocentric) human-object interaction videos captured in everyday environments to support training for Physical AI models. Along with raw video feeds, it provides structured metadata, including Embodied Chain-of-Thought (ECoT) annotations, 3D hand keypoints and skeleton visualizations, and movement trajectories.

Potential Use Cases

  • Training Embodied AI & Robotic Manipulation Models: Serves as high-quality demonstration data to train robotic agents in learning human-like object manipulation, hand-eye coordination, and precise trajectory planning in unstructured daily environments.
  • Reasoning via Embodied Chain-of-Thought (ECoT): Enables the development of Multimodal Large Language Models (MLLMs) capable of step-by-step spatial reasoning, intent understanding, and planning action sequences from egocentric visual inputs.
Flitto Curation Data Flitto Curation Data