OpenBot
Back to Explore
Manipulation datasetOpen

ManipArena

ManipArena is a comprehensive real-world benchmark for evaluating reasoning-oriented generalist robot manipulation, run as a CVPR 2026 Embodied AI Workshop challenge. It provides 10,812 expert trajectories (~188 hours, 13.5M frames) across 20 real tasks spanning execution-reasoning, semantic-reasoning, and long-horizon mobile manipulation, plus 3 synchronized real-to-sim tasks built via 3D scanning for fair Vision-Language-Action and world-model comparison. Demonstrations are recorded on 5 robot platforms with 3 synchronized RGB cameras (one overhead + two wrist), 56-D proprioception (joint positions/velocities/currents), gripper and mobile-base states, and three-level language annotations, in LeRobot v2.1 format.

Scale
188 hours
Formats
lerobot
License
Apache-2.0
Published
2026-03-30

Decision summary

Best for

teleoperation

Main blocker

Metadata requires review against the official source before publication.

Next check

Read the dataset manifest and feature schema.

Catalog assessment

Selection evidence

73/100

Provisional · confidence 48 · 4/6 evaluated

Access and governance

Access and license are declared by the source.

usefulfit 75 · confidence 85

Schema and signal coverage

No machine-readable schema has been verified yet.

unknownnot scored · confidence 15

Policy training readiness

Observation and action/state signals are declared; alignment quality still depends on sample verification.

usefulfit 85 · confidence 55
View 3 more dimensions

World-model readiness

Temporal observations plus geometry or semantic context are declared; sample alignment remains to be audited.

usefulfit 68 · confidence 50

Failure and recovery readiness

No verified failure/recovery annotation evidence is available yet.

unknownnot scored · confidence 15

Download and processing readiness

Scale is declared; transfer and processing estimates are not measured.

usefulfit 65 · confidence 65
Review unresolved evidence and next checks

Signal gaps

  • Gaze / attention. Not enough evidence is available to classify this signal.
  • Feedback / correction / failure. Not enough evidence is available to classify this signal.

Next checks

  • Read the dataset manifest and feature schema.
  • Run a bounded sample audit before assigning Strong readiness.

Record specifics

Dataset facts

Source
ManipArena (SYSU x MBZUAI)
Evidence
secondary claim
Formats
lerobot
episodes
10812
hours
188
tasks
20
Read paper

Metadata coverage

Loop signals

5/7 present or partial

Gaze / attention

No decision-grade evidence captured yet.

unknown
Feedback / correction / failure

No decision-grade evidence captured yet.

unknown
View 5 more signal categories
Observation / ego video

video · ManipArena is a comprehensive real-world benchmark for evaluating reasoning-oriented generalist robot manipulation, run as a CVPR 2026 Embodied AI Workshop challenge. It provides 10,812 expert trajectories (~188 hours, 13.5M frames) across 20 real tasks spanning execution-reasoning, semantic-reasoning, and long-horizon mobile manipulation, plus 3 synchronized real-to-sim tasks built via 3D scanning for fair Vision-Language-Action and world-model comparison. Demonstrations are recorded on 5 robot platforms with 3 synchronized RGB cameras (one overhead + two wrist), 56-D proprioception (joint positions/velocities/currents), gripper and mobile-base states, and three-level language annotations, in LeRobot v2.1 format.

present
Action / hand pose / robot state

ee_pose · ManipArena is a comprehensive real-world benchmark for evaluating reasoning-oriented generalist robot manipulation, run as a CVPR 2026 Embodied AI Workshop challenge. It provides 10,812 expert trajectories (~188 hours, 13.5M frames) across 20 real tasks spanning execution-reasoning, semantic-reasoning, and long-horizon mobile manipulation, plus 3 synchronized real-to-sim tasks built via 3D scanning for fair Vision-Language-Action and world-model comparison. Demonstrations are recorded on 5 robot platforms with 3 synchronized RGB cameras (one overhead + two wrist), 56-D proprioception (joint positions/velocities/currents), gripper and mobile-base states, and three-level language annotations, in LeRobot v2.1 format.

partial
Language intent / task phase

language · has-success-labels · ManipArena is a comprehensive real-world benchmark for evaluating reasoning-oriented generalist robot manipulation, run as a CVPR 2026 Embodied AI Workshop challenge. It provides 10,812 expert trajectories (~188 hours, 13.5M frames) across 20 real tasks spanning execution-reasoning, semantic-reasoning, and long-horizon mobile manipulation, plus 3 synchronized real-to-sim tasks built via 3D scanning for fair Vision-Language-Action and world-model comparison. Demonstrations are recorded on 5 robot platforms with 3 synchronized RGB cameras (one overhead + two wrist), 56-D proprioception (joint positions/velocities/currents), gripper and mobile-base states, and three-level language annotations, in LeRobot v2.1 format.

present
Sim-real pairing

simulation · ManipArena is a comprehensive real-world benchmark for evaluating reasoning-oriented generalist robot manipulation, run as a CVPR 2026 Embodied AI Workshop challenge. It provides 10,812 expert trajectories (~188 hours, 13.5M frames) across 20 real tasks spanning execution-reasoning, semantic-reasoning, and long-horizon mobile manipulation, plus 3 synchronized real-to-sim tasks built via 3D scanning for fair Vision-Language-Action and world-model comparison. Demonstrations are recorded on 5 robot platforms with 3 synchronized RGB cameras (one overhead + two wrist), 56-D proprioception (joint positions/velocities/currents), gripper and mobile-base states, and three-level language annotations, in LeRobot v2.1 format.

present
License / format / access

Open · Apache-2.0 · lerobot

present
Evidence details and provenance

Official signal claims

Ee_poseLanguageProprioceptionVideo

Schema and annotations

No machine-readable schema facts are captured.

Sample verification

Pending. Metadata does not prove sample coverage, alignment, or file integrity.

curated official source

Integration notes

  • Metadata requires review against the official source before publication.

Catalog links

Related records