LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning
Simplexity Robotics co-authored LaST-R1, a reinforcement-learning post-training framework for latent-reasoning VLA manipulation policies.
Why it matters
LaST-R1 jointly optimizes latent reasoning and action generation, reporting a 99.9% average LIBERO success rate and real-world evaluation on Franka Research 3 hardware.

Evidence notes
- The paper introduces Latent-to-Action Policy Optimization to jointly optimize latent reasoning and action generation.
- LaST-R1 reports a 99.9% average success rate across the LIBERO benchmark suites.
- Real-world evaluation covers four single- and dual-arm manipulation tasks on Franka Research 3 hardware.
Company context
Chinese embodied-robotics company developing general-purpose robot hardware, models and deployment systems.