Filter by Topic:
All Publications
2026
Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification
Haojie Huang*, Zhang Ye, Linfeng Zhao, Boce Hu, Mingxi Jia, Yu Qi, Ahmed Agha, Dian Wang, Robert Platt†, Robin Walters†
arXiv 2026, In submission
TL;DR
Action Map Policy casts closed-loop 3D manipulation as dense pixel classification, preserving multimodal action distributions while predicting a full action chunk in one forward pass.
Pix2Act: Image-Space Manipulation Policies with Equivariant Augmentation
Haojie Huang*, Linfeng Zhao, Haotian Liu, Zhang Ye, Si-Yuan Huang, Mingxi Jia, Boce Hu, Fangzhou Lin, Yu Qi, Dian Wang, Robin Walters†, Robert Platt†
arXiv 2026, In submission
TL;DR
Pix2Act represents manipulation as continuous image-space keypoint trajectories, enabling equivariant augmentation and robust reconstruction of closed-loop 3D actions.
Retriever: Composing Closed-Loop Asynchronous Robot Programs
Linfeng Zhao, Haojie Huang, Jiayuan Mao, Weiyu Liu, Mykel Kochenderfer†, Lawson L.S. Wong†
arXiv 2026, In submission
TL;DR
Retriever is a programming model and runtime that we use to build hierarchical pipelines for long-horizon, partially observable robot manipulation.
2025
BOSS: Benchmark for Observation Space Shift in Long‑Horizon Task
Yue Yang, Linfeng Zhao, Mingyu Ding, Gedas Bertasius, Daniel J. Szafir
IEEE RA-L 2025
TL;DR
A benchmark for evaluating observation space shift challenges in long-horizon robotic tasks.
Seeing is Believing: Planning to Perceive with Foundation Models and Act Under Uncertainty
Linfeng Zhao, Willie McClinton*, Aidan Curtis*, Nishanth Kumar, Tom Silver, Leslie Kaelbling, Lawson L.S. Wong
arXiv 2025
TL;DR
We use vision-language foundation models as uncertainty estimators inside a symbolic belief-space planner, enabling robots to plan to perceive and act under partial observability.
Learning and Planning with Structured Abstraction for Embodied Decision-Making
Linfeng Zhao
PhD Thesis (2025)
TL;DR
This thesis studies how structured abstractions, including symmetry, compositionality, and belief-state representations, can make learning and planning more efficient for embodied decision-making.
Hierarchical Equivariant Policy via Frame Transfer
Haibo Zhao, Dian Wang, Yizhe Zhu, Xupeng Zhu, Owen Lewis Howell, Linfeng Zhao, Yaoyao Qian, Robin Walters, Robert Platt
ICML 2025
Equivariant Open-vocabulary Pick and Place via Language Kernels and Patch-level Semantic Maps
Mingxi Jia*, Haojie Huang*, Zhewen Zhang, Chenghao Wang, Linfeng Zhao, Dian Wang, Jason Xinyu Liu, Robin Walters, Robert Platt, Stefanie Tellex
IEEE RA-L 2025 (Best Paper Award Honorable Mention, top 5 / 1,700+ papers)
TL;DR
GEM combines patch-level semantic maps, language-conditioned visual relevancy, and equivariant policy learning for sample-efficient open-vocabulary pick-and-place manipulation.
2024
Clebsch‑Gordan Transformers: Fast and Global Equivariant Attention
Clebsch‑Gordan Transformers: Fast and Global Equivariant Attention
Owen Lewis Howell, Linfeng Zhao, Xupeng Zhu, Yaoyao Qian, Haojie Huang, Lingfeng Sun, Wil Thomason, Robert Platt, Robin Walters
In Submission
Robot Tactile Gesture Recognition Based on Full‑body Modular E‑skin
Shuo Jiang, Boce Hu, Linfeng Zhao, Lawson L.S. Wong
In Submission
Practice Makes Perfect: Planning to Learn Skill Parameter Policies
Nishanth Kumar*, Tom Silver*, Willie McClinton, Linfeng Zhao, Stephen Proul, Tomás Lozano-Pérez, Leslie Kaelbling, Jennifer Barry
RSS 2024
TL;DR
We enable a robot to rapidly and autonomously specialize parameterized skills by planning to practice them. The robot decides what skills to practice and how to practice them. The robot is left alone for hours, repeatedly practicing and improving.
ThinkGrasp: A Vision-Language System for Strategic Part Grasping in Clutter
Yaoyao Qian, Xupeng Zhu, Ondrej Biza, Shuo Jiang, Linfeng Zhao, Haojie Huang, Yu Qi, Robert Platt
CoRL 2024
TL;DR
We have developed ThinkGrasp, a plug-and-play vision-language grasping system for heavy clutter environment grasping strategies.
Equivariant Action Sampling for Reinforcement Learning and Planning
Linfeng Zhao, Owen Howell, Xupeng Zhu, Jung Yeon Park, Zhewen Zhang, Robin Walters†, Lawson L.S. Wong†
WAFR 2024
TL;DR
We study the problem of action sampling and propose a method to incorporate equivariance properties to the action sampling procedure.
ThinkGrasp: A Vision-Language System for Strategic Part Grasping in Clutter
Yaoyao Qian, Xupeng Zhu, Ondrej Biza, Shuo Jiang, Linfeng Zhao, Haojie Huang, Yu Qi, Robert Platt
CoRL 2024
TL;DR
We have developed ThinkGrasp, a plug-and-play vision-language grasping system for heavy clutter environment grasping strategies.
E(2)-Equivariant Graph Planning for Navigation
Linfeng Zhao*, Hongyu Li*, Taskin Padir, Huaizu Jiang†, Lawson L.S. Wong†
IEEE RA-L 2024
IROS 2024 (Oral)
TL;DR
We study E(2) Euclidean equivariance in navigation on geometric graphs and develop message passing network to solve it.
2023
Integrating Symmetry into Differentiable Planning with Steerable Convolutions
Linfeng Zhao, Xupeng Zhu*, Lingzhi Kong*, Robin Walters, Lawson L.S. Wong
ICLR 2023
RLDM 2022
TL;DR
We formulate how differentiable planning algorithms can exploit inherent symmetry in path planning problems, named SymPlan, and propose practical algorithms.
Scaling up and Stabilizing Differentiable Planning with Implicit Differentiation
Linfeng Zhao, Huazhe Xu, Lawson L.S. Wong
ICLR 2023
TL;DR
We differentiate through the Bellman fixed point to decouple forward planning from backward computation, enabling a flexible forward budget and constant backward cost in planning horizon.
Sample Efficient Modeling of Drag Coefficients for Satellites with Symmetry
Neel Sortur, Linfeng Zhao, Robin Walters
NeurIPS 2023 Workshop
TL;DR
We study sample-efficient modeling of invariant drag coefficients with equivariant networks.
Equivariant Single View Pose Prediction Via Induced and Restriction Representations
Owen Howell, David Klee, Ondrej Biza, Linfeng Zhao, Robin Walters
NeurIPS 2023
TL;DR
We train an equivariant network for pose prediction from single 2D image by using induced and restricted representations.
Can Euclidean Symmetry Help in Reinforcement Learning and Planning?
Linfeng Zhao, Owen Howell, Jung Yeon Park, Xupeng Zhu, Robin Walters, Lawson L.S. Wong
ICML 2023 Workshop
TL;DR
We study whether Euclidean symmetry can help in reinforcement learning and planning, which models the geometric transformations between reference frames of robots.
2022
Toward Compositional Generalization in Object‑Oriented World Modeling
Linfeng Zhao, Lingzhi Kong, Robin Walters, Lawson L.S. Wong
ICML 2022 (Long Presentation, top 2%)
RLDM 2022
TL;DR
We formulate compositional generalization in object-oriented world modeling, and propose a soft and efficient mechanism for practice.
Learning Symmetric Embeddings for Equivariant World Models
Jung Yeon Park, Ondrej Biza, Linfeng Zhao, Jan-Willem van de Meent, Robin Walters
ICML 2022
TL;DR
We learn latent representations enforced with known transformation laws (group action), and apply this idea on equivariant latent world modeling.
2021
Match Plan Generation in Web Search with Parameterized Action Reinforcement Learning
Linfeng Zhao*, Ziyan Luo*, Wei Cheng*, Sihao Chen, Qi Chen, Hui Xue, Haidong Wang, Chuanjie Liu, Mao Yang, Lintao Zhang
WWW 2021
TL;DR
We propose a parameterized action reinforcement learning algorithm to improve the performance of match plan generation in Bing search.
2020
Deep Imitation Learning for Bimanual Robotic Manipulation
Fan Xie*, Alexander Chowdhury*, M. Clara De Paolis Kaluza, Linfeng Zhao, Lawson L.S. Wong, Rose Yu
NeurIPS 2020
TL;DR
We present a deep imitation learning framework for robotic bimanual manipulation in a continuous state-action space.
Model-based Navigation in Environments with Novel Layouts Using Abstract 2-D Maps
Linfeng Zhao, Lawson L.S. Wong
NeurIPS 2020 Workshop
TL;DR
This work aims to improve the zero-shot generalization performance in map-based navigation on novel layouts.
2019
InterFact: Towards Interactive Factorization of Actionable Entities
InterFact: Towards Interactive Factorization of Actionable Entities
Linfeng Zhao, Hao Su
Preprint 2019
TL;DR
This work proposes a reinforcement learning framework for compositional object-oriented environments.