When Robots Disagree: Taming Gradient Conflicts in Cross-Embodiment Offline RL
A mechanism-first reading of why cross-embodiment offline reinforcement learning can benefit from messy robot data, and why morphology-aware grouping matters when robots start pulling the policy in opposite directions.