关于我
我是一名研究员和 AI 工程师,致力于构建能够感知、理解并与物理世界交互的智能机器人系统。具体来说,我关注具身智能与物理 AI 领域中通用多模态能力与执行能力的构建,以及基础模型的训练。
目前,我在自变量机器人(X Square Robot)工作,是以下项目的核心贡献者:
- Wall-OSS-0.5:我们开源的 4B 视觉-语言-动作(VLA)基础模型,其预训练模型未经任务微调即可在真实机器人上完成操作任务;
- WALL-B 物流分拣:全自主分拣真实物流包裹,已部署到真实产线;
- TwinDEX:本体一致、高效率的灵巧手数据采集系统。
我还参与了 X-Tokenizer 和 WALL-WM 等工作。
此前,我在微软亚洲研究院赵立研究员的团队工作,从事强化学习与具身基础模型(潜在动作模型、VLA、视觉导航)研究。
更长远地,我希望我的研究能够惠及整个社会。
加入我们
我希望与认同 Physical AGI 愿景的优秀伙伴合作,实习、全职均可。我尤其看重:
- 前沿 AI 能力:深入掌握前沿 LLM 与 Agent,并能将其工程化为 Agent 原生的管线,自动化物理 AI 的研究与数据流程;
- 具身数据能力:精通具身数据从采集、质量控制到训练的全链路,并将其构建为严谨、可复现的系统;
- 研究深度:在某个方向上有深入的积累,能识别通往物理 AGI 道路上的关键问题,并以严谨的实验加以验证;
- 扎实基础:数学功底扎实,工程能力出色。
如果你有意愿,或者希望交流,欢迎联系我。
代表工作
WALL-B 物流分拣
核心贡献者WALL-B 具身基础模型驱动双臂,全自主分拣大小、形状、材质各异的真实物流包裹:全球直播中分拣效率达 1816 件/小时、准确率超过 98%,并已与头部物流企业合作部署到真实产线。
最新动态
- 2026.09 发布 TwinDEX:本体一致、高效率的灵巧手数据采集系统。
- 2026.08 WALL-B 模型在全球直播中全自主分拣真实物流包裹:1816 件/小时,准确率超过 98%。
- 2026.06 发布 X-Tokenizer(面向 VLA 预训练的多模态动作分词器)与 WALL-WM(以语义动作事件为学习单元的世界动作模型)。
- 2026.05 开源 4B 视觉-语言-动作基础模型 Wall-OSS-0.5,同步发布技术报告、代码与模型权重。
- 2026.01 论文 villa-X 被 ICLR 2026 接收。
- 2025.09 开源 PIG-Nav 的代码与模型,在图像目标导航任务上取得优异表现。
- 2024.10 发布 IGOR:以图像目标表示作为具身 AI 基础模型的原子控制单元。
代表论文
* 同等贡献 · 全部论文 →
- NeurIPSWhat Do Latent Action Models Actually Learn?In Advances in Neural Information Processing Systems (NeurIPS), 2025
- Report



