张蒲石 Pushi Zhang

研究员 · 自变量机器人(X Square Robot)

让智能走向物理世界。

张蒲石

关于我

我是一名研究员和 AI 工程师,致力于构建能够感知、理解并与物理世界交互的智能机器人系统。具体来说,我关注具身智能与物理 AI 领域中通用多模态能力与执行能力的构建,以及基础模型的训练。

目前,我在自变量机器人(X Square Robot)工作,是以下项目的核心贡献者:

  • Wall-OSS-0.5:我们开源的 4B 视觉-语言-动作(VLA)基础模型,其预训练模型未经任务微调即可在真实机器人上完成操作任务;
  • WALL-B 物流分拣:全自主分拣真实物流包裹,已部署到真实产线;
  • TwinDEX:本体一致、高效率的灵巧手数据采集系统。

我还参与了 X-Tokenizer 和 WALL-WM 等工作。

此前,我在微软亚洲研究院赵立研究员的团队工作,从事强化学习与具身基础模型(潜在动作模型、VLA、视觉导航)研究。

更长远地,我希望我的研究能够惠及整个社会。

加入我们

我希望与认同 Physical AGI 愿景的优秀伙伴合作,实习、全职均可。我尤其看重:

  • 前沿 AI 能力:深入掌握前沿 LLM 与 Agent,并能将其工程化为 Agent 原生的管线,自动化物理 AI 的研究与数据流程;
  • 具身数据能力:精通具身数据从采集、质量控制到训练的全链路,并将其构建为严谨、可复现的系统;
  • 研究深度:在某个方向上有深入的积累,能识别通往物理 AGI 道路上的关键问题,并以严谨的实验加以验证;
  • 扎实基础:数学功底扎实,工程能力出色。

如果你有意愿,或者希望交流,欢迎联系我。

代表工作

Wall-OSS-0.5

Wall-OSS-0.5

核心贡献者

开源 4B 视觉-语言-动作基础模型,在 20 多种机器人本体上预训练,未经任务微调即可在真机上完成操作任务。

WALL-B 物流分拣

WALL-B 物流分拣

核心贡献者

WALL-B 具身基础模型驱动双臂,全自主分拣大小、形状、材质各异的真实物流包裹:全球直播中分拣效率达 1816 件/小时、准确率超过 98%,并已与头部物流企业合作部署到真实产线。

TwinDEX

TwinDEX

核心贡献者

本体一致、高效率的灵巧手数据采集系统:可穿戴采集装置与机器人灵巧手同构设计,人手示教可直接迁移到机器人,实现规模化采集。

X-Tokenizer

X-Tokenizer

多模态动作分词器,在视觉语言推理与连续机器人控制之间建立语义接口。

WALL-WM

WALL-WM

世界动作模型,以语义动作事件而非固定长度的动作块作为学习单元。

最新动态

  • 2026.09 发布 TwinDEX:本体一致、高效率的灵巧手数据采集系统。
  • 2026.08 WALL-B 模型在全球直播中全自主分拣真实物流包裹:1816 件/小时,准确率超过 98%。
  • 2026.06 发布 X-Tokenizer(面向 VLA 预训练的多模态动作分词器)与 WALL-WM(以语义动作事件为学习单元的世界动作模型)。
  • 2026.05 开源 4B 视觉-语言-动作基础模型 Wall-OSS-0.5,同步发布技术报告、代码与模型权重。
  • 2026.01 论文 villa-X 被 ICLR 2026 接收。
  • 2025.09 开源 PIG-Nav 的代码与模型,在图像目标导航任务上取得优异表现。
  • 2024.10 发布 IGOR:以图像目标表示作为具身 AI 基础模型的原子控制单元。

代表论文

* 同等贡献 · 全部论文 →

  1. Report
    Wall-OSS-0.5 Technical Report
    Ryan Yu, Pushi Zhang, Starrick Liu, et al.等 Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vincent Chen, Harrison Huang, James Wang, Dance Kuzi, Andy Zhai, Hang Su, Roy Gan, Lucy Liang, Hao Wang, and Qian Wang
    Technical report, arXiv:2605.30877, 2026
  2. Report
    X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining
    Miracle Kang*, Lights Shi*, Lucy Liang, …, Pushi Zhang, et al.等 Miracle Kang*, Lights Shi*, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Sylas Chen, Shawn Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, and Hang Su
    Technical report, arXiv:2606.14752, 2026
  3. Report
    WALL-WM: Carving World Action Modeling at the Event Joints
    Shalfun Li, Victor Yao, Charles Yang, …, Pushi Zhang, et al.等 Shalfun Li, Victor Yao, Charles Yang, Truth Qu, Regis Cheng, Ryan Yu, Howard Lu, Newton Von, Vincent Chen, Yohann Tang, Maeve Zhang, Ellie Ma, Gody Li, Starrick Liu, Sage Yang, Lorien Shu, J. W. Gao, Ethan Chen, Colin Ye, Yu Sun, Elise Mon, Pushi Zhang, Neo Li, Lily Li, James Wang, Ping Yang, Chris Pan, Lucy Liang, Hang Su, Roy Gan, Hao Wang, and Qian Wang
    Technical report, arXiv:2606.01955, 2026
    Early version at ECCV 2026 Workshop (STEAI), Oral
  4. ICLR
    villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
    Xiaoyu Chen*, Hangxing Wei*, Pushi Zhang*, et al.等 Xiaoyu Chen*, Hangxing Wei*, Pushi Zhang*, Chuheng Zhang*, Kaixin Wang*, Yanjiang Guo, Rushuai Yang, Yucen Wang, Xinquan Xiao, Li Zhao*, Jianyu Chen, and Jiang Bian
    In International Conference on Learning Representations (ICLR), 2026
  5. NeurIPS
    What Do Latent Action Models Actually Learn?
    Chuheng Zhang*, Tim Pearce*, Pushi Zhang, Kaixin Wang, Xiaoyu Chen, Wei Shen, Li Zhao, and Jiang Bian
    In Advances in Neural Information Processing Systems (NeurIPS), 2025
  6. Report
    PIG-Nav: Key Insights for Pretrained Image Goal Navigation Models
    Jiansong Wan, Chengming Zhou, Jinkua Liu, …, Pushi Zhang, et al.等 Jiansong Wan, Chengming Zhou, Jinkua Liu, Xiangge Huang, Xiaoyu Chen, Xiaohan Yi, Qisen Yang, Baiting Zhu, Xin-Qiang Cai, Lixing Liu, Rushuai Yang, Chuheng Zhang, Sherif Abdelfattah, Hayong Shin, Pushi Zhang, Li Zhao, and Jiang Bian
    Technical report, arXiv:2507.17220, 2025
  7. Report
    IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI
    Xiaoyu Chen*, Junliang Guo*, Tianyu He*, Chuheng Zhang*, Pushi Zhang, Derek Cathera Yang, Li Zhao*, and Jiang Bian
    Technical report, arXiv:2411.00785, 2024