前字节腾讯AI核心研发孙鹏加盟星尘智能 加码机器人强化学习后训练
强化学习专家孙鹏加盟星尘智能,主攻机器人后训练,让机器人从真实执行反馈中越做越好。
9月2日,前字节跳动强化学习专家、前腾讯 Robotics X 智能体中心负责人孙鹏博士加入机器人公司星尘智能,负责强化学习方向。过去两年机器人基础模型解决“会不会”,现在转向“能不能稳定做好”,强化学习(让机器人通过试错和反馈持续改进策略的方法)重回焦点。孙鹏的加入将补强星尘智能在模型训练之后的关键环节,推动机器人在真实世界中持续进化。
正文摘录
.png) 9 月 2 日,前字节跳动强化学习专家、前腾讯 Robotics X 智能体中心负责人孙鹏博士正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索。 过去两年,机器人基础模型主要解决的是“会不会”。但随着机器人从 Demo 走向真实部署和商业化,问题正在转向“能不能稳定做好”。如何让机器人根据真实执行结果持续修正策略,也让强化学习重新回到行业关注的中心。 孙鹏长期深耕强化学习(RL)、智能体(Agent)及多智能体强化学习(MARL),拥有横跨机器人强化学习、大规模分布式 RL 系统与大模型强化学习的研究与产业实践经历。他的加入将进一步强化星尘智能在机器人强化学习方向的布局,并与 AI 模型、具身 OS 和绳驱机器人本体形成协同,推动机器人在真实世界中持续学习、不断进化。 据了解,孙鹏加入星尘智能后,将继续扩充机器人强化学习团队,推动相关技术能力提升和应用部署。  从腾讯到字节 深耕强化学习十余年 孙鹏博士毕业于清华大学,此后先后在康奈尔大学和罗格斯大学从事博士后研究。过去十余年,其研究与产业实践始终围绕强化学习与智能体展开,并逐步从机器人强化学习拓展至大规模 RL 系统与大模型后训练,形成了兼具算法研究与系统工程的技术积累。