腾讯
校招面向通用机器人操作的具身多模态模型
深圳总部 · 校招 · 2027 届 · 博士
长期有效
任职要求
- 岗位要求
- 1 - 基本要求
- 计算机、人工智能、机器人、自动化等相关专业在读硕士/博士
- 扎实的数学基础与良好的编程能力(Python/PyTorch)
- 2 - 技能要求(满足一项或多项即可)
- 有Transformer、扩散模型、VQ-VAE等生成模型的训练经验
- 有LLM/VLM预训练、微调或推理优化经验,熟悉DeepSpeed、vLLM等框架
- 有模仿学习、强化学习或机器人操作策略学习经验,了解ACT、Diffusion Policy、RT系列、OpenVLA、π₀等工作
- 有视频生成模型(Sora、SVD、CogVideo等)或世界模型(UniSim、GAIA-1、GameGen等)相关研究或项目经验
- 熟悉ROS/ROS2,有真实机械臂或移动操作平台实验经验
- 有3D视觉、触觉/力觉传感或机器人仿真(Isaac Sim、MuJoCo等)经验
- 3 - 加分项
- 在CoRL、RSS、ICRA、NeurIPS、ICML、CVPR等顶会/顶刊发表过论文
- 有开源项目贡献或大规模模型部署工程经验
- 具备跨学科背景(机械、控制 × 深度学习)
- 4- 素质要求
- 对具身智能方向有浓厚兴趣,具备自驱力与独立研究能力 良好的团队协作、沟通能力与英文学术写作能力
- 此课题同时招聘应届实习生和低年级实习生。
岗位描述
【岗位职责】
课题背景:
随着视觉大模型和多模态模型的发展,机器已经基本具备“看得懂、听得懂”的能力,但在真实世界中“稳定干活”仍明显不足。现实中存在形态各异的机器人,分布在家庭、商用、工业等不同场景,当前主流仍是“单本体、单场景、单任务”的定制方案。因此亟需一个统一视觉、语言与动作决策的通用 VLA 基础操作模型,作为跨本体、跨场景具身智能应用的共性底座。
课题价值:
通用、稳定的 具身操作模型(如VLA) 基础操作模型可以像“操作层 GPT”一样,为多种机器人本体提供统一的感知–理解–操作能力,让不同厂商和不同类型机器人在同一模型之上复用抓取、搬运、装配、服务等基础技能,实现生活与工业场景之间的知识迁移与任务泛化
课题挑战:
●泛化性 / 通用性:对特定数据和本体依赖重,难以在新本体、新物体组合和新任务指令上做到可靠的零/少样本视觉–语言到行动迁移。
●准确率:非结构化环境下的光照、遮挡和动态干扰会放大为执行偏差,抓取、插拔、装配等操作成功率和精度仍不足。
●节拍慢 / 时延高:大模型推理开销大,响应速度难以满足工业节拍和高频实时交互需求。
●缺乏记忆:多为短时上下文,缺少对历史状态和子任务的长期记忆,易在多步、长周期任务中丢步骤、难恢复。
●力触融合难:将力觉、触觉与视觉、语言有效融合以理解力度、摩擦和约束并保证安全,同时控制数据成本、模型复杂度和推理延迟,工程实现难度高。
具体工作(一项或多项)
1 - 通用VLA模型研发:参与视觉-语言-动作(VLA)基础模型的架构设计与训练,探索跨本体统一动作表征与零/少样本迁移方法
2 - 世界模型与视频生成驱动的操作学习:探索基于视频生成模型/世界模型(World Model)的操作策略学习路线
3 - 模型推理加速与部署:研究模型量化、蒸馏、动作chunk并行预测及分层异步决策等加速方案,推动模型在边缘端的实时部署
4 - 长时记忆与多步任务执行:设计面向长周期任务的记忆机制与层次化规划策略,提升多步骤复杂任务的鲁棒执行与异常恢复能力
5 - 多模态感知融合:研究力觉、触觉与视觉、语言的对齐融合方法,支撑精密操作与安全交互场景
6 - 仿真与真机实验:在主流仿真平台搭建评测环境,完成sim-to-real验证;撰写技术报告
【任职要求】
岗位要求
1 - 基本要求
计算机、人工智能、机器人、自动化等相关专业在读硕士/博士
扎实的数学基础与良好的编程能力(Python/PyTorch)
2 - 技能要求(满足一项或多项即可)
有Transformer、扩散模型、VQ-VAE等生成模型的训练经验
有LLM/VLM预训练、微调或推理优化经验,熟悉DeepSpeed、vLLM等框架
有模仿学习、强化学习或机器人操作策略学习经验,了解ACT、Diffusion Policy、RT系列、OpenVLA、π₀等工作
有视频生成模型(Sora、SVD、CogVideo等)或世界模型(UniSim、GAIA-1、GameGen等)相关研究或项目经验
熟悉ROS/ROS2,有真实机械臂或移动操作平台实验经验
有3D视觉、触觉/力觉传感或机器人仿真(Isaac Sim、MuJoCo等)经验
3 - 加分项
在CoRL、RSS、ICRA、NeurIPS、ICML、CVPR等顶会/顶刊发表过论文
有开源项目贡献或大规模模型部署工程经验
具备跨学科背景(机械、控制 × 深度学习)
4- 素质要求
对具身智能方向有浓厚兴趣,具备自驱力与独立研究能力 良好的团队协作、沟通能力与英文学术写作能力
【加分项】
此课题同时招聘应届实习生和低年级实习生。
【技术方向】
其他
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 运营 岗位的常见面试问题整理
我提到了电竞方面,另一个面试官就问我对于ig战队(lol)的看法,然后一道情景题:公司和ig方面有合作,怎样运营才能吸引ig粉丝使用我们产品
查看答题思路
1. 电竞营销=粉丝经济,核心是社区运营而非传统广告 2. 跨界合作:战队/选手/IP 联名,借粉丝流量 3. 内容策略:比赛直播/选手日常/粉丝二创/社区活动 4. 案例:用 STAR 讲一个电竞相关的运营策划
另一个面试官看我的专业(偏设计)就问我愿不愿意做产品设计方向,让我发作品集 大概就这些 #咪咕#<a href="/creation/subject/928d551be73f40db82c0ed83286c8783" target="_blank" class="s
查看答题思路
1. 核心概念:一句话说清这个问题的底层逻辑 2. 方法论/框架:用 STAR 原则或专业框架结构化回答 3. 实际案例:结合一个具体场景说明 4. 量化结果:用数据佐证你的观点
你认为内容运营需要具备哪些能力
查看答题思路
1. 内容运营=创作有价值的内容→分发到正确渠道→吸引目标用户→促成转化 2. 核心能力:选题能力(知道用户想看什么)、写作能力、数据分析能力(用数据迭代内容策略) 3. 生命周期:选题→创作→审核→发布→分发→数据回收→优化→二次传播 4. 优质内容标准:原创/有用/有趣/有共鸣/有行动引导
谈谈你理解的内容生命周期
查看答题思路
1. 真诚:为什么对这个方向感兴趣(具体经历/瞬间) 2. 匹配:你的能力和这个岗位的契合点 3. 成长:你希望从这个岗位学到什么 4. 贡献:你能为团队带来什么
自我介绍
查看答题思路
1. 我是谁(姓名+学校+专业,15秒) 2. 我做过什么(最相关的 1-2 个经历,30秒) 3. 为什么适合这个岗位(能力匹配,15秒) 4. 总时长控制在 1 分钟以内 5. 避免:念简历、说「我学习能力强」这种空话
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。