← 返回岗位列表

腾讯

校招

面向通用机器人操作的具身多模态模型

深圳总部 · 校招 · 2027 届 · 博士

长期有效

任职要求

  • 岗位要求
  • 1 - 基本要求
  • 计算机、人工智能、机器人、自动化等相关专业在读硕士/博士
  • 扎实的数学基础与良好的编程能力(Python/PyTorch)
  • 2 - 技能要求(满足一项或多项即可)
  • 有Transformer、扩散模型、VQ-VAE等生成模型的训练经验
  • 有LLM/VLM预训练、微调或推理优化经验,熟悉DeepSpeed、vLLM等框架
  • 有模仿学习、强化学习或机器人操作策略学习经验,了解ACT、Diffusion Policy、RT系列、OpenVLA、π₀等工作
  • 有视频生成模型(Sora、SVD、CogVideo等)或世界模型(UniSim、GAIA-1、GameGen等)相关研究或项目经验
  • 熟悉ROS/ROS2,有真实机械臂或移动操作平台实验经验
  • 有3D视觉、触觉/力觉传感或机器人仿真(Isaac Sim、MuJoCo等)经验
  • 3 - 加分项
  • 在CoRL、RSS、ICRA、NeurIPS、ICML、CVPR等顶会/顶刊发表过论文
  • 有开源项目贡献或大规模模型部署工程经验
  • 具备跨学科背景(机械、控制 × 深度学习)
  • 4- 素质要求
  • 对具身智能方向有浓厚兴趣,具备自驱力与独立研究能力 良好的团队协作、沟通能力与英文学术写作能力
  • 此课题同时招聘应届实习生和低年级实习生。

岗位描述

【岗位职责】

课题背景:

随着视觉大模型和多模态模型的发展,机器已经基本具备“看得懂、听得懂”的能力,但在真实世界中“稳定干活”仍明显不足。现实中存在形态各异的机器人,分布在家庭、商用、工业等不同场景,当前主流仍是“单本体、单场景、单任务”的定制方案。因此亟需一个统一视觉、语言与动作决策的通用 VLA 基础操作模型,作为跨本体、跨场景具身智能应用的共性底座。

课题价值:

通用、稳定的 具身操作模型(如VLA) 基础操作模型可以像“操作层 GPT”一样,为多种机器人本体提供统一的感知–理解–操作能力,让不同厂商和不同类型机器人在同一模型之上复用抓取、搬运、装配、服务等基础技能,实现生活与工业场景之间的知识迁移与任务泛化

课题挑战:

●泛化性 / 通用性:对特定数据和本体依赖重,难以在新本体、新物体组合和新任务指令上做到可靠的零/少样本视觉–语言到行动迁移。

●准确率:非结构化环境下的光照、遮挡和动态干扰会放大为执行偏差,抓取、插拔、装配等操作成功率和精度仍不足。

●节拍慢 / 时延高:大模型推理开销大,响应速度难以满足工业节拍和高频实时交互需求。

●缺乏记忆:多为短时上下文,缺少对历史状态和子任务的长期记忆,易在多步、长周期任务中丢步骤、难恢复。

●力触融合难:将力觉、触觉与视觉、语言有效融合以理解力度、摩擦和约束并保证安全,同时控制数据成本、模型复杂度和推理延迟,工程实现难度高。

具体工作(一项或多项)

1 - 通用VLA模型研发:参与视觉-语言-动作(VLA)基础模型的架构设计与训练,探索跨本体统一动作表征与零/少样本迁移方法

2 - 世界模型与视频生成驱动的操作学习:探索基于视频生成模型/世界模型(World Model)的操作策略学习路线

3 - 模型推理加速与部署:研究模型量化、蒸馏、动作chunk并行预测及分层异步决策等加速方案,推动模型在边缘端的实时部署

4 - 长时记忆与多步任务执行:设计面向长周期任务的记忆机制与层次化规划策略,提升多步骤复杂任务的鲁棒执行与异常恢复能力

5 - 多模态感知融合:研究力觉、触觉与视觉、语言的对齐融合方法,支撑精密操作与安全交互场景

6 - 仿真与真机实验:在主流仿真平台搭建评测环境,完成sim-to-real验证;撰写技术报告

【任职要求】

岗位要求

1 - 基本要求

计算机、人工智能、机器人、自动化等相关专业在读硕士/博士

扎实的数学基础与良好的编程能力(Python/PyTorch)

2 - 技能要求(满足一项或多项即可)

有Transformer、扩散模型、VQ-VAE等生成模型的训练经验

有LLM/VLM预训练、微调或推理优化经验,熟悉DeepSpeed、vLLM等框架

有模仿学习、强化学习或机器人操作策略学习经验,了解ACT、Diffusion Policy、RT系列、OpenVLA、π₀等工作

有视频生成模型(Sora、SVD、CogVideo等)或世界模型(UniSim、GAIA-1、GameGen等)相关研究或项目经验

熟悉ROS/ROS2,有真实机械臂或移动操作平台实验经验

有3D视觉、触觉/力觉传感或机器人仿真(Isaac Sim、MuJoCo等)经验

3 - 加分项

在CoRL、RSS、ICRA、NeurIPS、ICML、CVPR等顶会/顶刊发表过论文

有开源项目贡献或大规模模型部署工程经验

具备跨学科背景(机械、控制 × 深度学习)

4- 素质要求

对具身智能方向有浓厚兴趣,具备自驱力与独立研究能力 良好的团队协作、沟通能力与英文学术写作能力

【加分项】

此课题同时招聘应届实习生和低年级实习生。

【技术方向】

其他

你的简历匹配这个岗位吗?

上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方

该岗位可能会问的问题

基于 运营 岗位的常见面试问题整理

我提到了电竞方面,另一个面试官就问我对于ig战队(lol)的看法,然后一道情景题:公司和ig方面有合作,怎样运营才能吸引ig粉丝使用我们产品

类型专业能力·难度中等·一面·咪咕动漫
查看答题思路

1. 电竞营销=粉丝经济,核心是社区运营而非传统广告 2. 跨界合作:战队/选手/IP 联名,借粉丝流量 3. 内容策略:比赛直播/选手日常/粉丝二创/社区活动 4. 案例:用 STAR 讲一个电竞相关的运营策划

另一个面试官看我的专业(偏设计)就问我愿不愿意做产品设计方向,让我发作品集 大概就这些 #咪咕#<a href="/creation/subject/928d551be73f40db82c0ed83286c8783" target="_blank" class="s

类型专业能力·难度中等·一面·咪咕动漫
查看答题思路

1. 核心概念:一句话说清这个问题的底层逻辑 2. 方法论/框架:用 STAR 原则或专业框架结构化回答 3. 实际案例:结合一个具体场景说明 4. 量化结果:用数据佐证你的观点

你认为内容运营需要具备哪些能力

类型专业能力·难度简单·一面·搜狐
查看答题思路

1. 内容运营=创作有价值的内容→分发到正确渠道→吸引目标用户→促成转化 2. 核心能力:选题能力(知道用户想看什么)、写作能力、数据分析能力(用数据迭代内容策略) 3. 生命周期:选题→创作→审核→发布→分发→数据回收→优化→二次传播 4. 优质内容标准:原创/有用/有趣/有共鸣/有行动引导

谈谈你理解的内容生命周期

类型动机/岗位认知·难度简单·一面·搜狐
查看答题思路

1. 真诚:为什么对这个方向感兴趣(具体经历/瞬间) 2. 匹配:你的能力和这个岗位的契合点 3. 成长:你希望从这个岗位学到什么 4. 贡献:你能为团队带来什么

自我介绍

类型动机/岗位认知·难度中等·一面·咪咕动漫
查看答题思路

1. 我是谁(姓名+学校+专业,15秒) 2. 我做过什么(最相关的 1-2 个经历,30秒) 3. 为什么适合这个岗位(能力匹配,15秒) 4. 总时长控制在 1 分钟以内 5. 避免:念简历、说「我学习能力强」这种空话

更多面试题库功能即将上线

信息来源:企业官方招聘页。投递前请以官网信息为准。