腾讯
实习面向真实物理世界的多模态大模型研究
深圳总部 · 实习 · 博士
长期有效
任职要求
- 基本要求:
- 1、计算机、人工智能、自动化、机器人、电子信息等相关专业在读硕士/博士;
- 2、具备扎实的编程能力,熟悉Python、PyTorch等深度学习开发工具;
- 3、对多模态大模型、具身智能、世界模型或机器人学习方向有浓厚兴趣。
- 技能要求(满足一项或多项即可):
- 1、有LLM/VLM/多模态大模型的预训练、微调或强化学习相关经验;
- 2、熟悉Transformer、Attention机制及主流大模型架构,理解其在长序列建模、多模态对齐和时序推理中的应用;
- 3、熟悉AutoRegressive、Diffusion、FlowMatching等生成建模方法,有相关训练或研究经验;
- 4、熟悉MoE/MoT等模型架构,理解稀疏激活、多路径推理或任务分治等相关机制;
- 5、有视频/图理解、图生成、时序建模、3D视觉、双目感知相关研究/项目经验;
- 6、熟悉大规模训练与推理框架,如DeepSpeed、Megatron、vLLM、SGLang等。
- 加分项:
- 1、在具身智能、多模态大模型、计算机视觉、机器人、机器学习等方向有科研成果;
- 2、在CVPR、ICCV、ECCV、NeurIPS、ICML、ICLR、CoRL、RSS、ICRA等顶会/顶刊发表过论文;
- 3、有开源项目贡献、大规模模型训练/部署经验或较强工程实现能力。
- 素质要求:
- 1、对前沿研究有强烈兴趣,具备较强的自驱力与独立探索能力;
- 2、具备良好的沟通协作能力和团队合作意识;
- 3、具备较好的问题分析能力、实验迭代能力与英文学术阅读/写作能力。
- 此课题同时招聘应届实习生和低年级实习生。
岗位描述
【岗位职责】
课题背景:
随着具身智能系统从仿真环境走向真实物理世界,智能体不仅需要在复杂开放场景中对环境进行精准感知与语义理解,还需要在动态、不确定场景下形成对未来状态的合理预判。传统视觉模型侧重静态识别与检测任务,难以支持空间关系建模、物理逻辑理解以及对潜在变化的推演能力。当前多模态大模型虽具备图文理解能力,但在真实场景中的三维空间建模、跨模态对齐以及物理一致性推理的能力方面仍存在不足。因此,有必要构建面向真实物理世界的多模态感知大模型,实现对语义、空间与物理逻辑的统一建模。
课题价值:
本课题旨在构建具备语义理解、空间推理与物理逻辑建模能力的多模态感知大模型,并在此基础上引入符合物理规律的认知想象机制。通过统一图像、视频、文本等多模态信息,实现对物体属性、相对位置、可供性以及动态演化趋势的结构化表达,为上层Agent提供高质量环境表征,为下层VLA模型提供可执行语义与状态预测支持。该能力将有效提升具身系统在复杂任务中的交互稳定性与动态适应能力,为真实场景下的持续决策与安全执行提供认知基础。
课题挑战:
- 1、真实世界复杂性挑战:真实环境存在遮挡、光照变化、动态干扰等问题,多模态感知模型需具备高鲁棒性与泛化能力;
- 2、三维空间与物理逻辑建模难题:现有VLM多基于二维图像理解,缺乏对三维空间结构、物体相对关系及物理约束的深度建模能力;
- 3、感知到想象的能力跃迁难题:如何在保证感知精度的基础上,引入物理一致性的状态推演能力,是模型设计中的关键问题;
- 4、数据构建、标注与评测难题:高质量、多模态、带空间与物理标签的数据构建成本高昂,且缺乏统一评测体系。
具体工作:
(一项或多项)
- 1、通用理解与生成 unified 具身模型研发:参与面向真实物理世界的多模态大模型研发,探索统一感知、理解、想象与推理的具身模型架构,提升模型对语义信息、空间关系、物理规律及任务状态的综合建模能力;
- 2、面向真实物理世界的人类视频学习:研究利用大规模人类与真实物理世界交互视频,提升模型对任务过程、操作意图、物理状态变化规律理解与泛化能力;
- 3、大模型架构与训练机制探索:探索适用于具身场景的大模型架构与训练方法,研究其在多模态理解、状态生成与时序推理中的应用潜力;
- 4、多模态认知与VLA协同:研究多模态大模型的能力如何与 VLA 模型有效结合,探索通过状态建模与交互反馈辅助机器人操作执行,提升在未见任务及复杂任务中的规划能力、稳定性与成功率;
- 5、数据构建、评测与实验验证:参与多模态数据构建、评测基准设计与实验分析,支持模型在真实物理世界任务中的验证与持续优化。
【任职要求】
基本要求:
- 1、计算机、人工智能、自动化、机器人、电子信息等相关专业在读硕士/博士;
- 2、具备扎实的编程能力,熟悉Python、PyTorch等深度学习开发工具;
- 3、对多模态大模型、具身智能、世界模型或机器人学习方向有浓厚兴趣。
技能要求(满足一项或多项即可):
- 1、有LLM/VLM/多模态大模型的预训练、微调或强化学习相关经验;
- 2、熟悉Transformer、Attention机制及主流大模型架构,理解其在长序列建模、多模态对齐和时序推理中的应用;
- 3、熟悉AutoRegressive、Diffusion、FlowMatching等生成建模方法,有相关训练或研究经验;
- 4、熟悉MoE/MoT等模型架构,理解稀疏激活、多路径推理或任务分治等相关机制;
- 5、有视频/图理解、图生成、时序建模、3D视觉、双目感知相关研究/项目经验;
- 6、熟悉大规模训练与推理框架,如DeepSpeed、Megatron、vLLM、SGLang等。
加分项:
- 1、在具身智能、多模态大模型、计算机视觉、机器人、机器学习等方向有科研成果;
- 2、在CVPR、ICCV、ECCV、NeurIPS、ICML、ICLR、CoRL、RSS、ICRA等顶会/顶刊发表过论文;
- 3、有开源项目贡献、大规模模型训练/部署经验或较强工程实现能力。
素质要求:
- 1、对前沿研究有强烈兴趣,具备较强的自驱力与独立探索能力;
- 2、具备良好的沟通协作能力和团队合作意识;
- 3、具备较好的问题分析能力、实验迭代能力与英文学术阅读/写作能力。
【加分项】
此课题同时招聘应届实习生和低年级实习生。
【技术方向】
其他
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 算法 岗位的常见面试问题整理
请解释 Transformer 模型的自注意力机制(Self-Attention)
查看答题思路
1. Self-Attention = 序列中每个 token 与所有 token 计算相关性权重 2. Q=Wq·x, K=Wk·x, V=Wv·x; Attention(Q,K,V)=softmax(QK^T/√d_k)V 3. 除以 √d_k 防止点积过大导致 softmax 梯度消失 4. 多头注意力:多组 QKV 并行,拼接后线性变换,捕获不同子空间特征 5. 对比 RNN:可并行计算,捕获长距离依赖
你做过的最有深度的算法/模型项目是什么
查看答题思路
1. 一句话说清任务:分类/生成/检索/推荐 2. 模型选型:为什么选这个而非那个 3. 数据:数据量、来源、清洗策略 4. 创新点:你做的改进是什么(不是调参) 5. 结果:核心指标提升(准确率/召回/延迟)
过拟合是什么?怎么判断和解决
查看答题思路
1. 过拟合=训练集表现好、验证集表现差,模型记住了噪声 2. 判断:train loss 持续下降而 val loss 上升 3. 解决:更多数据 / 正则化(L1/L2) / Dropout / 早停 / 数据增强 / 降低模型复杂度
解释梯度下降的原理,SGD 和 Adam 的区别
查看答题思路
1. 梯度下降:沿负梯度方向更新参数,使损失降低 2. SGD:每次用随机小批量估算梯度,引入随机性帮助跳出局部最优 3. Adam = Momentum + RMSProp:自适应学习率 + 动量加速 4. Adam 收敛快但可能泛化不如 SGD;CV 常用 SGD,NLP 多用 Adam
给你 10 万条未标注的文本数据,如何找出其中 10 个主题
查看答题思路
1. 预处理:分词、去停用词 2. 向量化:TF-IDF 或 Sentence Embedding 3. 聚类:K-Means(需指定 K=10)或 HDBSCAN(自动确定类数) 4. 或 LDA 主题模型直接输出主题-词分布 5. 评估:看每个簇的高频词判断主题合理性,迭代调整
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。