← 返回岗位列表

腾讯

校招

腾讯地图-多模态大模型融合建图研究

北京 · 校招 · 2027 届 · 博士

长期有效

任职要求

  • 1. 学历和专业要求
  • 包括但不限于:计算机科学与技术、人工智能、自动化、机器人、模式识别、遥感与地理信息工程(GIS)、测绘工程、应用数学、统计学等相关专业博士及优秀硕士。
  • 2. 技术技能要求
  • 熟练掌握多模态模型、SLAM、三维重建、深度学习基础理论与主流方法;
  • 具备扎实的工程能力,熟悉 PyTorch/TensorFlow 等训练框架,有模型训练、优化与部署经验;
  • 有以下任一经验者优先:
  • 多模态融合、VLM 大模型、特征对齐与跨模态表征学习;
  • 视觉 / 激光 SLAM、视觉里程计、点云处理、传感器标定与融合;
  • 三维重建、语义建图、数字孪生、自动驾驶环境感知;
  • 模型优化、蒸馏、量化、端侧部署与系统落地经验。
  • 3. 软性素质要求
  • 具备极强的自驱力与科研探索精神,能够在前沿方向上独立拆解问题、设计方案并落地;
  • 具备良好的论文阅读、算法复现与创新能力,善于在无成熟方案的场景下推进迭代;
  • 具备优秀的跨团队协作与沟通能力,能够快速理解业务场景并将技术转化为实际产品价值。

岗位描述

【岗位职责】

  • 1. 课题背景

高精度地图与环境感知是自动驾驶、机器人导航、智能交通与数字孪生场景的核心基础设施。传统建图方案多依赖激光雷达、视觉、IMU 等单一或简单融合的传感器数据,在复杂城市场景、极端光照、动态遮挡、无纹理区域等条件下,存在鲁棒性不足、精度受限、语义信息缺失、建图效率低等问题。

随着多模态大模型与端到端感知技术的快速发展,基于视觉、激光、文本语义、先验地图、GPS / 北斗位置信息等多源异构数据的联合建图成为下一代主流技术方向。但当前行业仍面临三大核心瓶颈:

  • 1)多模态数据难以深度对齐:图像、点云、位置、文本等数据在时空、特征、语义层面缺乏统一表征与融合机制;
  • 2)环境语义理解能力薄弱:现有建图系统以几何重建为主,缺乏对道路、设施、障碍物、交通规则的语义理解与结构化表达;
  • 3)泛化与鲁棒性不足:在长尾场景、陌生环境、动态干扰下易失效,难以实现大规模、低成本、自动化的地图更新与维护。

本课题旨在突破传统几何建图范式,构建多模态原生融合的端到端建图体系,实现高精度、高鲁棒、高语义的自动化地图构建与持续更新。

  • 2. 课题挑战
  • 1)多源异构数据融合建模:视觉、激光、惯性、位置、文本等模态差异大,时空校准与特征融合难度高,业界缺乏统一的融合表征框架;
  • 2)语义与几何联合优化:同时满足地图的几何精度、拓扑一致性与语义完整性,存在多目标约束与优化冲突问题;
  • 3)动态环境与在线建图:在动态障碍物干扰下实现稳定建图,支持低算力平台实时推理与增量更新;
  • 4)大模型与传统 SLAM 深度结合:如何将多模态大模型的感知与理解能力,注入到经典 SLAM 流程中,提升泛化性与鲁棒性,是前沿且开放的难题。
  • 3. 具体工作

你将参与下一代多模态融合建图系统的核心研发,主要内容包括:

多模态(图像 / 点云 / IMU / 位置 / 文本)时空对齐与深度融合模型设计;

面向建图的多模态基座模型预训练、特征提取与跨模态表征学习;

视觉 - 激光融合定位、SLAM、里程计与后端优化算法研发;

语义分割、目标检测、场景理解与地图结构化信息抽取;

语义与几何联合约束的图优化、束调整与地图一致性校正;

大模型驱动的自动化建图、标注、校验与增量更新闭环系统;

多任务联合训练策略、蒸馏量化、端侧部署与完整评估体系建设。

【任职要求】

  • 1. 学历和专业要求

包括但不限于:计算机科学与技术、人工智能、自动化、机器人、模式识别、遥感与地理信息工程(GIS)、测绘工程、应用数学、统计学等相关专业博士及优秀硕士。

  • 2. 技术技能要求

熟练掌握多模态模型、SLAM、三维重建、深度学习基础理论与主流方法;

具备扎实的工程能力,熟悉 PyTorch/TensorFlow 等训练框架,有模型训练、优化与部署经验;

有以下任一经验者优先:

多模态融合、VLM 大模型、特征对齐与跨模态表征学习;

视觉 / 激光 SLAM、视觉里程计、点云处理、传感器标定与融合;

三维重建、语义建图、数字孪生、自动驾驶环境感知;

模型优化、蒸馏、量化、端侧部署与系统落地经验。

  • 3. 软性素质要求

具备极强的自驱力与科研探索精神,能够在前沿方向上独立拆解问题、设计方案并落地;

具备良好的论文阅读、算法复现与创新能力,善于在无成熟方案的场景下推进迭代;

具备优秀的跨团队协作与沟通能力,能够快速理解业务场景并将技术转化为实际产品价值。

【技术方向】

多模态、视觉、语音

你的简历匹配这个岗位吗?

上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方

该岗位可能会问的问题

基于 算法 岗位的常见面试问题整理

请解释 Transformer 模型的自注意力机制(Self-Attention)

类型专业能力·难度困难
查看答题思路

1. Self-Attention = 序列中每个 token 与所有 token 计算相关性权重 2. Q=Wq·x, K=Wk·x, V=Wv·x; Attention(Q,K,V)=softmax(QK^T/√d_k)V 3. 除以 √d_k 防止点积过大导致 softmax 梯度消失 4. 多头注意力:多组 QKV 并行,拼接后线性变换,捕获不同子空间特征 5. 对比 RNN:可并行计算,捕获长距离依赖

你做过的最有深度的算法/模型项目是什么

类型项目经历·难度中等
查看答题思路

1. 一句话说清任务:分类/生成/检索/推荐 2. 模型选型:为什么选这个而非那个 3. 数据:数据量、来源、清洗策略 4. 创新点:你做的改进是什么(不是调参) 5. 结果:核心指标提升(准确率/召回/延迟)

过拟合是什么?怎么判断和解决

类型专业能力·难度简单
查看答题思路

1. 过拟合=训练集表现好、验证集表现差,模型记住了噪声 2. 判断:train loss 持续下降而 val loss 上升 3. 解决:更多数据 / 正则化(L1/L2) / Dropout / 早停 / 数据增强 / 降低模型复杂度

解释梯度下降的原理,SGD 和 Adam 的区别

类型专业能力·难度中等
查看答题思路

1. 梯度下降:沿负梯度方向更新参数,使损失降低 2. SGD:每次用随机小批量估算梯度,引入随机性帮助跳出局部最优 3. Adam = Momentum + RMSProp:自适应学习率 + 动量加速 4. Adam 收敛快但可能泛化不如 SGD;CV 常用 SGD,NLP 多用 Adam

给你 10 万条未标注的文本数据,如何找出其中 10 个主题

类型情景/案例·难度中等
查看答题思路

1. 预处理:分词、去停用词 2. 向量化:TF-IDF 或 Sentence Embedding 3. 聚类:K-Means(需指定 K=10)或 HDBSCAN(自动确定类数) 4. 或 LDA 主题模型直接输出主题-词分布 5. 评估:看每个簇的高频词判断主题合理性,迭代调整

更多面试题库功能即将上线

信息来源:企业官方招聘页。投递前请以官网信息为准。