← 返回岗位列表

腾讯

校招

光子AI-多模态大模型在游戏场景中的研究与应用

深圳总部 · 校招 · 2027 届 · 博士

长期有效

任职要求

  • 1. 包含但不限于计算机科学、人工智能、模式识别、信息工程、多媒体技术、计算机视觉、自然语言处理、电子工程、应用数学、统计学、自动化、软件工程等专业的博士和优秀硕士;
  • 2. 熟练掌握多模态大模型(如CLIP、LLaVA、Qwen-VL、GPT-4V等)的基本原理与技术架构,熟悉视觉-语言预训练、指令微调、RLHF等核心方法,具备大模型训练/微调的实践经验;
  • 3. 熟悉PyTorch、DeepSpeed、Hugging Face Transformers等至少一个主流深度学习/大模型训练框架,具有较强的工程实现能力;
  • 4. 熟悉Shell/Python等编程语言,具备良好的代码规范与实验管理习惯;
  • 5. 加分项:在计算机视觉、多模态学习、NLP等相关领域发表过顶会/顶刊论文(如CVPR、NeurIPS、ACL、ICLR、AAAI等);有多模态大模型相关开源项目维护经验;有游戏行业相关项目经历。

岗位描述

【岗位职责】

课题背景

近年来,多模态大模型(Multimodal Large Language Models, MLLMs)在通用视觉理解、跨模态生成等领域取得了突破性进展,成为AI领域最受关注的前沿方向之一。游戏作为天然的多模态富媒体场景,涵盖画面、文本、音频、视频、UI界面、3D模型及玩家行为序列等多种异构信息,为多模态大模型提供了极具价值的落地土壤。然而,当前通用多模态大模型在游戏这一"高度风格化、强交互、强实时"的垂直领域中,仍面临领域适配不足、游戏画面细粒度理解能力欠缺、生成可控性弱、游戏专有知识匮乏等核心挑战。因此,本课题聚焦于将多模态大模型的通用能力高效迁移并深度适配至游戏场景,释放其在游戏研发、运营、测试及玩家体验全链路中的价值。典型应用场景例如:基于游戏截图/视频的智能UI元素识别与状态解析,自动化检测穿模、渲染异常等画面缺陷;构建"看懂游戏画面、理解游戏语境"的多模态对话系统,实现基于截图的智能客服问答、游戏攻略自动生成;游戏视频长时序理解,包括操作序列识别、高光时刻自动提取与战斗片段智能摘要等等。

课题挑战

游戏领域多模态数据建设: 游戏画面具有高度风格化、类别多样、UI元素密集等特点,如何构建高质量的游戏领域多模态训练数据集与评测Benchmark?如何设计高效的数据标注流水线与自动化数据合成策略,以覆盖游戏场景中的多样视觉理解与生成需求?

游戏视觉细粒度理解与定位: 游戏画面中包含大量领域特有的视觉元素(技能图标、状态栏、小地图标注、装备属性面板等),通用多模态模型的识别精度不足。如何通过领域适配微调、视觉Grounding增强等方法,使模型具备对游戏画面的细粒度理解与精确定位能力?

游戏视频长时序理解与推理: 游戏视频包含复杂的时序动态信息(操作序列、战斗节奏、剧情进展),如何在长视频理解中平衡计算效率与时序建模精度?如何使模型具备跨时间步的因果推理与事件关联能力?

游戏专有知识融合与多模态检索: 游戏场景中存在大量专有术语、机制规则、版本更新知识等,如何将结构化/非结构化的游戏知识与视觉信息高效融合?如何构建统一的游戏多模态表征空间,实现"以图搜资产""以文本检索3D模型"等跨模态检索能力?

推理效率与部署优化: 游戏场景对实时性要求高(如实时画面理解、在线客服响应),大规模多模态模型的推理延迟和计算开销难以直接满足线上需求。如何通过模型蒸馏、量化、推测解码等技术实现多模态大模型在游戏场景中的高效部署?

具体工作

你将参与到游戏领域多模态数据集构建与Benchmark设计、多模态大模型的游戏领域适配微调(视觉理解/对话)、游戏画面细粒度理解与视觉Grounding能力建设、游戏视频长时序理解与高光时刻提取、游戏多模态知识库构建与跨模态检索系统搭建、以及模型推理优化与线上部署等工作中,提升多模态大模型在游戏研发、运营、测试与玩家体验全链路中的实际应用能力。

【任职要求】

  • 1. 包含但不限于计算机科学、人工智能、模式识别、信息工程、多媒体技术、计算机视觉、自然语言处理、电子工程、应用数学、统计学、自动化、软件工程等专业的博士和优秀硕士;
  • 2. 熟练掌握多模态大模型(如CLIP、LLaVA、Qwen-VL、GPT-4V等)的基本原理与技术架构,熟悉视觉-语言预训练、指令微调、RLHF等核心方法,具备大模型训练/微调的实践经验;
  • 3. 熟悉PyTorch、DeepSpeed、Hugging Face Transformers等至少一个主流深度学习/大模型训练框架,具有较强的工程实现能力;
  • 4. 熟悉Shell/Python等编程语言,具备良好的代码规范与实验管理习惯;
  • 5. 加分项:在计算机视觉、多模态学习、NLP等相关领域发表过顶会/顶刊论文(如CVPR、NeurIPS、ACL、ICLR、AAAI等);有多模态大模型相关开源项目维护经验;有游戏行业相关项目经历。

【技术方向】

多模态、视觉、语音

你的简历匹配这个岗位吗?

上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方

该岗位可能会问的问题

基于 算法 岗位的常见面试问题整理

请解释 Transformer 模型的自注意力机制(Self-Attention)

类型专业能力·难度困难
查看答题思路

1. Self-Attention = 序列中每个 token 与所有 token 计算相关性权重 2. Q=Wq·x, K=Wk·x, V=Wv·x; Attention(Q,K,V)=softmax(QK^T/√d_k)V 3. 除以 √d_k 防止点积过大导致 softmax 梯度消失 4. 多头注意力:多组 QKV 并行,拼接后线性变换,捕获不同子空间特征 5. 对比 RNN:可并行计算,捕获长距离依赖

你做过的最有深度的算法/模型项目是什么

类型项目经历·难度中等
查看答题思路

1. 一句话说清任务:分类/生成/检索/推荐 2. 模型选型:为什么选这个而非那个 3. 数据:数据量、来源、清洗策略 4. 创新点:你做的改进是什么(不是调参) 5. 结果:核心指标提升(准确率/召回/延迟)

过拟合是什么?怎么判断和解决

类型专业能力·难度简单
查看答题思路

1. 过拟合=训练集表现好、验证集表现差,模型记住了噪声 2. 判断:train loss 持续下降而 val loss 上升 3. 解决:更多数据 / 正则化(L1/L2) / Dropout / 早停 / 数据增强 / 降低模型复杂度

解释梯度下降的原理,SGD 和 Adam 的区别

类型专业能力·难度中等
查看答题思路

1. 梯度下降:沿负梯度方向更新参数,使损失降低 2. SGD:每次用随机小批量估算梯度,引入随机性帮助跳出局部最优 3. Adam = Momentum + RMSProp:自适应学习率 + 动量加速 4. Adam 收敛快但可能泛化不如 SGD;CV 常用 SGD,NLP 多用 Adam

给你 10 万条未标注的文本数据,如何找出其中 10 个主题

类型情景/案例·难度中等
查看答题思路

1. 预处理:分词、去停用词 2. 向量化:TF-IDF 或 Sentence Embedding 3. 聚类:K-Means(需指定 K=10)或 HDBSCAN(自动确定类数) 4. 或 LDA 主题模型直接输出主题-词分布 5. 评估:看每个簇的高频词判断主题合理性,迭代调整

更多面试题库功能即将上线

信息来源:企业官方招聘页。投递前请以官网信息为准。