← 返回岗位列表

腾讯

校招

微信搜索-多模态理解(数据/算法)研究

北京 · 校招 · 2027 届 · 博士

长期有效

任职要求

  • 面向计算机科学、人工智能、机器学习、应用数学等相关专业的硕士或博士同学;在顶级学术会议(如ICML, ICLR, NeurIPS, COLM, CVPR等)有相关论文发表经验者优先。
  • 深入理解主流视觉编码器(如 CLIP, SigLIP 等)的模型结构,熟悉其训练与评测方法。
  • 熟悉主流多模态模型的架构,熟悉主流多模态模型架构:LLaVA 系列、Qwen-VL / Qwen2-VL / Qwen2.5-VL、InternVL 系列、Kimi-VL、DeepSeek-VL、Molmo、Pixtral、Gemini、GPT-4o / GPT-4V、Claude 3.5 Sonnet、以及原生多模态 (Emu3 / Show-o / Janus) 的结构差异与工程实现。
  • 大规模多模态预训练或后训练实战经验:至少完整落地过一个阶段 (Pretrain / Mid-Train / SFT / RL / OPD),理解模态融合、位置编码 (M-RoPE / 2D-RoPE)、AnyRes、Native Resolution、Token Compression 等关键技术。
  • 极强的数据直觉:具备大规模图文/视频数据 清洗、质量标注、去重、合成、混合配比 的实战经验,能从数据分布中一眼识别问题,有大规模图文/视频数据清洗、质量标注及数据合成的实战经验。具备一定的工程代码能力。

岗位描述

【岗位职责】

课题背景

作为连接内生态的桥梁,微信搜索在大模型发展的路径上除了通过语义连接文本内容,还需要让模型理解内生态中的各种多模态内容。在海量图片、视频加持下,为 AI 注入看懂世界的能力,能够提升 AI 搜索内容的准确性和丰富度。在这里,你将会遇到多模态领域的最本质的问题,处理海量且带有噪声的真实多模态数据,充分利用微信内生态各种资源、工具,设计高效原生的数据管线,探索全面且覆盖真实搜索场景的多模态评估基准,跨越数据、评估、训练的全链路。

课题挑战:

视觉编码器与 VLM 架构的高效训练是多模态理解的挑战之一。在Vision Encoder 的选型与再训练面临着 CLIP/SigLIP等的适配、Native Resolution/Patch-npack 的取舍。另外在训练阶段还需解决在大 batch、大分辨率下的 loss spike、模态坍塌、语言能力退化等现象的诊断与缓解。

评估是引导模型迭代的重中之重。结合搜索的多模态评测不能局限于公开 benchmark,需要独立地针对任务设计人工评测、自动评测流程。此外,需要构建覆盖幻觉 (Hallucination)、空间推理 (Spatial Reasoning)、细粒度识别 (Fine-grained)、OCR、图表理解 (Chart/Doc)、多图/长视频、意图理解、Agent 交互等维度的分层评测。

引入外部工具 (搜索、code-interpreter等) 是提升多模态能力上限的重要路径,但也会带来副作用。比如能力偏置 (Capability Shift)问题会导致模型过度依赖工具会削弱模型的原生视觉能力 (grounding、counting、reading)。因此需要研究跨模态信号分配、工具加持下多模态模型训练推理一致性和工具调用的鲁棒性。

多模态模型对数据配方 (Data Recipe) 极其敏感。挑战包括:图文数据跨任务的混合策略,在多模态模型训练中对模型能力的影响较大。调配不同任务数据在模型各训练阶段中的配比,才能使模型发挥出需要的关键能力。

具体工作:

负责多模态模型的迭代。探索视觉编码器和 VLM 结构的高效训练、评测方式。针对微信搜索场景的多模态理解需求,持续验证和迭代训练算法(包括 SFT/RL/OPD 算法)。

负责多模态模型训练数据的合成预筛选。从头定义图文数据的采集方式、质量标准、筛选逻辑。从丰富的内生态资源中,构建稳定、扎实、高效的自动化合成、清洗的数据管线。在数据侧稳步提升模型的多模态基础能力。

搭建针对微信搜索 Agent 领域的定制化多模态评估基准,定位模型短板,针对性优化模型在多模理解上的不足,并持续回流训练数据建设流程,指引模型迭代。

【任职要求】

面向计算机科学、人工智能、机器学习、应用数学等相关专业的硕士或博士同学;在顶级学术会议(如ICML, ICLR, NeurIPS, COLM, CVPR等)有相关论文发表经验者优先。

深入理解主流视觉编码器(如 CLIP, SigLIP 等)的模型结构,熟悉其训练与评测方法。

熟悉主流多模态模型的架构,熟悉主流多模态模型架构:LLaVA 系列、Qwen-VL / Qwen2-VL / Qwen2.5-VL、InternVL 系列、Kimi-VL、DeepSeek-VL、Molmo、Pixtral、Gemini、GPT-4o / GPT-4V、Claude 3.5 Sonnet、以及原生多模态 (Emu3 / Show-o / Janus) 的结构差异与工程实现。

大规模多模态预训练或后训练实战经验:至少完整落地过一个阶段 (Pretrain / Mid-Train / SFT / RL / OPD),理解模态融合、位置编码 (M-RoPE / 2D-RoPE)、AnyRes、Native Resolution、Token Compression 等关键技术。

极强的数据直觉:具备大规模图文/视频数据 清洗、质量标注、去重、合成、混合配比 的实战经验,能从数据分布中一眼识别问题,有大规模图文/视频数据清洗、质量标注及数据合成的实战经验。具备一定的工程代码能力。

【技术方向】

多模态、视觉、语音

你的简历匹配这个岗位吗?

上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方

该岗位可能会问的问题

基于 算法 岗位的常见面试问题整理

请解释 Transformer 模型的自注意力机制(Self-Attention)

类型专业能力·难度困难
查看答题思路

1. Self-Attention = 序列中每个 token 与所有 token 计算相关性权重 2. Q=Wq·x, K=Wk·x, V=Wv·x; Attention(Q,K,V)=softmax(QK^T/√d_k)V 3. 除以 √d_k 防止点积过大导致 softmax 梯度消失 4. 多头注意力:多组 QKV 并行,拼接后线性变换,捕获不同子空间特征 5. 对比 RNN:可并行计算,捕获长距离依赖

你做过的最有深度的算法/模型项目是什么

类型项目经历·难度中等
查看答题思路

1. 一句话说清任务:分类/生成/检索/推荐 2. 模型选型:为什么选这个而非那个 3. 数据:数据量、来源、清洗策略 4. 创新点:你做的改进是什么(不是调参) 5. 结果:核心指标提升(准确率/召回/延迟)

过拟合是什么?怎么判断和解决

类型专业能力·难度简单
查看答题思路

1. 过拟合=训练集表现好、验证集表现差,模型记住了噪声 2. 判断:train loss 持续下降而 val loss 上升 3. 解决:更多数据 / 正则化(L1/L2) / Dropout / 早停 / 数据增强 / 降低模型复杂度

解释梯度下降的原理,SGD 和 Adam 的区别

类型专业能力·难度中等
查看答题思路

1. 梯度下降:沿负梯度方向更新参数,使损失降低 2. SGD:每次用随机小批量估算梯度,引入随机性帮助跳出局部最优 3. Adam = Momentum + RMSProp:自适应学习率 + 动量加速 4. Adam 收敛快但可能泛化不如 SGD;CV 常用 SGD,NLP 多用 Adam

给你 10 万条未标注的文本数据,如何找出其中 10 个主题

类型情景/案例·难度中等
查看答题思路

1. 预处理:分词、去停用词 2. 向量化:TF-IDF 或 Sentence Embedding 3. 聚类:K-Means(需指定 K=10)或 HDBSCAN(自动确定类数) 4. 或 LDA 主题模型直接输出主题-词分布 5. 评估:看每个簇的高频词判断主题合理性,迭代调整

更多面试题库功能即将上线

信息来源:企业官方招聘页。投递前请以官网信息为准。