腾讯
校招多模态大模型/AI算子智能评测体系构建与Agent自动化升级
深圳总部 · 校招 · 2027 届 · 本科
长期有效
任职要求
- 1、具备扎实的 NLP/CV/多模态领域算法基础,深刻理解大模型(LLM/VLM)的基本原理与演进趋势,对大模型能力评测方法论、评测基准(Benchmark)设计以及“以模型评测模型(LLM-as-a-Judge)”深入理解和研究;
- 2、熟练掌握大模型评测核心技术,有高质量评测数据集构建、评测算子开发经验;熟悉并实践过 Agent 核心技术(如 Tool-use、复杂任务规划 Planning),了解强化学习(RLHF/RLAIF)在主观偏好对齐中的应用者优先;
- 3、熟练掌握 PyTorch 等主流深度学习框架,熟悉 LangChain、AutoGen 等主流 Agent 开发框架,代码熟练,具备优秀的端到端评测系统工程化落地能力;
- 4、在 ACL、CVPR、ICLR、NeurIPS、EMNLP 等顶会发表过高质量论文(尤其是大模型评测基准、多模态理解、Agent 架构、强化学习对齐等相关方向),或在相关知名开源评测项目(如 OpenCompass、HELM、Chatbot Arena等)、算法竞赛中获得优异成绩。
岗位描述
【岗位职责】
【课题背景】
驱动大模型快速迭代优化的核心要素是“自知”,即全面评测其智能水平与短板,同时相关AI算子的评测也是影响模型效果的关键。为此,首先需要针对大模型和AI算子构建一套全面且科学的全模态智能评测体系(标准/BMK/评测算子)。在此基础上,针对当前评测流程高度依赖半自动化工具链、主观评测难以对齐等瓶颈,亟需将该评测体系进行“自治化”升级。通过引入 Agent(智能体)架构与强化学习机制,实现从任务理解、算子调度到主观标准对齐的端到端无人工干预闭环,真正做到以评测高效牵引模型迭代优化。
【课题内容】
- 1. 构建全模态与跨模态的智能评测基准体系(打基础):面向大模型与AI算子,构建覆盖多领域知识融合、自主适应与学习、高级认知推理、情感理解及社会交互等维度的全面评测标准与多层次 BMK。
- 2. 研发多维度评测算子与大模型化抽象(造工具):针对不同评测维度开发相应的评测算子。随着体系演进,逐步将碎片化的传统规则算子抽象、整合为统一的“评测大模型”,提升算子在复杂多模态任务中的泛化能力与评测上限。
- 3. 构建基于 Agent 的端到端自治评测架构(做升级):在评测基建基础上进行智能化升级,研发具备任务意图理解、动态规划与工具调用(Tool-use)能力的评测智能体。实现根据任务描述(如数字人生成评测)自动编排数据集、调度评测算子并生成报告的全链路自动化。
- 4. 基于强化学习的主观对齐与协同自进化(攻难点):针对美学、生成自然度等难以规则化的主观评测场景,引入强化学习(RLHF/RLAIF)机制,使 Agent 能够动态学习并逼近人类专家的主观偏好;同时实现评测 BMK 与评测算子的自动化扩充与协同自进化。
【任职要求】
- 1、具备扎实的 NLP/CV/多模态领域算法基础,深刻理解大模型(LLM/VLM)的基本原理与演进趋势,对大模型能力评测方法论、评测基准(Benchmark)设计以及“以模型评测模型(LLM-as-a-Judge)”深入理解和研究;
- 2、熟练掌握大模型评测核心技术,有高质量评测数据集构建、评测算子开发经验;熟悉并实践过 Agent 核心技术(如 Tool-use、复杂任务规划 Planning),了解强化学习(RLHF/RLAIF)在主观偏好对齐中的应用者优先;
- 3、熟练掌握 PyTorch 等主流深度学习框架,熟悉 LangChain、AutoGen 等主流 Agent 开发框架,代码熟练,具备优秀的端到端评测系统工程化落地能力;
- 4、在 ACL、CVPR、ICLR、NeurIPS、EMNLP 等顶会发表过高质量论文(尤其是大模型评测基准、多模态理解、Agent 架构、强化学习对齐等相关方向),或在相关知名开源评测项目(如 OpenCompass、HELM、Chatbot Arena等)、算法竞赛中获得优异成绩。
【技术方向】
多模态、视觉、语音
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 算法 岗位的常见面试问题整理
请解释 Transformer 模型的自注意力机制(Self-Attention)
查看答题思路
1. Self-Attention = 序列中每个 token 与所有 token 计算相关性权重 2. Q=Wq·x, K=Wk·x, V=Wv·x; Attention(Q,K,V)=softmax(QK^T/√d_k)V 3. 除以 √d_k 防止点积过大导致 softmax 梯度消失 4. 多头注意力:多组 QKV 并行,拼接后线性变换,捕获不同子空间特征 5. 对比 RNN:可并行计算,捕获长距离依赖
你做过的最有深度的算法/模型项目是什么
查看答题思路
1. 一句话说清任务:分类/生成/检索/推荐 2. 模型选型:为什么选这个而非那个 3. 数据:数据量、来源、清洗策略 4. 创新点:你做的改进是什么(不是调参) 5. 结果:核心指标提升(准确率/召回/延迟)
过拟合是什么?怎么判断和解决
查看答题思路
1. 过拟合=训练集表现好、验证集表现差,模型记住了噪声 2. 判断:train loss 持续下降而 val loss 上升 3. 解决:更多数据 / 正则化(L1/L2) / Dropout / 早停 / 数据增强 / 降低模型复杂度
解释梯度下降的原理,SGD 和 Adam 的区别
查看答题思路
1. 梯度下降:沿负梯度方向更新参数,使损失降低 2. SGD:每次用随机小批量估算梯度,引入随机性帮助跳出局部最优 3. Adam = Momentum + RMSProp:自适应学习率 + 动量加速 4. Adam 收敛快但可能泛化不如 SGD;CV 常用 SGD,NLP 多用 Adam
给你 10 万条未标注的文本数据,如何找出其中 10 个主题
查看答题思路
1. 预处理:分词、去停用词 2. 向量化:TF-IDF 或 Sentence Embedding 3. 聚类:K-Means(需指定 K=10)或 HDBSCAN(自动确定类数) 4. 或 LDA 主题模型直接输出主题-词分布 5. 评估:看每个簇的高频词判断主题合理性,迭代调整
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。