← 返回岗位列表

腾讯

校招

微信搜索-Agent研究

北京 · 校招 · 2027 届 · 博士

长期有效

任职要求

  • 面向计算机科学、人工智能、机器学习、应用数学等相关专业的硕士或博士同学;在顶级学术会议(如ICML, ICLR, NeurIPS, COLM, RLC等)有相关论文发表经验者优先。
  • 深入理解 MCP (Model Context Protocol)、Harness 等工具封装抽象,并有落地实践;
  • 熟悉主流模型的多轮工具调用协议 (OpenAI FC、Anthropic Tool Use、Gemini FC、Qwen / DeepSeek 私有协议) 及 Interleaved Thinking (Claude 3.7 Extended Thinking / OpenAI o-series / DeepSeek-R1) 的技术细节;
  • 熟悉 veRL / OpenRLHF / slime / Nemo-Aligner 等 RL 训练框架,有多轮 RL / GRPO / DAPO / Async RL 落地经验;
  • 具备极强的数据直觉,有大规模 tool-call/response 数据清洗、质量过滤以及数据合成的实战经验。具备一定的工程代码能力。

岗位描述

【岗位职责】

课题背景:

大模型正在从"知识对齐 (Alignment)"迈入"世界交互 (Interaction)"的新范式。仅依赖预训练知识与后训练对齐 (SFT / RLHF / DPO),已难以满足海量真实用户在多步推理、跨系统协作、动态环境决策上的诉求。Agent 正是大模型走向物理与数字世界的关键载体:它通过工具协议 (Tool Protocol)、规划 (Planning)、反思 (Reflection) 与记忆 (Memory) 构成的闭环,把模型能力外延到真实业务链路。微信天然的内生态工具,为构建连接微信内部资源的 Agent 系统服务好海量用户需求奠定了基础,也是模型向与真实世界交互的关键一步。在这里,我们围绕工具协议标准化 (MCP / Harness)、Agentic 数据合成、Agentic RL、多轮 Tool-Use 训练、可信评测 五大支柱,系统性地把模型在真实 Agentic 任务上的能力上限推向新的 SOTA,并在微信生态中实现规模化落地。

课题挑战:

在多步、多工具 (Multi-Tool, Multi-Turn) 场景下,模型输出的 tool-call schema 必须与工具真实签名严格对齐——参数类型、必填项、命名一致性、JSON / XML / Function-Calling 格式、错误恢复策略均需鲁棒。长上下文下的 schema drift:随着工具数量线性增长,工具描述被稀释、模型出现幻觉调用。同时Tool Selection under Ambiguity:Query 意图不清时的澄清 / 探索 / 试错策略也需要探索。

Agentic RL 的研究。信用分配 (Credit Assignment):多轮 rollout 中稀疏且延迟的奖励如何回传到早期决策。Rollout 成本爆炸:真实工具调用带来的时延、同步采样的空等,都制约了 rollout 的高效性。On-policy vs Off-policy 权衡:GSPO / Reinforce++ / VAPO 等算法在多轮 tool-use 场景的稳定性也需要验证。

评测是模型迭代的指北针。当前公开 benchmark (τ-bench、BFCL v3、AgentBench、GAIA、WebArena、ToolBench) 各有偏侧,均无法完整刻画真实业务链路。内部需要构建针对工具调用格式、效率、鲁棒性(错误调用时的纠偏)的评估。

具体工作:

负责模型 Agentic 能力的端到端提升,覆盖但不限于:

工具协议与 Harness 建设:设计并维护统一的工具封装协议 (MCP-aligned Harness),抽象微信内异构工具 (RPC / OpenAPI / MCP Server) 为一致的调用接口。主导工具描述规范 (schema 编写指南、few-shot 范本、错误码规范) 的落地。

Agentic 数据合成与质量过滤:大规模 tool-call / response 数据的清洗、去重、质量过滤、难度分层 (curriculum);合成数据 pipeline:基于强模型 self-play、AI Feedback (RLAIF)、反事实增广、失败案例挖掘 (hard negatives) 构建多样化训练集;

Agentic 训练算法:完成 SFT、Rejection Sampling 的训练,稳定多轮 Agentic RL 在 tool-use 场景下的持久 scaling。进行 PRM、ORM 的联合训练和消融,结合 OPD 方法高效训练 RL。

评测体系与迭代闭环:构建微信 Agent 强相关任务 bench,覆盖真实用户 query 分布、单/多工具、串/并行、长/短程任务。建立离线自动评测 + 在线 A/B + 人评校准的三级评测流水线,反哺数据与算法迭代。

前沿探索:探究多 Agent 协同 (Multi-Agent Society)、在线持续学习(Continue Learning)、智能体记忆系统(Agentic Memory)的架构与训练协同。

【任职要求】

面向计算机科学、人工智能、机器学习、应用数学等相关专业的硕士或博士同学;在顶级学术会议(如ICML, ICLR, NeurIPS, COLM, RLC等)有相关论文发表经验者优先。

深入理解 MCP (Model Context Protocol)、Harness 等工具封装抽象,并有落地实践;

熟悉主流模型的多轮工具调用协议 (OpenAI FC、Anthropic Tool Use、Gemini FC、Qwen / DeepSeek 私有协议) 及 Interleaved Thinking (Claude 3.7 Extended Thinking / OpenAI o-series / DeepSeek-R1) 的技术细节;

熟悉 veRL / OpenRLHF / slime / Nemo-Aligner 等 RL 训练框架,有多轮 RL / GRPO / DAPO / Async RL 落地经验;

具备极强的数据直觉,有大规模 tool-call/response 数据清洗、质量过滤以及数据合成的实战经验。具备一定的工程代码能力。

【技术方向】

智能体、强化学习

你的简历匹配这个岗位吗?

上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方

该岗位可能会问的问题

基于 运营 岗位的常见面试问题整理

我提到了电竞方面,另一个面试官就问我对于ig战队(lol)的看法,然后一道情景题:公司和ig方面有合作,怎样运营才能吸引ig粉丝使用我们产品

类型专业能力·难度中等·一面·咪咕动漫
查看答题思路

1. 电竞营销=粉丝经济,核心是社区运营而非传统广告 2. 跨界合作:战队/选手/IP 联名,借粉丝流量 3. 内容策略:比赛直播/选手日常/粉丝二创/社区活动 4. 案例:用 STAR 讲一个电竞相关的运营策划

另一个面试官看我的专业(偏设计)就问我愿不愿意做产品设计方向,让我发作品集 大概就这些 #咪咕#<a href="/creation/subject/928d551be73f40db82c0ed83286c8783" target="_blank" class="s

类型专业能力·难度中等·一面·咪咕动漫
查看答题思路

1. 核心概念:一句话说清这个问题的底层逻辑 2. 方法论/框架:用 STAR 原则或专业框架结构化回答 3. 实际案例:结合一个具体场景说明 4. 量化结果:用数据佐证你的观点

你认为内容运营需要具备哪些能力

类型专业能力·难度简单·一面·搜狐
查看答题思路

1. 内容运营=创作有价值的内容→分发到正确渠道→吸引目标用户→促成转化 2. 核心能力:选题能力(知道用户想看什么)、写作能力、数据分析能力(用数据迭代内容策略) 3. 生命周期:选题→创作→审核→发布→分发→数据回收→优化→二次传播 4. 优质内容标准:原创/有用/有趣/有共鸣/有行动引导

谈谈你理解的内容生命周期

类型动机/岗位认知·难度简单·一面·搜狐
查看答题思路

1. 真诚:为什么对这个方向感兴趣(具体经历/瞬间) 2. 匹配:你的能力和这个岗位的契合点 3. 成长:你希望从这个岗位学到什么 4. 贡献:你能为团队带来什么

自我介绍

类型动机/岗位认知·难度中等·一面·咪咕动漫
查看答题思路

1. 我是谁(姓名+学校+专业,15秒) 2. 我做过什么(最相关的 1-2 个经历,30秒) 3. 为什么适合这个岗位(能力匹配,15秒) 4. 总时长控制在 1 分钟以内 5. 避免:念简历、说「我学习能力强」这种空话

更多面试题库功能即将上线

信息来源:企业官方招聘页。投递前请以官网信息为准。