← 返回岗位列表

腾讯

校招

腾讯云—基于大模型异构分布式推理性能优化研究

上海 · 校招 · 2027 届 · 本科

长期有效

任职要求

  • 1、深入理解主流大模型架构,包括Transformer及其注意力机制变体(MHA/GQA/MLA等)、MoE稀疏架构、以及多模态相关模型(ViT、VAE、Diffusion等),能够针对不同架构特点进行推理优化;
  • 2、扎实的系统编程与GPU编程能力,熟练使用C/C++和Python,至少掌握CUDA/CUTLASS/Triton中的一种;熟悉MLIR/LLVM编译基础设施或有AI编译器开发经验者优先;
  • 3、熟悉大模型推理引擎的核心技术,包括Attention优化(FlashAttention系列、FlashDecoding等)、KV Cache管理(PagedAttention等)、量化部署(GPTQ/AWQ/FP8等),并有vLLM、SGLang、TensorRT-LLM等主流框架的实际使用或开发经验;
  • 4、具备分布式推理系统设计与优化经验,理解PD分离、Speculative Decoding、Chunked Prefill等架构模式,熟悉TP/SP/EP/CP等并行策略,能针对不同业务场景进行调度与资源优化;
  • 5、了解高性能网络通信技术(RDMA、NVLink、NVSwitch等),能在多机多卡集群环境下进行通信性能调优。

岗位描述

【岗位职责】

课题背景:

随着大模型技术的快速发展,模型架构日趋多样化——从稠密Transformer到稀疏MoE(如DeepSeek-V3),从纯文本到多模态融合,从单轮问答到具备深度推理能力的Reasoning Model——部署模型的规模越来越大,相关服务的QPS也在不断增加,服务的任务种类也在不断增多且各不相同,例如文本摘要服务、对话与Agent服务、图片/视频生成服务、深度推理服务等。各种服务对推理引擎的挑战也各不相同。同样是长序列,文本摘要服务的输入Prompt通常很长,因此TTFT是关键;对话与Agent服务更关注TPOT与多轮交互延迟;图片/视频生成服务则更强调E2E Latency;而Reasoning Model需要支持超长思维链输出,对Decode吞吐提出极高要求。即使是短序列,遇到长序列时也会产生P99问题。这些问题结合当前Prefill和Decode两阶段不同的计算特性、PD分离等新型架构模式的成熟落地、以及日益增大的模型体量与部署规模,给大模型推理引擎和服务带来了巨大挑战。与此同时,推理引擎的性能最终依赖于底层算子的执行效率,而传统由工程师针对每种硬件平台(NVIDIA GPU、国产NPU等)手工编写和调优算子的模式,已难以跟上模型结构快速迭代与多硬件生态并存的节奏。本课题的目标是设计开发一款面向通用场景的分布式大模型推理引擎,同时探索构建一套面向多硬件平台的高性能算子DSL及自动调优编译器,实现从推理服务调度到底层算子生成的全栈极致优化。

课题挑战:

  • 1、在通用场景下,面对不同长度、不同模态和不同种类的大模型请求服务(包括MoE动态路由、超长上下文、多模态混合、深度推理等),满足各自的TTFT、TPOT及P99要求;
  • 2、在上述前提条件下,做到最大化资源利用率,通过PD分离、Speculative Decoding、KV Cache智能管理等技术将单Token的成本降到最低;
  • 3、探索面向多硬件平台的算子DSL与编译优化技术,支持从统一算子描述自动生成多后端高性能代码,降低算子开发与跨平台适配成本,使编译生成的算子性能逼近专家手工优化水平。

具体工作:

  • 1、参与到大模型推理引擎工程项目中的核心开发工作,涵盖PD分离调度、KV Cache管理、多模态Pipeline、MoE动态路由等关键模块并产出成果,其成果的产出能够给我们的大模型推理引擎技术带来直接价值——产品、技术竞争力的提升,从而获得极致的成本优化,带来直接的经济收益;
  • 2、参与面向多硬件平台的高性能算子DSL设计与编译器开发,构建从算子描述到多后端代码生成的自动化工具链,大幅降低算子跨平台适配成本,加速国产AI芯片生态建设;
  • 3、在参与公司、知名厂商及高校合作中,建立行业技术影响力与标杆项目,推动AI基础软件开源生态发展,最终吸引企业用户使用腾讯云的产品;
  • 4、在当前的AI浪潮中,参与AI重构移动互联网应用,以推理引擎与编译优化的核心能力推动行业深刻变革。

【任职要求】

  • 1、深入理解主流大模型架构,包括Transformer及其注意力机制变体(MHA/GQA/MLA等)、MoE稀疏架构、以及多模态相关模型(ViT、VAE、Diffusion等),能够针对不同架构特点进行推理优化;
  • 2、扎实的系统编程与GPU编程能力,熟练使用C/C++和Python,至少掌握CUDA/CUTLASS/Triton中的一种;熟悉MLIR/LLVM编译基础设施或有AI编译器开发经验者优先;
  • 3、熟悉大模型推理引擎的核心技术,包括Attention优化(FlashAttention系列、FlashDecoding等)、KV Cache管理(PagedAttention等)、量化部署(GPTQ/AWQ/FP8等),并有vLLM、SGLang、TensorRT-LLM等主流框架的实际使用或开发经验;
  • 4、具备分布式推理系统设计与优化经验,理解PD分离、Speculative Decoding、Chunked Prefill等架构模式,熟悉TP/SP/EP/CP等并行策略,能针对不同业务场景进行调度与资源优化;
  • 5、了解高性能网络通信技术(RDMA、NVLink、NVSwitch等),能在多机多卡集群环境下进行通信性能调优。

【技术方向】

AI基础设施、系统与安全

你的简历匹配这个岗位吗?

上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方

该岗位可能会问的问题

基于 算法 岗位的常见面试问题整理

请解释 Transformer 模型的自注意力机制(Self-Attention)

类型专业能力·难度困难
查看答题思路

1. Self-Attention = 序列中每个 token 与所有 token 计算相关性权重 2. Q=Wq·x, K=Wk·x, V=Wv·x; Attention(Q,K,V)=softmax(QK^T/√d_k)V 3. 除以 √d_k 防止点积过大导致 softmax 梯度消失 4. 多头注意力:多组 QKV 并行,拼接后线性变换,捕获不同子空间特征 5. 对比 RNN:可并行计算,捕获长距离依赖

你做过的最有深度的算法/模型项目是什么

类型项目经历·难度中等
查看答题思路

1. 一句话说清任务:分类/生成/检索/推荐 2. 模型选型:为什么选这个而非那个 3. 数据:数据量、来源、清洗策略 4. 创新点:你做的改进是什么(不是调参) 5. 结果:核心指标提升(准确率/召回/延迟)

过拟合是什么?怎么判断和解决

类型专业能力·难度简单
查看答题思路

1. 过拟合=训练集表现好、验证集表现差,模型记住了噪声 2. 判断:train loss 持续下降而 val loss 上升 3. 解决:更多数据 / 正则化(L1/L2) / Dropout / 早停 / 数据增强 / 降低模型复杂度

解释梯度下降的原理,SGD 和 Adam 的区别

类型专业能力·难度中等
查看答题思路

1. 梯度下降:沿负梯度方向更新参数,使损失降低 2. SGD:每次用随机小批量估算梯度,引入随机性帮助跳出局部最优 3. Adam = Momentum + RMSProp:自适应学习率 + 动量加速 4. Adam 收敛快但可能泛化不如 SGD;CV 常用 SGD,NLP 多用 Adam

给你 10 万条未标注的文本数据,如何找出其中 10 个主题

类型情景/案例·难度中等
查看答题思路

1. 预处理:分词、去停用词 2. 向量化:TF-IDF 或 Sentence Embedding 3. 聚类:K-Means(需指定 K=10)或 HDBSCAN(自动确定类数) 4. 或 LDA 主题模型直接输出主题-词分布 5. 评估:看每个簇的高频词判断主题合理性,迭代调整

更多面试题库功能即将上线

信息来源:企业官方招聘页。投递前请以官网信息为准。