腾讯
实习元宝—搜索大模型推理加速研究
北京 · 实习 · 博士
长期有效
任职要求
- 学历和专业要求:
- 计算机、人工智能、高性能计算或相关专业硕士及以上学历,博士优先。需具备扎实的深度学习理论基础,在高性能计算、编译器优化或大模型架构领域有深入研究背景。
- 技术技能要求:
- 精通PyTorch/TensorRT/vLLM等框架,熟练掌握CUDA编程与分布式训练推理技术。深入理解Transformer/SSM架构,拥有模型剪枝、量化及大规模搜索系统落地经验者优先。
- 软性素质要求:
- 具备极强的技术自驱力与系统架构思维,善于跨算法与系统工程边界协同攻关。拥有优秀的沟通协作能力,能在高并发、低延迟的生产环境下高效解决复杂工程难题。
岗位描述
【岗位职责】
课题背景:
大规模搜索系统面临长序列建模、高计算开销与异构资源约束的挑战,传统稠密注意力模型在效率、存储及部署层面存在显著瓶颈,制约系统性能与扩展性。
课题挑战:
- 1、近线性注意力的语义保真:在实现O(n)的近似注意力计算时,需突破在长序列建模中的语义瓶颈,在降低计算负载的同时保持全局语义的建模能力,避免因近似计算导致的排序精度衰减。
- 2、多约束的联合压缩优化:结构化稀疏、动态路由与非均匀量化形成了包含离散与连续变量的混合优化空间,需在精度、效率、鲁棒性的多重约束下建立联合优化范式,实现多维压缩目标间的平衡。
- 3、异构算力的协同调度:混合硬件架构中,计算、通信、I/O等资源深度耦合。需建立统一的计算图分析与调度模型,突破异构分布式推理的性能边界,实现异构资源的性能突破。
具体工作:
- 1、高效推理注意力机制
研究并设计高性能注意力机制(线性注意力、稀疏注意力),针对搜索长序列短输出场景定制算子,将计算复杂度从 O(n^2) 降至 O(n) ,在保障排序精度的前提下显著提升推理吞吐与响应速度。
- 2、高精度结构化模型压缩
构建融合结构化稀疏、动态路由与非均匀量化的联合压缩范式,以排序指标为约束优化模型体量,实现计算与存储的协同压缩,确保轻量化后精度无损。
- 3、异构分布式推理架构
设计混合并行策略与通信原语融合机制,优化跨节点传输与动态调度能力,打通从算子内核到集群的全栈链路,挖掘异构资源潜力以触达系统性能边界。
【任职要求】
学历和专业要求:
计算机、人工智能、高性能计算或相关专业硕士及以上学历,博士优先。需具备扎实的深度学习理论基础,在高性能计算、编译器优化或大模型架构领域有深入研究背景。
技术技能要求:
精通PyTorch/TensorRT/vLLM等框架,熟练掌握CUDA编程与分布式训练推理技术。深入理解Transformer/SSM架构,拥有模型剪枝、量化及大规模搜索系统落地经验者优先。
软性素质要求:
具备极强的技术自驱力与系统架构思维,善于跨算法与系统工程边界协同攻关。拥有优秀的沟通协作能力,能在高并发、低延迟的生产环境下高效解决复杂工程难题。
【技术方向】
AI基础设施、系统与安全
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 算法 岗位的常见面试问题整理
请解释 Transformer 模型的自注意力机制(Self-Attention)
查看答题思路
1. Self-Attention = 序列中每个 token 与所有 token 计算相关性权重 2. Q=Wq·x, K=Wk·x, V=Wv·x; Attention(Q,K,V)=softmax(QK^T/√d_k)V 3. 除以 √d_k 防止点积过大导致 softmax 梯度消失 4. 多头注意力:多组 QKV 并行,拼接后线性变换,捕获不同子空间特征 5. 对比 RNN:可并行计算,捕获长距离依赖
你做过的最有深度的算法/模型项目是什么
查看答题思路
1. 一句话说清任务:分类/生成/检索/推荐 2. 模型选型:为什么选这个而非那个 3. 数据:数据量、来源、清洗策略 4. 创新点:你做的改进是什么(不是调参) 5. 结果:核心指标提升(准确率/召回/延迟)
过拟合是什么?怎么判断和解决
查看答题思路
1. 过拟合=训练集表现好、验证集表现差,模型记住了噪声 2. 判断:train loss 持续下降而 val loss 上升 3. 解决:更多数据 / 正则化(L1/L2) / Dropout / 早停 / 数据增强 / 降低模型复杂度
解释梯度下降的原理,SGD 和 Adam 的区别
查看答题思路
1. 梯度下降:沿负梯度方向更新参数,使损失降低 2. SGD:每次用随机小批量估算梯度,引入随机性帮助跳出局部最优 3. Adam = Momentum + RMSProp:自适应学习率 + 动量加速 4. Adam 收敛快但可能泛化不如 SGD;CV 常用 SGD,NLP 多用 Adam
给你 10 万条未标注的文本数据,如何找出其中 10 个主题
查看答题思路
1. 预处理:分词、去停用词 2. 向量化:TF-IDF 或 Sentence Embedding 3. 聚类:K-Means(需指定 K=10)或 HDBSCAN(自动确定类数) 4. 或 LDA 主题模型直接输出主题-词分布 5. 评估:看每个簇的高频词判断主题合理性,迭代调整
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。