百度
校招上海-AI infra 推理工程师(基座研发方向)(J101224)
上海市 · 校招 · 2027 届 · 本科
长期有效
任职要求
- -本科及以上学历,计算机、软件工程、人工智能等相关专业
- -掌握C++/Python,掌握CUDA、CUTLASS、CuTe、Triton、TileLang编程
- -熟悉并行计算、分布式系统、存储等相关技术,掌握注意力及矩阵计算优化、批调度策略、分离部署、Cache池化与传输优化等大模型推理核心优化技术
- -有CUDA 编程或高性能计算经验者优先,有计算通信优化、编译优化、巨型算子优化经验者优先
- -有vLLM / SGLang / TensorRTLLM 等主流推理引擎经验者优先,有Agent场景Cache池化优化经验者优化
- -有大模型低比特量化、投机解码、稀疏注意力等相关项目或实习经历者优先
- -有大模型推理系统、大规模调度平台相关项目或实习经历者优先
- -自驱、敢啃硬骨头,对算法前沿保持真实的好奇心;有开源贡献或顶会论文(OSDI / SOSP / MLSys / NeurIPS / ICML 等)是显著加分项
- -软素质要求:结果导向,具备强烈的技术探索自驱力;优秀的团队协作与跨部门沟通能力;善于独立分析和解决复杂系统问题;学习敏锐度高,具备快速迁移知识到新场景的能力
岗位描述
【岗位职责】
-负责百度文心大模型推理基建体系的搭建与演进
-全面参与大模型推理全链路能力建设,涵盖推理功能开发、后训练适配及深度性能优化,重点推进计算模块在GPU下的极致调优
-主导推理引擎、高性能计算库及通信库的设计、开发与迭代,构建自主可控的高性能推理底座
-负责模型结构与推理优化协同设计,加速算法与推理系统协同优化,RL Infa协同设计优化
-负责 AI Infra 前沿进展跟踪调研,开展前瞻性研究与工程验证,推动关键技术突破与创新落地
【任职要求】
-本科及以上学历,计算机、软件工程、人工智能等相关专业
-掌握C++/Python,掌握CUDA、CUTLASS、CuTe、Triton、TileLang编程
-熟悉并行计算、分布式系统、存储等相关技术,掌握注意力及矩阵计算优化、批调度策略、分离部署、Cache池化与传输优化等大模型推理核心优化技术
-有CUDA 编程或高性能计算经验者优先,有计算通信优化、编译优化、巨型算子优化经验者优先
-有vLLM / SGLang / TensorRTLLM 等主流推理引擎经验者优先,有Agent场景Cache池化优化经验者优化
-有大模型低比特量化、投机解码、稀疏注意力等相关项目或实习经历者优先
-有大模型推理系统、大规模调度平台相关项目或实习经历者优先
-自驱、敢啃硬骨头,对算法前沿保持真实的好奇心;有开源贡献或顶会论文(OSDI / SOSP / MLSys / NeurIPS / ICML 等)是显著加分项
-软素质要求:结果导向,具备强烈的技术探索自驱力;优秀的团队协作与跨部门沟通能力;善于独立分析和解决复杂系统问题;学习敏锐度高,具备快速迁移知识到新场景的能力
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 后端开发 岗位的常见面试问题整理
请解释 RESTful API 的设计原则,并举一个你实际设计过的例子
查看答题思路
1. 资源导向:URL 表示资源而非操作 2. HTTP 方法语义:GET/POST/PUT/DELETE 对应查增改删 3. 无状态:每个请求包含全部所需信息 4. 统一接口:一致的响应格式(如 JSON) 5. 举例:用户模块 /users/{id},GET 查/POST 创/PUT 改/DELETE 删,返回统一 {code, data, message}
MySQL 索引的底层数据结构是什么?为什么用 B+ 树而不是哈希表或红黑树
查看答题思路
1. B+ 树:非叶子节点只存 key 不存 data,单次 IO 读更多 key 2. 叶子节点形成有序链表,支持范围查询(哈希表不支持范围) 3. 高度低(3-4 层可存千万级数据),减少磁盘 IO 4. 对比红黑树:B+ 树是多叉的,高度更低,磁盘 IO 更少
你参与过的最复杂的后端项目是什么,你承担了什么角色
查看答题思路
1. 项目背景:一句话说清业务场景 2. 技术栈:语言/框架/数据库/中间件 3. 个人职责:你做的,不是团队做的——用「我设计了」「我优化了」 4. 难点:遇到了什么具体问题,怎么解决的 5. 数据佐证:QPS 从多少提到多少 / 延迟降了多少
什么是微服务架构,和单体架构相比各有什么优劣
查看答题思路
1. 单体:所有功能在一个进程,部署简单,初期开发快;缺点是耦合高、扩展难 2. 微服务:按业务拆分独立服务,独立部署/扩展/技术栈 3. 优点:故障隔离、团队自治、技术栈灵活 4. 缺点:网络开销、分布式事务、运维复杂度 5. 判断标准:团队<10 人或业务不复杂时,单体是更好的选择
如何设计一个高并发的秒杀系统
查看答题思路
1. 前端限流:按钮置灰、验证码 2. 网关层:Nginx 限流 + 负载均衡 3. 业务层:Redis 预减库存(原子操作),消息队列异步下单 4. 数据库:乐观锁扣库存,读写分离 5. 降级方案:流量过大时返回「已售罄」而非崩溃
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。