百度
实习AI-Infra开发工程师(可观测/运维平台方向)(J99647)
北京市/上海市 · 实习 · 不限
长期有效
任职要求
- -扎实的基础知识与工程能力:具备良好的计算机基础(操作系统、网络、数据结构等),具备一定编码能力(如 Go / Python / Java 等),能够完成基础功能开发与问题定位
- -清晰的逻辑思维与问题拆解能力:面对复杂问题具备良好的分析与拆解能力,能够从现象出发逐步定位问题本质,具备以解决问题为导向的思考习惯
- -良好的学习能力与技术兴趣:对云计算、分布式系统或 AI 相关方向有兴趣,具备快速学习新技术并将其应用到实际问题中的能力
- -基本的软件工程意识与责任感:具备良好的代码习惯与工程意识,能够在指导下参与系统开发与优化;具备责任心与沟通能力,能够推动问题闭环
岗位描述
【岗位职责】
-构建统一可观测数据底座:负责日志、指标、链路(Tracing)等多维数据的采集、处理与存储体系建设,推进数据标准化与互联互通,打造统一的数据底座,支撑大规模分布式系统的可观测与运维分析能力
-设计与实现智能运维能力闭环:围绕“巡检 → 诊断 → 根因定位 → 调度止损”构建自动化运维闭环,结合规则引擎与 AI 能力,提升问题发现、定位与处置效率,推动运维从被动响应向主动治理演进
-开发 AI-Agent 驱动的 AIOps 能力中心(AIOps Platform):负责构建以 Agent 为核心的运维平台架构,将诊断、调度、分析等能力进行标准化封装与服务化治理,形成可编排、可推理、可演进的能力体系;通过 Skill / Plugin 机制实现能力的模块化沉淀与动态扩展,支持多 Agent 协同完成复杂运维任务,持续提升平台的自动化与智能化水平
-推动 AI 与运维融合及异构资源治理能力建设:引入大模型与机器学习能力,构建智能分析、异常检测与自动诊断等核心能力,提升系统自愈与智能决策水平;同时面向 CPU / GPU / 混部等异构算力场景,建设统一的资源观测与调度支撑体系,提升资源利用率与系统稳定性
-提升平台稳定性与工程效率:通过自动化运维、发布治理、容量规划与性能优化等手段,保障平台高可用与稳定运行,并持续提升研发与运维整体效率
【任职要求】
-扎实的基础知识与工程能力:具备良好的计算机基础(操作系统、网络、数据结构等),具备一定编码能力(如 Go / Python / Java 等),能够完成基础功能开发与问题定位
-清晰的逻辑思维与问题拆解能力:面对复杂问题具备良好的分析与拆解能力,能够从现象出发逐步定位问题本质,具备以解决问题为导向的思考习惯
-良好的学习能力与技术兴趣:对云计算、分布式系统或 AI 相关方向有兴趣,具备快速学习新技术并将其应用到实际问题中的能力
-基本的软件工程意识与责任感:具备良好的代码习惯与工程意识,能够在指导下参与系统开发与优化;具备责任心与沟通能力,能够推动问题闭环
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 后端开发 岗位的常见面试问题整理
请解释 RESTful API 的设计原则,并举一个你实际设计过的例子
查看答题思路
1. 资源导向:URL 表示资源而非操作 2. HTTP 方法语义:GET/POST/PUT/DELETE 对应查增改删 3. 无状态:每个请求包含全部所需信息 4. 统一接口:一致的响应格式(如 JSON) 5. 举例:用户模块 /users/{id},GET 查/POST 创/PUT 改/DELETE 删,返回统一 {code, data, message}
MySQL 索引的底层数据结构是什么?为什么用 B+ 树而不是哈希表或红黑树
查看答题思路
1. B+ 树:非叶子节点只存 key 不存 data,单次 IO 读更多 key 2. 叶子节点形成有序链表,支持范围查询(哈希表不支持范围) 3. 高度低(3-4 层可存千万级数据),减少磁盘 IO 4. 对比红黑树:B+ 树是多叉的,高度更低,磁盘 IO 更少
你参与过的最复杂的后端项目是什么,你承担了什么角色
查看答题思路
1. 项目背景:一句话说清业务场景 2. 技术栈:语言/框架/数据库/中间件 3. 个人职责:你做的,不是团队做的——用「我设计了」「我优化了」 4. 难点:遇到了什么具体问题,怎么解决的 5. 数据佐证:QPS 从多少提到多少 / 延迟降了多少
什么是微服务架构,和单体架构相比各有什么优劣
查看答题思路
1. 单体:所有功能在一个进程,部署简单,初期开发快;缺点是耦合高、扩展难 2. 微服务:按业务拆分独立服务,独立部署/扩展/技术栈 3. 优点:故障隔离、团队自治、技术栈灵活 4. 缺点:网络开销、分布式事务、运维复杂度 5. 判断标准:团队<10 人或业务不复杂时,单体是更好的选择
如何设计一个高并发的秒杀系统
查看答题思路
1. 前端限流:按钮置灰、验证码 2. 网关层:Nginx 限流 + 负载均衡 3. 业务层:Redis 预减库存(原子操作),消息队列异步下单 4. 数据库:乐观锁扣库存,读写分离 5. 降级方案:流量过大时返回「已售罄」而非崩溃
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。