腾讯
实习大规模资源调度技术研究
深圳总部 · 实习 · 不限
长期有效
任职要求
- 1、强烈的技术自驱力,能快速学习GPU/NPU新硬件架构及前沿论文技术
- 2、熟悉Kubernetes核心组件(调度器/网络/存储)、容器运行时及CRD开发,具备大规模集群调优经验
- 3、具备OpenMP/MPI/RDMA高性能计算开发经验
- 4、熟悉主流AI框架及训练加速技术(算子优化/显存管理)
- 5、加分项:
- 有万卡级GPU集群调度实战经验(如弹性任务抢占、跨集群资源池化)
- 熟悉分布式训练框架、大规模训练推理等技术
- 在MLSys/ATC等顶会发表过资源调度相关论文
- 此课题同时招聘应届实习生和低年级实习生。
岗位描述
【岗位职责】
课题背景
AI领域任务对异构算力的需求急剧增长,且常依赖跨地域分布的存储、数据等资源。传统的、局限于单个数据中心或单一硬件类型的集中式调度器,已难以满足调度此类复杂作业的需求。
本项目基于联邦集群架构,研究大规模 AI 场景下资源调度能力。通过刻画不同任务在不同卡型的计算能力、不同任务其他依赖其他资源(包括异地存储等资源),研究一体化联邦调度方案。最终实现资源利用率和用户任务执行效率最优。
课题挑战
- 1. 复杂约束下的跨域调度建模:AI任务调度决策不仅需考虑计算资源,还需统筹网络带宽(用于梯度同步)、跨地域数据访问延迟、存储I/O性能以及作业内部的亲和性约束。在联邦环境下,将这些异构、跨域的软硬件约束统一建模为一个可解的优化问题。
2, 多卡型算力的归一化与效能评估:不同型号卡在各类上的实际算力与能效比差异显著。难点在于建立一套精准、通用的“算力归一化”模型,将不同卡型的计算能力与业务特性精确匹配。
具体工作:
- 1. 研究跨集群场景下,计算任务跨集群、跨卡型、跨地域调度。
- 2. 解决超大规模调度场景下的规模、性能问题。
- 3. 多卡型算力归一化
【任职要求】
- 1、强烈的技术自驱力,能快速学习GPU/NPU新硬件架构及前沿论文技术
- 2、熟悉Kubernetes核心组件(调度器/网络/存储)、容器运行时及CRD开发,具备大规模集群调优经验
- 3、具备OpenMP/MPI/RDMA高性能计算开发经验
- 4、熟悉主流AI框架及训练加速技术(算子优化/显存管理)
5、加分项:
有万卡级GPU集群调度实战经验(如弹性任务抢占、跨集群资源池化)
熟悉分布式训练框架、大规模训练推理等技术
在MLSys/ATC等顶会发表过资源调度相关论文
【加分项】
此课题同时招聘应届实习生和低年级实习生。
【技术方向】
其他
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 运营 岗位的常见面试问题整理
我提到了电竞方面,另一个面试官就问我对于ig战队(lol)的看法,然后一道情景题:公司和ig方面有合作,怎样运营才能吸引ig粉丝使用我们产品
查看答题思路
1. 电竞营销=粉丝经济,核心是社区运营而非传统广告 2. 跨界合作:战队/选手/IP 联名,借粉丝流量 3. 内容策略:比赛直播/选手日常/粉丝二创/社区活动 4. 案例:用 STAR 讲一个电竞相关的运营策划
另一个面试官看我的专业(偏设计)就问我愿不愿意做产品设计方向,让我发作品集 大概就这些 #咪咕#<a href="/creation/subject/928d551be73f40db82c0ed83286c8783" target="_blank" class="s
查看答题思路
1. 核心概念:一句话说清这个问题的底层逻辑 2. 方法论/框架:用 STAR 原则或专业框架结构化回答 3. 实际案例:结合一个具体场景说明 4. 量化结果:用数据佐证你的观点
你认为内容运营需要具备哪些能力
查看答题思路
1. 内容运营=创作有价值的内容→分发到正确渠道→吸引目标用户→促成转化 2. 核心能力:选题能力(知道用户想看什么)、写作能力、数据分析能力(用数据迭代内容策略) 3. 生命周期:选题→创作→审核→发布→分发→数据回收→优化→二次传播 4. 优质内容标准:原创/有用/有趣/有共鸣/有行动引导
谈谈你理解的内容生命周期
查看答题思路
1. 真诚:为什么对这个方向感兴趣(具体经历/瞬间) 2. 匹配:你的能力和这个岗位的契合点 3. 成长:你希望从这个岗位学到什么 4. 贡献:你能为团队带来什么
自我介绍
查看答题思路
1. 我是谁(姓名+学校+专业,15秒) 2. 我做过什么(最相关的 1-2 个经历,30秒) 3. 为什么适合这个岗位(能力匹配,15秒) 4. 总时长控制在 1 分钟以内 5. 避免:念简历、说「我学习能力强」这种空话
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。