阿里巴巴
校招大规模多地域数据存储和异构计算系统研究-阿里星
北京/杭州 · 校招 · 2027 届 · 本科
长期有效
任职要求
- 1.工程与系统基础:计算机相关专业背景,具备优秀的工程实现能力,精通 C/C++、Go 或 Python;具备扎实的数据结构、操作系统、分布式系统与存储系统基础,熟悉性能分析与故障定位方法。
- 2.大规模存储系统经验:有分布式文件系统、对象存储、KV 存储、湖仓系统或缓存系统研发经验,理解数据分片、副本、纠删码、一致性协议、元数据管理、冷热分层、跨地域复制等核心机制。
- 3.AI 数据与训练场景理解:熟悉大模型训练数据链路,包括样本构建、数据加载、Checkpoint、模型权重管理、数据版本管理等;有 LLM、多模态训练平台或大规模数据管道经验者优先。
- 4.高性能数据处理经验:熟悉高吞吐 I/O、零拷贝、异步流水线、并行计算、数据压缩、编解码、索引优化等技术;有 GPU Direct Storage、RDMA、高性能网络或异构计算优化经验者优先。
- 5.数据格式与计算引擎经验:熟悉 Parquet、Arrow、ORC、WebDataset、TFRecord、HDF5 等数据格式,或 Spark、Ray、Flink、Dask 等分布式计算框架;有自研样本格式、索引系统或多模态数据处理引擎经验者优先。
- 加分项:对 AI Infra、存储系统与大规模数据处理有强烈兴趣,具备系统性思考能力和端到端优化意识,乐于深入底层、解决复杂工程问题,不惧挑战。"
岗位描述
- 1.大规模多地域 AI 存储架构:负责面向大模型训练与多模态数据处理的多地域数据存储系统设计与演进,支撑跨地域 GPU 集群下模型、样本、特征与中间结果的高效存储、访问与迁移,解决大规模训练中的数据吞吐、成本与稳定性挑战。
- 2.新一代模型存储格式研究:研究面向大模型的高效存储格式,包括浮点数压缩、权重分片、增量存储、Checkpoint 压缩与快速恢复等技术,降低模型存储成本与跨地域传输开销,提升模型存储、分发与恢复效率。
- 3.多模态样本存储与索引系统:设计融合结构化与非结构化数据的多模态样本存储格式,覆盖文本、图像、音频、视频等数据类型,构建高性能索引、元数据管理与数据版本体系,提升大规模训练数据的检索、加载与治理效率。
- 4.样本计算与异构计算引擎:研发高效弹性的多模态样本计算系统,支持数据清洗、解码、增强、过滤、特征抽取等计算流程,结合 CPU / GPU / 异构加速资源进行调度与性能优化,提升样本计算整体效率与资源利用率。
- 5.AI 训练数据底座落地支撑:作为 AI 基础设施核心模块,支撑大模型训练与应用落地,解决训练过程中的数据规模化、跨地域一致性、吞吐抖动、成本控制与系统稳定性问题,保障模型从数据准备到训练应用的顺畅衔接。
- 1.工程与系统基础:计算机相关专业背景,具备优秀的工程实现能力,精通 C/C++、Go 或 Python;具备扎实的数据结构、操作系统、分布式系统与存储系统基础,熟悉性能分析与故障定位方法。
- 2.大规模存储系统经验:有分布式文件系统、对象存储、KV 存储、湖仓系统或缓存系统研发经验,理解数据分片、副本、纠删码、一致性协议、元数据管理、冷热分层、跨地域复制等核心机制。
- 3.AI 数据与训练场景理解:熟悉大模型训练数据链路,包括样本构建、数据加载、Checkpoint、模型权重管理、数据版本管理等;有 LLM、多模态训练平台或大规模数据管道经验者优先。
- 4.高性能数据处理经验:熟悉高吞吐 I/O、零拷贝、异步流水线、并行计算、数据压缩、编解码、索引优化等技术;有 GPU Direct Storage、RDMA、高性能网络或异构计算优化经验者优先。
- 5.数据格式与计算引擎经验:熟悉 Parquet、Arrow、ORC、WebDataset、TFRecord、HDF5 等数据格式,或 Spark、Ray、Flink、Dask 等分布式计算框架;有自研样本格式、索引系统或多模态数据处理引擎经验者优先。
加分项:对 AI Infra、存储系统与大规模数据处理有强烈兴趣,具备系统性思考能力和端到端优化意识,乐于深入底层、解决复杂工程问题,不惧挑战。"
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 数据 岗位的常见面试问题整理
请解释数据仓库的星型模型和雪花模型的区别
查看答题思路
1. 星型:事实表在中间,维度表直接关联,维度表非规范化(有冗余) 2. 雪花:维度表进一步规范化,减少冗余但增加 join 次数 3. 选择:星型查询快(join 少),雪花存储省,一般生产用星型更多
如何设计一个埋点体系来追踪用户行为
查看答题思路
1. 确定业务目标:留存/转化/活跃 2. 定义事件:页面浏览/点击/曝光/转化,每个事件带属性 3. 技术栈:前端 SDK 上报 → Kafka → Flink 实时清洗 → ClickHouse/Hive 存储 4. 数据分层:ODS(原始)→ DWD(明细)→ DWS(汇总)→ ADS(应用) 5. 质量:埋点测试 + 数据校验 + 异常告警
SQL:有一个用户登录表 user_login(user_id, login_date),查询连续登录超过 7 天的用户
查看答题思路
1. 思路:用 login_date 减去排名序号(ROW_NUMBER),同组连续日期差值相同 2. 关键 SQL:SELECT user_id, login_date-ROW_NUMBER() OVER (PARTITION BY user_id ORDER BY login_date) AS grp 3. GROUP BY user_id, grp HAVING COUNT(*) >= 7 4. 强调:理解窗口函数和连续性问题的一般解法
你做过最有价值的数据分析项目是什么
查看答题思路
1. 业务背景:分析什么、为什么重要 2. 数据来源和量级 3. 分析方法:用了什么模型/统计方法 4. 核心发现:一句话说清洞察 5. 业务影响:做了什么决策、带来了什么改变(用数字)
解释 A/B 测试的原理和常见陷阱
查看答题思路
1. 原理:分流用户到对照组和实验组,对比核心指标差异 2. 统计基础:假设检验,p<0.05 表示差异显著 3. 陷阱:样本量不足、运行时间太短(未覆盖周期波动)、多重比较(同时做多组 A/B 需修正显著性水平) 4. 指标选择:北极星指标优先,避免虚荣指标
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。