腾讯
校招腾讯云大数据-流湖一体统一增量计算引擎关键技术研究
北京 · 校招 · 2027 届 · 硕士
长期有效
任职要求
- 1、计算机科学、软件工程、数据科学、分布式系统等相关专业硕士及以上学历;
- 2、扎实的C++编程能力,熟悉现代C++特性(C++17/20),有高性能系统开发经验;具备良好的系统编程基础,熟悉内存管理、并发编程、协程等底层技术;
- 3、熟悉大数据处理框架(如Flink、Spark)或分布式存储系统(如RocksDB、HBase、Iceberg、Paimon等)的原理与实现,有相关开发经验者优先;
- 4、了解LSM Tree、B+ Tree等存储引擎数据结构,熟悉数据库存储引擎或数据湖存储格式(Parquet、ORC等)的设计与优化,有相关项目经验者优先;
- 5、了解分布式系统基本原理,包括一致性协议、存算分离架构、缓存策略、容错机制等;
- 6、具备较强的问题分析、系统设计与工程实现能力,有良好的团队协作和沟通能力;有开源项目贡献经验者优先。
岗位描述
【岗位职责】
课题背景:
Oceanus是腾讯云企业级实时大数据分析平台,当前大数据在实时数据处理场景下普遍采用Lambda架构,存在存储冗余、计算成本高、开发维护复杂(流批两套代码逻辑)等痛点。为此,我们自研了Setats统一流湖存储引擎,以"统一存储+灵活计算"为核心理念,用一套存储替代多套系统,支持流(秒级)、增量(分钟级)、批(小时级)三种执行模式灵活切换,从而实现存储/计算降本与开发效率的提升。
课题挑战:
- 1. 统一存储引擎的高效数据更新与多模式访问:如何在远程存储上实现秒级数据合并与变更捕获,同时高效支持流读写、批读写、点查等多种访问模式的统一处理;
- 2. 存算分离架构下的存储性能优化:如何设计多级缓存与智能预取策略,在存算分离的架构下保证热数据的高效访问,并支持不同计算模式间的平滑切换;
- 3. 存储格式优化与向量化执行加速:如何优化数据存储组织方式以同时满足点查和批量扫描的性能需求,并通过向量化批处理技术大幅提升数据处理吞吐;
- 4. 关键算子的C++高性能重写与执行优化:如何将核心计算算子用C++进行高性能重写,消除运行时开销,并优化远程IO并发模型,充分利用系统资源;
- 5. 流批增量一体的调度与资源优化:如何实现同一套SQL在流/增量/批三种模式间的零代码切换,设计高效的调度与资源复用机制,大幅提升资源利用率。
具体工作:
你将深入参与Setats统一流湖存储引擎的核心研发,主要涉及以下方向的设计与开发:存储引擎的数据写入与合并优化模块;多级缓存系统的缓存管理与预取策略实现;存储格式的读写路径优化;基于C++的向量化执行引擎与关键算子的高性能重写;高并发IO执行框架的设计与优化;增量计算模式下的状态管理与调度引擎适配。同时参与Setats在各类客户场景的落地优化与性能调优工作。
【任职要求】
- 1、计算机科学、软件工程、数据科学、分布式系统等相关专业硕士及以上学历;
- 2、扎实的C++编程能力,熟悉现代C++特性(C++17/20),有高性能系统开发经验;具备良好的系统编程基础,熟悉内存管理、并发编程、协程等底层技术;
- 3、熟悉大数据处理框架(如Flink、Spark)或分布式存储系统(如RocksDB、HBase、Iceberg、Paimon等)的原理与实现,有相关开发经验者优先;
- 4、了解LSM Tree、B+ Tree等存储引擎数据结构,熟悉数据库存储引擎或数据湖存储格式(Parquet、ORC等)的设计与优化,有相关项目经验者优先;
- 5、了解分布式系统基本原理,包括一致性协议、存算分离架构、缓存策略、容错机制等;
- 6、具备较强的问题分析、系统设计与工程实现能力,有良好的团队协作和沟通能力;有开源项目贡献经验者优先。
【技术方向】
AI数据、数据工程
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 数据 岗位的常见面试问题整理
请解释数据仓库的星型模型和雪花模型的区别
查看答题思路
1. 星型:事实表在中间,维度表直接关联,维度表非规范化(有冗余) 2. 雪花:维度表进一步规范化,减少冗余但增加 join 次数 3. 选择:星型查询快(join 少),雪花存储省,一般生产用星型更多
如何设计一个埋点体系来追踪用户行为
查看答题思路
1. 确定业务目标:留存/转化/活跃 2. 定义事件:页面浏览/点击/曝光/转化,每个事件带属性 3. 技术栈:前端 SDK 上报 → Kafka → Flink 实时清洗 → ClickHouse/Hive 存储 4. 数据分层:ODS(原始)→ DWD(明细)→ DWS(汇总)→ ADS(应用) 5. 质量:埋点测试 + 数据校验 + 异常告警
SQL:有一个用户登录表 user_login(user_id, login_date),查询连续登录超过 7 天的用户
查看答题思路
1. 思路:用 login_date 减去排名序号(ROW_NUMBER),同组连续日期差值相同 2. 关键 SQL:SELECT user_id, login_date-ROW_NUMBER() OVER (PARTITION BY user_id ORDER BY login_date) AS grp 3. GROUP BY user_id, grp HAVING COUNT(*) >= 7 4. 强调:理解窗口函数和连续性问题的一般解法
你做过最有价值的数据分析项目是什么
查看答题思路
1. 业务背景:分析什么、为什么重要 2. 数据来源和量级 3. 分析方法:用了什么模型/统计方法 4. 核心发现:一句话说清洞察 5. 业务影响:做了什么决策、带来了什么改变(用数字)
解释 A/B 测试的原理和常见陷阱
查看答题思路
1. 原理:分流用户到对照组和实验组,对比核心指标差异 2. 统计基础:假设检验,p<0.05 表示差异显著 3. 陷阱:样本量不足、运行时间太短(未覆盖周期波动)、多重比较(同时做多组 A/B 需修正显著性水平) 4. 指标选择:北极星指标优先,避免虚荣指标
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。