← 返回岗位列表

阿里巴巴

校招

面向多模态与Agentic 湖仓的 AI-aware 查询优化技术-阿里星/A Star

杭州 · 校招 · 2027 届 · 博士

长期有效

任职要求

  • 1. 计算机相关专业博士
  • 2. 熟悉数据库系统、分布式系统、查询优化技术、机器学习系统、向量检索、大规模数据处理中的一个或多个方向。
  • 3. 对 AI Native 数据平台、Agent Native 工程体系、Agentic Lakehouse 和多模态数据处理有强烈兴趣,愿意探索 LLM、Agent、RAG、semantic operator、AI function、向量检索、全文检索、混合检索等前沿方向。
  • 4. 具备较强的问题抽象、技术判断和工程落地能力,能够将前沿 AI 技术问题转化为可运行、可优化、可观测、可规模化落地的系统能力。
  • 5. 有数据库、分布式系统、AI 系统、机器学习系统、Agent 系统相关顶会论文、开源项目、竞赛或高质量实习经历者优先。
  • 6. 愿意在 AI + Data Infrastructure 的交叉方向长期深耕,参与构建下一代 AI Native / Agent Native 湖仓基础设施。

岗位描述

AI 正在重塑数据平台的形态。未来的湖仓系统不再只是承载人写的 SQL,也将成为 AI agent 理解数据、检索知识、规划任务、调用工具和执行决策的核心基础设施。传统查询优化技术主要围绕结构化数据,关注 CPU、IO、网络、cardinality、join order、数据分布和访问路径选择;而在 AI Native 时代,查询执行链路中会越来越多地出现 LLM 调用、semantic operator、embedding、向量检索、全文检索、多模态文档解析、RAG pipeline 和 agentic workflow。

这带来了全新的技术挑战:查询优化技术不仅要决定数据如何访问、计算如何组织、结果如何物化,还需要进一步感知和优化 模型调用成本、token 消耗、推理 latency、语义质量、向量召回率、多模态解析成本、AI 结果缓存与增量维护成本。查询优化技术正在从传统 CBO / RBO / 执行计划优化,演进为面向 AI workload 的 AI-aware 查询优化体系,成为连接数据、模型和 agent 的智能规划与执行基础。

本岗位面向阿里云湖仓 / 数仓引擎核心技术团队,聚焦 “面向多模态与 Agentic 湖仓的 AI-aware 查询优化技术”,探索下一代 AI 数据平台的核心系统能力。你将参与建设 semantic operator、AI-aware cost model、混合检索优化、多模态 AI pipeline、AI function 增量计算、Agentic智能数仓等前沿方向,让大规模湖仓系统能够更高效、更低成本、更可解释地支撑 AI agent 和多模态数据处理。

这是一个处在数据库系统、分布式系统、机器学习系统、LLM 应用基础设施和 AI Native 数据平台交叉处的前沿方向。你将有机会在真实超大规模工业系统中解决学术界和工业界都在探索的新问题,并将研究创新沉淀为产品能力、工程系统和业界影响力。

岗位职责

  • 1. 探索 AI-aware 查询优化核心技术

面向 LLM、AI function、semantic operator 和多模态 workload,研究和实现下一代查询优化能力,包括 AI-aware cost model、语义算子重写、模型调用优化、推理成本优化、结果缓存与复用等。

  • 2. 建设面向 AI workload 的 semantic operator 体系

设计和实现 AI_FILTER、AI_CLASSIFY、AI_AGG / AI_SUMMARY_AGG、AI_EMBED、AI_SIMILARITY 等语义算子的优化能力,使 AI 计算不再只是黑盒 UDF,而是可被系统理解、规划和优化的一等计算能力。

优化向量检索、全文检索和混合检索执行路径

  • 3. 面向 RAG、知识检索、多模态搜索等场景,建设向量检索、全文检索、混合检索的统一查询优化能力,探索 filter pushdown、ANN / exact search 选择、top-k fusion、semantic rerank、retrieval + rerank 两阶段优化等策略。
  • 4. 构建多模态 AI pipeline 的增量计算能力

结合湖仓增量计算能力,探索文档解析、embedding 生成、分类、摘要、RAG 预处理等 AI function 的增量维护机制,降低多模态 AI 数据处理的计算成本和刷新延迟。

  • 5. 推动智能数仓走向 Agentic 自反馈优化

参与 Agentic AutoMV、智能数据排布、索引 / 排序 / clustering 推荐与自动应用等能力建设,探索由 agent 驱动的“发现问题—生成优化方案—自动应用—观测收益—自反馈调整”闭环。

  • 6. 打造 AI Native 数据基础设施的技术影响力

围绕 AI-aware 查询优化技术、semantic operator、Agentic Lakehouse、多模态增量计算、混合检索优化等方向,沉淀高质量技术方案、论文、专利和系统能力,提升团队在 AI + Data Infrastructure 方向的业界影响力。

  • 1. 计算机相关专业博士
  • 2. 熟悉数据库系统、分布式系统、查询优化技术、机器学习系统、向量检索、大规模数据处理中的一个或多个方向。
  • 3. 对 AI Native 数据平台、Agent Native 工程体系、Agentic Lakehouse 和多模态数据处理有强烈兴趣,愿意探索 LLM、Agent、RAG、semantic operator、AI function、向量检索、全文检索、混合检索等前沿方向。
  • 4. 具备较强的问题抽象、技术判断和工程落地能力,能够将前沿 AI 技术问题转化为可运行、可优化、可观测、可规模化落地的系统能力。
  • 5. 有数据库、分布式系统、AI 系统、机器学习系统、Agent 系统相关顶会论文、开源项目、竞赛或高质量实习经历者优先。
  • 6. 愿意在 AI + Data Infrastructure 的交叉方向长期深耕,参与构建下一代 AI Native / Agent Native 湖仓基础设施。

你的简历匹配这个岗位吗?

上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方

该岗位可能会问的问题

基于 产品 岗位的常见面试问题整理

介绍一款自己喜欢的app

类型动机/岗位认知·难度简单·二面·携程
查看答题思路

选你深度使用的app+核心用户+核心价值+2-3个好的设计决策+1个改进建议

如何沟通协调五个部门的负责人来确定一个会议时间

类型专业能力·难度中等·二面·携程
查看答题思路

先发Doodle/投票选时间+对无法参加的单独沟通+提前发议程让缺席者也能贡献意见

请做一个简短的自我介绍

类型动机/岗位认知·难度简单·一面·小米
查看答题思路

姓名+学校+实习经历(1-2家)+与岗位的关联点,控制在60秒内

为什么选择投递小米产品类的产品经理岗位?

类型动机/岗位认知·难度简单·一面·小米
查看答题思路

对小米产品理念和IoT生态的理解+个人职业方向与小米业务的契合点

通过这个项目,你觉得如果未来的工作里面遇到这样的问题,你可以怎么解决

类型情景/案例·难度中等·二面·携程
查看答题思路

从失败中提炼可迁移的方法论+应用到假设的新场景+展现学习能力

更多面试题库功能即将上线

信息来源:企业官方招聘页。投递前请以官网信息为准。