小鹏汽车
校招【27届校招】通用智能AI平台研发工程师
北京/上海/广州 · 校招 · 2027 届 · 博士
长期有效
任职要求
- 2027届硕士/博士毕业生,计算机、软件工程、人工智能、自动化、电子信息等相关专业
- 扎实的编程基础,熟练掌握 Python/C++/Java/Scala 中至少一门语言,有良好的工程习惯与代码质量意识
- 熟悉至少一项大数据处理框架(Spark/Flink)或深度学习框架(PyTorch/TensorFlow)
- 对自动驾驶场景有基本认知和浓厚兴趣——你不一定懂感知算法细节,但要理解数据对算法训练的价值。
- 加分项(满足1-2项即可,非硬性要求)
- 有数据仓库建模或数据湖(Iceberg/Delta Lake/Hudi)实际使用经验
- 熟悉分布式计算原理,有Spark/Flink任务性能调优经验
- 了解Kubernetes及GPU虚拟化技术,有集群资源调度相关实践
- 使用过Milvus、Weaviate、Pinecone等向量数据库,或对向量检索算法(HNSW/IVF)有研究
- 熟悉VLM/多模态模型(如CLIP、LLaVA、Qwen-VL等),有特征提取或模型微调经验
- 有自动驾驶相关数据集(nuScenes/Waymo/Argoverse)的处理经验,在ACM、Kaggle、天池等编程/数据竞赛中取得过优异成绩
- 有高质量技术博客或开源项目贡献。
岗位描述
小鹏AI数据闭环平台团队,打造支撑百万级路采、千卡GPU的自动驾驶与具身智能AI基础设施。你将处理PB级多传感器数据,直面分布式训练、大模型标注等工业级挑战,深度应用VLM自动化标注、Milvus向量检索、流批一体、GPU调度等前沿技术。参与数据接入→训练→推理→回流全链路建设。27届校招专属培养,mentor带教,目标快速独立负责核心模块。
方向一:大规模数据处理
- 1、开发Spark/Flink ETL流水线,处理车载传感器数据(图像/点云/GPS/CAN);
- 2、构建多模态Embedding生产流水线,支持分布式特征提取;
- 3、探索VLM自动标签生成,减少人工标注依赖;
- 4、构建驾驶场景语义检索系统(如“夜间雨天前车急刹”)。
方向二:数据建模与治理
- 1、设计数仓分层模型(ODS/DWD/DWS/ADS),支撑算法训练;
- 2、构建数据血缘与元数据管理体系,确保全链路可追溯;
- 3、制定多模态数据Embedding规范,保障特征输入质量。
方向三:AI平台架构与优化
- 1、搭建Iceberg/Doris湖仓一体架构,兼顾灵活性与查询性能;
- 2、开发Milvus向量数据库,支撑亿级低延迟检索;
- 3、优化存储计算性能(分区/压缩/缓存),探索流批一体、存算分离;
- 4、设计Parquet/ORC存储策略,优化I/O吞吐。
方向四:分析工具与可视化
- 1、开发BI看板,监控数据质量与核心指标(准确率/接管率/覆盖率);
- 2、提供多模态检索接口,支持文本搜视频片段。
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 算法 岗位的常见面试问题整理
请解释 Transformer 模型的自注意力机制(Self-Attention)
查看答题思路
1. Self-Attention = 序列中每个 token 与所有 token 计算相关性权重 2. Q=Wq·x, K=Wk·x, V=Wv·x; Attention(Q,K,V)=softmax(QK^T/√d_k)V 3. 除以 √d_k 防止点积过大导致 softmax 梯度消失 4. 多头注意力:多组 QKV 并行,拼接后线性变换,捕获不同子空间特征 5. 对比 RNN:可并行计算,捕获长距离依赖
你做过的最有深度的算法/模型项目是什么
查看答题思路
1. 一句话说清任务:分类/生成/检索/推荐 2. 模型选型:为什么选这个而非那个 3. 数据:数据量、来源、清洗策略 4. 创新点:你做的改进是什么(不是调参) 5. 结果:核心指标提升(准确率/召回/延迟)
过拟合是什么?怎么判断和解决
查看答题思路
1. 过拟合=训练集表现好、验证集表现差,模型记住了噪声 2. 判断:train loss 持续下降而 val loss 上升 3. 解决:更多数据 / 正则化(L1/L2) / Dropout / 早停 / 数据增强 / 降低模型复杂度
解释梯度下降的原理,SGD 和 Adam 的区别
查看答题思路
1. 梯度下降:沿负梯度方向更新参数,使损失降低 2. SGD:每次用随机小批量估算梯度,引入随机性帮助跳出局部最优 3. Adam = Momentum + RMSProp:自适应学习率 + 动量加速 4. Adam 收敛快但可能泛化不如 SGD;CV 常用 SGD,NLP 多用 Adam
给你 10 万条未标注的文本数据,如何找出其中 10 个主题
查看答题思路
1. 预处理:分词、去停用词 2. 向量化:TF-IDF 或 Sentence Embedding 3. 聚类:K-Means(需指定 K=10)或 HDBSCAN(自动确定类数) 4. 或 LDA 主题模型直接输出主题-词分布 5. 评估:看每个簇的高频词判断主题合理性,迭代调整
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。