字节跳动
实习CVR模型优化(长程任务Agent方向)算法实习生 - 国际化搜索广告
北京 · 实习 · 本科
长期有效
任职要求
- 本科及以上学历在读,计算机、人工智能、机器学习、统计学、数据科学等相关专业优先
- 有广告、推荐、深度学习相关科研或实习经历优先,了解搜索广告CVR/CTR建模者优先
- 扎实的机器学习、深度学习理论基础,了解CVR预估、时序建模、延迟反馈建模、负样本挖掘等广告建模核心技术,对搜索广告业务有基本认知
- 对大模型Agent、长序列任务建模、智能决策有技术认知和研究兴趣,了解长程Agent的基础架构、记忆机制、任务规划逻辑,有相关项目、课程设计、科研经历优先
- 熟练使用PyTorch/TensorFlow任意一种深度学习框架,具备基础的数据处理、模型训练、调优实战能力,熟悉Python数据分析常用工具
- 具备基本的数据分析、实验复盘能力,理解A/B测试核心逻辑,善于发现问题、总结问题。
- 加分条件
- 有大模型Agent、强化学习、长时序预测、多智能体协作相关落地项目经验
- 有国际化搜索广告、电商广告长周期CVR优化实战经验
- 在顶会(KDD、SIGIR、WWW、NeurIPS等)发表过广告、推荐、Agent相关论文者优先。
岗位描述
团队介绍:国际化搜索广告团队不断突破通用搜索引擎变现的界限,覆盖海外应用,致力于构建全球领先的搜索广告变现系统。在国际化搜索广告团队,您将有机会从事大规模分布式存储和架构、自然语言处理、排序和信息检索相关的问题。您还将深入参与我们的广告样式、创意展示和广告投放链路的创新和优化。我们正在寻找勇于挑战困难、热衷于解决复杂问题并与热情洋溢的候选人们共同发展我们的搜索广告产品。
日常实习:面向全体在校生,为符合岗位要求的同学提供为期3个月及以上的项目实践机会。
- 1、CVR模型核心优化工作:协助团队开展搜索广告场景下CVR转化预估模型的迭代与优化工作,跟进搜索广告召回、粗排、精排、出价全链路逻辑,针对国际化用户长周期延迟转化场景,辅助优化模型预估偏差、样本稀疏、时序偏移等问题,配合完成模型效果迭代,助力提升CVR预估精度、降低广告CPA;
- 2、长程任务Agent技术落地创新(核心重点):核心参与长程任务智能Agent在广告CVR建模中的创新落地项目,协助调研适配搜索广告场景的长程Agent技术,跟进时序感知Agent、长轨迹记忆Agent等模型方案的设计与实验,辅助验证Agent技术在长周期转化建模中的优化效果,助力突破传统CVR模型预估瓶颈;
- 3、算法方案设计与工程落地:依托海量搜索广告数据,协助团队完成算法方案调研、模型复现、实验验证、数据复盘等工作,参与模型训练、调优、特征工程等核心环节,配合保障模型在线服务的稳定性,适配国际化广告投放场景需求;
- 4、数据挖掘与效果迭代:协助拆解搜索广告转化漏斗,分析用户长程转化行为特征,挖掘有效特征与优化规律;配合团队完成A/B测试落地与效果分析,协助沉淀长程CVR建模、Agent智能优化相关技术总结与文档;
- 5、前沿技术调研与业务赋能:跟进大模型Agent、长时序建模、强化学习等前沿技术,聚焦广告转化场景的落地应用,协助整理技术调研成果、行业方案,助力团队CVR建模体系智能化升级。
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 算法 岗位的常见面试问题整理
请解释 Transformer 模型的自注意力机制(Self-Attention)
查看答题思路
1. Self-Attention = 序列中每个 token 与所有 token 计算相关性权重 2. Q=Wq·x, K=Wk·x, V=Wv·x; Attention(Q,K,V)=softmax(QK^T/√d_k)V 3. 除以 √d_k 防止点积过大导致 softmax 梯度消失 4. 多头注意力:多组 QKV 并行,拼接后线性变换,捕获不同子空间特征 5. 对比 RNN:可并行计算,捕获长距离依赖
你做过的最有深度的算法/模型项目是什么
查看答题思路
1. 一句话说清任务:分类/生成/检索/推荐 2. 模型选型:为什么选这个而非那个 3. 数据:数据量、来源、清洗策略 4. 创新点:你做的改进是什么(不是调参) 5. 结果:核心指标提升(准确率/召回/延迟)
过拟合是什么?怎么判断和解决
查看答题思路
1. 过拟合=训练集表现好、验证集表现差,模型记住了噪声 2. 判断:train loss 持续下降而 val loss 上升 3. 解决:更多数据 / 正则化(L1/L2) / Dropout / 早停 / 数据增强 / 降低模型复杂度
解释梯度下降的原理,SGD 和 Adam 的区别
查看答题思路
1. 梯度下降:沿负梯度方向更新参数,使损失降低 2. SGD:每次用随机小批量估算梯度,引入随机性帮助跳出局部最优 3. Adam = Momentum + RMSProp:自适应学习率 + 动量加速 4. Adam 收敛快但可能泛化不如 SGD;CV 常用 SGD,NLP 多用 Adam
给你 10 万条未标注的文本数据,如何找出其中 10 个主题
查看答题思路
1. 预处理:分词、去停用词 2. 向量化:TF-IDF 或 Sentence Embedding 3. 聚类:K-Means(需指定 K=10)或 HDBSCAN(自动确定类数) 4. 或 LDA 主题模型直接输出主题-词分布 5. 评估:看每个簇的高频词判断主题合理性,迭代调整
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。