字节跳动
实习【实习】Agentic RL For Long Horizon Task-剪映数据与智能团队
深圳 · 实习 · 2027 届 · 博士
长期有效
任职要求
- 2027届及以后毕业,博士在读,人工智能、计算机科学、数学相关专业优先
- 技术能力:
- 1)具备出色的编程能力,精通Python/C++,熟悉TensorFlow/PyTorch等框架,有自然语言处理(NLP)、计算机视觉(CV)或多模态生成模型(如CLIP、Diffusion Models)项目经验
- 2)熟悉AIGC工具链(LangChain、AutoGPT)者优先
- 3)熟悉大模型理论知识和应用,熟悉常见大模型架构,理解实际业务场景Agent设计理念;有实际大模型预训练、微调或推理优化经验者优先
- 学术与实践经验:
- 1)在ACL/CVPR/SIGIR/KDD/NeurIPS/ICCV等顶会发表过AIGC、LLM等相关论文者优先
- 2)了解LLM架构,熟悉Multi-Agent技术、Prompt/Context Engineering工程技术,有AI Agent应用经验、AIGC实操经验的优先
- 3)热爱视频剪辑,对常用视频剪辑工具有使用经验者优先。
岗位描述
团队介绍:剪映数据与智能团队旨在通过 AI 技术赋能剪映系产品,构建强大的算法能力壁垒。作为剪映系内的算法团队,负责推动整个业务在算法上的迭代与创新,为剪映、CapCut、即梦dreamina、Pippit、醒图等产品提供智能化支持。
课题介绍:
Seedance2.0发布后,创作Agent进入深水区,无论是漫剧/短剧/视频/图片都有新的飞跃,为了快速满足用户高质量的创作需求,尤其是超过15s的成片,需要一个涉及多轮Function Call的创作Agent去完成,涉及大量工具的调用,包括不限于意图,分镜,创意,故事性,故事版等。我们打造基于Agentic RL的Agent赋能业务。
Agentic RL在训练 Long-Horizon Tasks有一系列核心难点,本质上比传统RL更复杂,“Agent”不仅要行动,还要规划、分解任务、记忆上下文。
具体难点:
- 1、Sparse Rewards;
- 2、Credit Assignment;
- 3、Planning & Decomposition;
- 4、Huge State Space;
- 5、Memory;
- 6、Exploration;
- 7、Optimization Difficulty;
- 8、复杂的Agent交互环境
我们需要解决Agentic RL在多轮Function Call,多个Tools和Skills下的长任务训练问题。
课题挑战:
- 1、Sparse Rewards
a、稀疏奖励,如何设计合理的奖励
- 2、Credit Assignment
a、如何解决信用分配问题
- 3、Planning & Decomposition
a、如何拆解子目标
b、子目标的合理性
- 4、复杂的Agent交互环境
a、特别长的上下文
b、很多的Tools or Skills
- 5、训练的稳定性
a、同步、异步RL
b、Rollout效率
课题价值:
技术价值:
Agentic RL在Long Horizon Task是业内公认的难题,是处理复杂任务,Agent任务必须要攻克的难题,是提升大模型Agent效果上限的关键难题。
业务价值:
- 1、Long Horizon Task的解决会极大提升剪映各创作agent在处理长任务时的效果,使自研模型对比基座取得行业SOTA;
- 2、该技术的突破,可以落地更多更复杂的业务场景,尤其对目前的Sandbox Skill等架构有天然的适配。
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 算法 岗位的常见面试问题整理
请解释 Transformer 模型的自注意力机制(Self-Attention)
查看答题思路
1. Self-Attention = 序列中每个 token 与所有 token 计算相关性权重 2. Q=Wq·x, K=Wk·x, V=Wv·x; Attention(Q,K,V)=softmax(QK^T/√d_k)V 3. 除以 √d_k 防止点积过大导致 softmax 梯度消失 4. 多头注意力:多组 QKV 并行,拼接后线性变换,捕获不同子空间特征 5. 对比 RNN:可并行计算,捕获长距离依赖
你做过的最有深度的算法/模型项目是什么
查看答题思路
1. 一句话说清任务:分类/生成/检索/推荐 2. 模型选型:为什么选这个而非那个 3. 数据:数据量、来源、清洗策略 4. 创新点:你做的改进是什么(不是调参) 5. 结果:核心指标提升(准确率/召回/延迟)
过拟合是什么?怎么判断和解决
查看答题思路
1. 过拟合=训练集表现好、验证集表现差,模型记住了噪声 2. 判断:train loss 持续下降而 val loss 上升 3. 解决:更多数据 / 正则化(L1/L2) / Dropout / 早停 / 数据增强 / 降低模型复杂度
解释梯度下降的原理,SGD 和 Adam 的区别
查看答题思路
1. 梯度下降:沿负梯度方向更新参数,使损失降低 2. SGD:每次用随机小批量估算梯度,引入随机性帮助跳出局部最优 3. Adam = Momentum + RMSProp:自适应学习率 + 动量加速 4. Adam 收敛快但可能泛化不如 SGD;CV 常用 SGD,NLP 多用 Adam
给你 10 万条未标注的文本数据,如何找出其中 10 个主题
查看答题思路
1. 预处理:分词、去停用词 2. 向量化:TF-IDF 或 Sentence Embedding 3. 聚类:K-Means(需指定 K=10)或 HDBSCAN(自动确定类数) 4. 或 LDA 主题模型直接输出主题-词分布 5. 评估:看每个簇的高频词判断主题合理性,迭代调整
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。