腾讯
校招腾讯视频-多模态视频实时生成研究
北京 · 校招 · 2027 届 · 本科
长期有效
任职要求
- 1、具备较强的学习能力、清晰的逻辑思维能力和出色的沟通能力,有强烈的好奇心;
- 2、具有扎实的计算机视觉和机器学习算法基础,有图像、音视频生成和编辑方向顶级论文者优先;
- 3、具有蒸馏,实时视频生成,自回归生成等研究经验优先。
- 此课题同时招聘应届实习生和低年级实习生。
岗位描述
【岗位职责】
课题背景:
随着生成模型的发展,多模态视频实时生成已成为下一阶段视频大模型落地的关键方向。在直播、虚拟人、AI短片创作、实时特效、互动娱乐等场景中,实时性已成为制约其落地应用的关键瓶颈。本课题聚焦于多模态视频实时生成技术,旨在突破视频生成的实时性与生成质量之间的平衡瓶颈。
课题挑战:
多模态视频实时生成的核心挑战在于:一是如何在保证画面质量、语义一致性和时序连贯性的前提下,大幅降低生成延迟与推理成本;二是如何设计适配实时场景的模型架构与生成机制,实现文本、图像、音频、动作等多模态条件的高效融合;三是如何解决长时序流式生成中的误差累积、内容漂移和身份/场景一致性问题,从而支持稳定、可控、连续的视频输出。
具体工作:
研究方向包括:
- 1、高效实时视频生成推理架构: 研究并设计多模态视频生成模型结构,结合模型蒸馏、量化、缓存处理等技术,在保证生成质量的前提下大幅降低推理延迟;
- 2、多模态实时信息融合: 构建文本、图像、语音等多模态信息的实时编码与融合机制,支持实时交互式内容创作;
- 3、细粒度控制与时空一致性建模:提升实时视频生成中的细粒度控制与时空一致性建模能力,实现对人物、动作、镜头和场景的稳定控制。 通过本课题的研究,实现B端和C端的实时视频生成体验质量的跃升,推动多模态视频生成技术从“离线创作”向“实时交互”的跨越。
【任职要求】
- 1、具备较强的学习能力、清晰的逻辑思维能力和出色的沟通能力,有强烈的好奇心;
- 2、具有扎实的计算机视觉和机器学习算法基础,有图像、音视频生成和编辑方向顶级论文者优先;
- 3、具有蒸馏,实时视频生成,自回归生成等研究经验优先。
【加分项】
此课题同时招聘应届实习生和低年级实习生。
【技术方向】
多模态、视觉、语音
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 运营 岗位的常见面试问题整理
我提到了电竞方面,另一个面试官就问我对于ig战队(lol)的看法,然后一道情景题:公司和ig方面有合作,怎样运营才能吸引ig粉丝使用我们产品
查看答题思路
1. 电竞营销=粉丝经济,核心是社区运营而非传统广告 2. 跨界合作:战队/选手/IP 联名,借粉丝流量 3. 内容策略:比赛直播/选手日常/粉丝二创/社区活动 4. 案例:用 STAR 讲一个电竞相关的运营策划
另一个面试官看我的专业(偏设计)就问我愿不愿意做产品设计方向,让我发作品集 大概就这些 #咪咕#<a href="/creation/subject/928d551be73f40db82c0ed83286c8783" target="_blank" class="s
查看答题思路
1. 核心概念:一句话说清这个问题的底层逻辑 2. 方法论/框架:用 STAR 原则或专业框架结构化回答 3. 实际案例:结合一个具体场景说明 4. 量化结果:用数据佐证你的观点
你认为内容运营需要具备哪些能力
查看答题思路
1. 内容运营=创作有价值的内容→分发到正确渠道→吸引目标用户→促成转化 2. 核心能力:选题能力(知道用户想看什么)、写作能力、数据分析能力(用数据迭代内容策略) 3. 生命周期:选题→创作→审核→发布→分发→数据回收→优化→二次传播 4. 优质内容标准:原创/有用/有趣/有共鸣/有行动引导
谈谈你理解的内容生命周期
查看答题思路
1. 真诚:为什么对这个方向感兴趣(具体经历/瞬间) 2. 匹配:你的能力和这个岗位的契合点 3. 成长:你希望从这个岗位学到什么 4. 贡献:你能为团队带来什么
自我介绍
查看答题思路
1. 我是谁(姓名+学校+专业,15秒) 2. 我做过什么(最相关的 1-2 个经历,30秒) 3. 为什么适合这个岗位(能力匹配,15秒) 4. 总时长控制在 1 分钟以内 5. 避免:念简历、说「我学习能力强」这种空话
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。