← 返回岗位列表

腾讯

实习

语音/对话驱动数字人

上海 · 实习 · 不限

长期有效

任职要求

  • 基本素质:
  • 具备扎实的计算机科学、人工智能、计算机图形学或语音处理理论基础,拥有良好的跨学科技术视野与学术素养。在语音/对话驱动数字人领域,具备较强的独立科研能力与问题分析能力,能够围绕语音、文本、表情、动作与环境感知等多模态信息开展研究,探索数字人在真实交互场景下的情绪一致性、表达自然性与实时驱动问题。具备长期主义的科研精神,致力于将前沿模型与技术转化为具备实际应用价值的数字人原型与实验成果。
  • 技能要求:
  • 1、理论深度:在生成模型、多模态学习、计算机视觉、计算机图形学或语音技术方面具备扎实积累,熟悉 Transformer、Diffusion、时序建模、迁移学习等关键技术,并能够将其应用于语音/对话驱动数字人的核心任务中,如情绪一致性建模、音视频同步、表情与动作联合生成、长时序连续性优化等;
  • 2、工程与实验能力:具备较强的模型实现与实验推进能力,熟悉语音、视频与 3D 数字人相关的数据处理、训练与调试流程。了解或掌握SMPL-X标准骨骼、FLAME、blendshape、MetaHuman 等 3D 数字人表示与资产体系,并具备一定的实时推理优化、部署加速或端到端系统实现能力;
  • 3、学术成果:在 CVPR、SIGGRAPH、NeurIPS、ICML、ICLR、ACL、INTERSPEECH 等顶级会议发表过高质量论文者优先,研究方向聚焦于生成模型、多模态学习、语音交互、数字人等领域;在语音驱动生成、对话数字人、情绪建模、3D 人体/面部表示等相关方向有成果者优先。

岗位描述

【岗位职责】

课题背景:

随着大模型、语音生成、多模态建模与实时渲染技术的发展,语音/对话驱动数字人正成为智能交互、虚拟主播、游戏 NPC、数字员工等方向的重要技术基础。相比传统"会说话"的数字人,真实可用的系统不仅要完成口型同步,还需要在对话过程中保持身份稳定、情绪一致、表达自然、响应实时。本课题聚焦语音与数字人交叉方向,重点研究如何结合语音、文本、上下文与环境信息,驱动游戏数字人生成自然连贯的面部表情、口型、头部运动与肢体动作,提升数字人的真实感、陪伴感与交互能力。

课题挑战:

  • 1、角色身份一致性保持: 在长对话和多轮交互中,数字人容易出现表情习惯、动作风格、人格气质不稳定的问题,难以在情绪表达变化的同时持续保持"像这个角色在说话";
  • 2、语音—情绪—表情—动作的跨模态一致性: 现有方法往往只关注 lip-sync,容易出现"口型对了但情绪不对""语气强烈但表情平淡""声音和动作不同步"等跨模态冲突,缺乏覆盖语音韵律、面部表情、头部姿态、手势等多维度的统一情绪约束;
  • 3、长时序连续性与情绪自然过渡: 持续对话中数字人容易出现表情重复、动作僵硬、情绪漂移与状态跳变等问题,且真实情绪变化是连续渐变而非离散跳转,建模自然过渡比建模静态情绪困难得多;
  • 4、环境感知与上下文驱动不足: 数字人的表达应受场景、用户实时反馈与上下文语义的多层级影响,但目前系统在"感知—理解—表达"闭环上仍较弱,尚停留在被动回应而非主动感知;
  • 5、实时性与端到端效率挑战: 数字人应用要求低延迟、稳定输出与在线交互,但多模态生成与高保真渲染链路推理成本高,难以兼顾效果与实时性。

具体工作:

  • 1、多模态输入到数字人驱动的可控生成框架 融合语音、文本、上下文、环境信息与角色设定,建立统一的情绪条件表示;以 3D 数字人为主、兼顾 2D 视频数字人,研究从语音/对话到表情、口型、头部和肢体动作的联合生成,支持情绪强度、风格、视线等可控调节;
  • 2、情绪一致性与长时序连续性建模 研究跨模态情绪约束与信号传递机制,解决语音、文本、表情、动作之间的情绪冲突;通过时序模型和状态记忆机制提升多轮对话中的情绪连贯性与自然过渡,缓解情绪漂移问题;
  • 3、实时推理与端到端链路优化 面向在线交互场景,优化从语音输入到数字人输出的完整链路,涉及模型量化、推理加速、流式生成等,兼顾生成质量、响应延迟与系统稳定性。

【任职要求】

基本素质:

具备扎实的计算机科学、人工智能、计算机图形学或语音处理理论基础,拥有良好的跨学科技术视野与学术素养。在语音/对话驱动数字人领域,具备较强的独立科研能力与问题分析能力,能够围绕语音、文本、表情、动作与环境感知等多模态信息开展研究,探索数字人在真实交互场景下的情绪一致性、表达自然性与实时驱动问题。具备长期主义的科研精神,致力于将前沿模型与技术转化为具备实际应用价值的数字人原型与实验成果。

技能要求:

  • 1、理论深度:在生成模型、多模态学习、计算机视觉、计算机图形学或语音技术方面具备扎实积累,熟悉 Transformer、Diffusion、时序建模、迁移学习等关键技术,并能够将其应用于语音/对话驱动数字人的核心任务中,如情绪一致性建模、音视频同步、表情与动作联合生成、长时序连续性优化等;
  • 2、工程与实验能力:具备较强的模型实现与实验推进能力,熟悉语音、视频与 3D 数字人相关的数据处理、训练与调试流程。了解或掌握SMPL-X标准骨骼、FLAME、blendshape、MetaHuman 等 3D 数字人表示与资产体系,并具备一定的实时推理优化、部署加速或端到端系统实现能力;
  • 3、学术成果:在 CVPR、SIGGRAPH、NeurIPS、ICML、ICLR、ACL、INTERSPEECH 等顶级会议发表过高质量论文者优先,研究方向聚焦于生成模型、多模态学习、语音交互、数字人等领域;在语音驱动生成、对话数字人、情绪建模、3D 人体/面部表示等相关方向有成果者优先。

【技术方向】

多模态、视觉、语音

你的简历匹配这个岗位吗?

上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方

该岗位可能会问的问题

基于 运营 岗位的常见面试问题整理

我提到了电竞方面,另一个面试官就问我对于ig战队(lol)的看法,然后一道情景题:公司和ig方面有合作,怎样运营才能吸引ig粉丝使用我们产品

类型专业能力·难度中等·一面·咪咕动漫
查看答题思路

1. 电竞营销=粉丝经济,核心是社区运营而非传统广告 2. 跨界合作:战队/选手/IP 联名,借粉丝流量 3. 内容策略:比赛直播/选手日常/粉丝二创/社区活动 4. 案例:用 STAR 讲一个电竞相关的运营策划

另一个面试官看我的专业(偏设计)就问我愿不愿意做产品设计方向,让我发作品集 大概就这些 #咪咕#<a href="/creation/subject/928d551be73f40db82c0ed83286c8783" target="_blank" class="s

类型专业能力·难度中等·一面·咪咕动漫
查看答题思路

1. 核心概念:一句话说清这个问题的底层逻辑 2. 方法论/框架:用 STAR 原则或专业框架结构化回答 3. 实际案例:结合一个具体场景说明 4. 量化结果:用数据佐证你的观点

你认为内容运营需要具备哪些能力

类型专业能力·难度简单·一面·搜狐
查看答题思路

1. 内容运营=创作有价值的内容→分发到正确渠道→吸引目标用户→促成转化 2. 核心能力:选题能力(知道用户想看什么)、写作能力、数据分析能力(用数据迭代内容策略) 3. 生命周期:选题→创作→审核→发布→分发→数据回收→优化→二次传播 4. 优质内容标准:原创/有用/有趣/有共鸣/有行动引导

谈谈你理解的内容生命周期

类型动机/岗位认知·难度简单·一面·搜狐
查看答题思路

1. 真诚:为什么对这个方向感兴趣(具体经历/瞬间) 2. 匹配:你的能力和这个岗位的契合点 3. 成长:你希望从这个岗位学到什么 4. 贡献:你能为团队带来什么

自我介绍

类型动机/岗位认知·难度中等·一面·咪咕动漫
查看答题思路

1. 我是谁(姓名+学校+专业,15秒) 2. 我做过什么(最相关的 1-2 个经历,30秒) 3. 为什么适合这个岗位(能力匹配,15秒) 4. 总时长控制在 1 分钟以内 5. 避免:念简历、说「我学习能力强」这种空话

更多面试题库功能即将上线

信息来源:企业官方招聘页。投递前请以官网信息为准。