腾讯
校招混元基座模型-原生 VLM 预训练
北京 · 校招 · 2027 届 · 硕士
长期有效
任职要求
- 学历和专业要求:
- 自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士以上学历;
- 技术技能要求:
- 1,相信 Scaling Law,认可数据、算力与模型规模化带来的长期价值,善于通过系统实验验证规律;
- 2,具备较强的工程能力,能够搭建高效、稳定、可复现的数据与训练链路,并持续优化工具和研发效率;
- 3,兼具研究探索能力与落地意识,能够独立推进方案设计、工程实现和生产级模型验证;
- 软性素质要求:
- 对数据和指标高度敏感,认真严谨,能够从细微异常中发现问题并追溯根因。
岗位描述
【岗位职责】
课题背景
原生 VLM 需要从预训练阶段统一学习文本、图像、文档、图表和视频等多模态知识,并在中期训练阶段进一步强化视觉理解、跨模态推理和任务执行能力。
当前,多模态预训练数据普遍存在质量低、图文错配和长尾知识不足等问题;文档、图表、空间推理、GUI、Agent 等高质量能力数据又较为稀缺。如何打通多模态数据清洗、科学配比、高质量合成和动态调度链路,是提升 VLM 能力上限的关键。
课题挑战
多模态数据质量参差: 在 PB 级数据中高效识别低质、重复和错配样本,同时保留高价值长尾知识。
多领域训练相互干扰: 视觉、语言及不同任务领域学习规律差异较大,混合训练容易出现能力退化和负迁移,如何在保证文本能力的前提下追求视觉能力的极致优化。
高质量能力数据稀缺: 合成数据容易模板化、难度不足和错误累积,缺乏高效可靠的质量评估与调度指标。
具体工作
负责图像、网页、文档、图表和视频等多模态数据的挖掘、清洗、筛选与质量评估;
探索原生 VLM 预训练及中期训练的数据配比、训练目标和阶段衔接策略;
负责 OCR、文档、图表、空间推理、GUI、Agent 等领域数据的挖掘与高质量合成;
设计多领域数据动态调度策略,并在生产级模型上验证训练效果。
【任职要求】
学历和专业要求:
自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士以上学历;
技术技能要求:
1,相信 Scaling Law,认可数据、算力与模型规模化带来的长期价值,善于通过系统实验验证规律;
2,具备较强的工程能力,能够搭建高效、稳定、可复现的数据与训练链路,并持续优化工具和研发效率;
3,兼具研究探索能力与落地意识,能够独立推进方案设计、工程实现和生产级模型验证;
软性素质要求:
对数据和指标高度敏感,认真严谨,能够从细微异常中发现问题并追溯根因。
【技术方向】
多模态、视觉、语音
你的简历匹配这个岗位吗?
上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方
该岗位可能会问的问题
基于 运营 岗位的常见面试问题整理
我提到了电竞方面,另一个面试官就问我对于ig战队(lol)的看法,然后一道情景题:公司和ig方面有合作,怎样运营才能吸引ig粉丝使用我们产品
查看答题思路
1. 电竞营销=粉丝经济,核心是社区运营而非传统广告 2. 跨界合作:战队/选手/IP 联名,借粉丝流量 3. 内容策略:比赛直播/选手日常/粉丝二创/社区活动 4. 案例:用 STAR 讲一个电竞相关的运营策划
另一个面试官看我的专业(偏设计)就问我愿不愿意做产品设计方向,让我发作品集 大概就这些 #咪咕#<a href="/creation/subject/928d551be73f40db82c0ed83286c8783" target="_blank" class="s
查看答题思路
1. 核心概念:一句话说清这个问题的底层逻辑 2. 方法论/框架:用 STAR 原则或专业框架结构化回答 3. 实际案例:结合一个具体场景说明 4. 量化结果:用数据佐证你的观点
你认为内容运营需要具备哪些能力
查看答题思路
1. 内容运营=创作有价值的内容→分发到正确渠道→吸引目标用户→促成转化 2. 核心能力:选题能力(知道用户想看什么)、写作能力、数据分析能力(用数据迭代内容策略) 3. 生命周期:选题→创作→审核→发布→分发→数据回收→优化→二次传播 4. 优质内容标准:原创/有用/有趣/有共鸣/有行动引导
谈谈你理解的内容生命周期
查看答题思路
1. 真诚:为什么对这个方向感兴趣(具体经历/瞬间) 2. 匹配:你的能力和这个岗位的契合点 3. 成长:你希望从这个岗位学到什么 4. 贡献:你能为团队带来什么
自我介绍
查看答题思路
1. 我是谁(姓名+学校+专业,15秒) 2. 我做过什么(最相关的 1-2 个经历,30秒) 3. 为什么适合这个岗位(能力匹配,15秒) 4. 总时长控制在 1 分钟以内 5. 避免:念简历、说「我学习能力强」这种空话
更多面试题库功能即将上线
信息来源:企业官方招聘页。投递前请以官网信息为准。