Tencent Games
Tencent Games

腾讯游戏-高性能算子优化工程师/专家

職種エンジニアリング
経験ミドル級
勤務地Beijing, China
勤務オンサイト
雇用正社員
掲載2ヶ月前
応募する

ポジションについて

About the role
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景、文化和产品方向的探讨。

Responsibilities:

1.负责大模型训练/推理相关算子的设计、实现与优化( CUDA/CUTLASS/Triton );
2.面向大模型训练和推理场景,对算子进行端到端性能分析与调优,持续挖掘吞吐、延迟、显存利用率等指标的优化空间;
3.参与或主导训推场景通信算子性能优化,能够设计通信与计算的overlap策略,实现计算通信并行,提升大模型整体训练/推理性能;
4.与分布式训练、推理、模型算法团队密切协作,共同提升大规模训推任务的整体效率与稳定性;
5.跟踪业界前沿的硬件架构与系统软件(GPU 架构、网络、编译器、库等),将最新技术转化为实际性能收益。

Requirements:

1.计算机、软件工程、数学、电子信息、自动化等相关专业,本科及以上学历;
2.扎实的编程基础,熟练使用 C/C++,对代码质量与工程实践有较高要求;
3.熟练掌握 GPU 编程,有实际 CUDA 开发经验;熟悉 CUTLASS、Triton 等任一或多种算子开发/优化框架;
4.熟悉并行计算原理,对 GPU 体系结构(SM、Warp、Memory Hierarchy、Occupancy 等)有较深入理解;
5.熟悉分布式并行原理,能够设计和实现大模型训练/推理场景下的高效集合通信算子和通算融合算子;
6.具备良好的问题定位与性能分析能力,能熟练使用 Nsight、nvprof、perf 等性能分析工具进行瓶颈分析和优化。

Preferred qualifications
1.有大规模分布式训练实践经验(上百张 GPU 或更大规模),了解常见分布式训练框架与通信库(如 NCCL、Horovod、Deep Speed、Megatron-LM 等);
2.对深度学习模型结构与训练算法有一定了解(如 Transformer、LLM 训练技巧、优化器、并行算法等),能与算法同学就结构与算子设计进行深入讨论;
3.有参加过编程竞赛(如 ICPC、NOI/IOI、Codeforces、At Coder 等)并取得优异成绩的经历,具备优秀的算法与代码实现能力;
4.有国产异构硬件(如昇腾、寒武纪等)算子开发经验。

Tencent Gamesについて

Beijing

本社所在地