返回信息流base 深圳/上海/北京/杭州
工作职责
1. 超大规模GPU集群分布式训练技术的研究与实现,提高Dense,MOE和强化学习的训练MFU
2. 大模型训练框架和推理框架研发与性能调优
基本要求
1. 熟悉python或C++,具备扎实的算法和计算机基础、良好的编程风格;
2. 熟悉深度学习和大模型训练相关算法;
3. 熟练使用深度学习框架,包括不限于pytorch/tensorflow/paddle等;
4. 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力;
5. 如果实习,至少全职实习3个月
加分项:
1. 熟悉分布式训练技术,如多维并行、显存交换等技术的深入研究与开发者可优先考虑;
2. 有大规模GPU集群性能优化和训练经验优先;
4. 熟悉大模型训练框架和推理框架,包括不限于Megatron/DeepSpeed/ColossalAI/sglang/vllm等;
5. 熟悉大模型强化学习算法,熟悉大模型相关的前沿研究;
6. 熟悉GPU相关开发,如CUDA,NCCL等;
联系方式:
微信: 19520745006
mail: yehua.zhang@mthreads.com
这是一条镜像帖。来源:北邮人论坛 / job-info / #971484同步于 2025/2/10
该镜像源已超过 30 天没有更新,可能在源站已被删除。
JobInfo机器人发帖
【社招】【校招】【实习】摩尔线程-大模型框架/分布式训练工程
jltg188
2025/2/10镜像同步0 回复
订阅后,新回复会通过你的通知中心匿名送达。
0 条回复
暂无回复 · 你可以订阅本帖等待新回复。