BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / work-life / #1237071同步于 2026/4/7
该镜像源已超过 30 天没有更新,可能在源站已被删除。
WorkLife机器人发帖

阿里云内推 AI Infra暑期急招

zxy571745944
2026/4/7镜像同步0 回复
我们是阿里云政企事业部下的专有云IaaS网络团队。现面向偏通信侧的的AI Infra岗位的暑期实习招聘,急招,联系邮箱:zengxy571745944@163.com 邮箱的简历直接转到老板,有网络背景且对ai infra感兴趣的同学可直接冲,团队氛围非常好,公司能够提供给你学习和实践的平台,硕博均可 招聘岗位:AI Infra工程师 毕业起止时间要求:2026-11-01-2027-10-31 要求:硕士 职位描述 在这里,你将成为大模型技术落地的“幕后推手”。你将参与构建支撑千卡/万卡规模的 AI 计算基础设施,通过软硬件协同优化,解决大模型在训练、推理、调度全链路中的工程挑战。你的代码将直接决定大模型训练的效率、推理的响应速度以及集群资源的利用率,为 AI 时代的算力底座注入核心动力。 具体的职责包括以下相关方向的一项或多项: 1. 算力基建与分布式训练: ● 深入分布式训练架构,优化通信与底层算子性能,解决大规模集群通信瓶颈,提升模型训练的吞吐量与计算效率。参与研究新的训练框架和模式。 极致推理加速: ● 针对大规模推理场景,研发高性能推理引擎,通过kernel、框架、与算法结合的有损优化等手段,实现极致的低延迟与高并发。 2. 智能化资源调度与系统: ● 构建大规模 GPU 集群的统一调度与编排系统,实现算力资源的弹性分配与自动化调度,设计与优化面向 AI 计算场景的高性能通信、存储系统,保障海量任务的极致的效率。 3. 工程效率与平台化建设: ● 打造一体化的平台,覆盖大模型研发和迭代的全流程,降低模型迭代门槛,提升研发效能。 职位要求 1. 基础条件: ● 计算机、软件工程等相关专业优先。 ● 热衷于数据结构和算法、在ACM大赛成绩优异者优先;有顶会论文/高影响项目/开源贡献者加分。 2. 专业能力: ● 系统工程与编程能力:具备良好的系统工程基础,熟悉 Linux 开发环境,掌握 Python、Go、Java 等至少一门编程语言,具备扎实的工程实现能力。 ● 分布式系统:了解分布式系统基本原理(如一致性、容错、扩展性等)。 ● AI 系统领域专业知识:对于以下领域中的一项或者多项具备专业能力 ○ 了解 AI 的基本原理与常见算法,理解模型训练任务的基本流程及其资源需求。 ○ 了解主流训练推理框架(如 PyTorch、TensorFlow、vLLM、sglang)的基本使用方式及训练流程。 ○ 了解异构计算或高性能计算体系,有 GPU 相关优化经验者优先。 3. 能力特质: ● 沟通能力:能与跨域岗位,如:算法、产品等,进行良好的沟通。 ● 跨域视野:有较宽的技术视野与知识面,对算法研发流程、数据、GPU调度、训练、推理等相关领域的技术逻辑都有涉猎。 ● 系统思维: 乐于挑战复杂系统的性能极限,具备良好的性能分析与调优能力,喜欢从底层视角拆解并解决问题。 ● 极客精神:对 AI 大模型技术充满热情,具备快速学习新技术的能力,渴望在高性能计算领域实现技术突破。 招聘岗位:面向训推一体与特定硬件无关的通信优化-A Star 基础信息 毕业起止时间要求 2026-11-01 - 2027-10-31 职位类别 技术类 招聘项目 阿里巴巴2027届实习生 职位描述 1、技术方案设计: *深入调研业界前沿的应用层多路径传输技术相关优化方案,分析其优缺点与适用场景; *结合业务需求与技术现状,识别网络传输瓶颈,提出创新的优化方向与具体技术方案; 2、技术实现: *负责将技术方案拆解为具体可实施的技术点,进行可行性分析,制定详细的任务目标、技术规范与验收标准; *主导技术原型的关键模块设计、编码实现及系统功能验证,快速迭代以验证核心思想; *基于原型验证结果,持续进行性能优化,完成产品化落地,确保方案的健壮性、可维护性和可扩展性; *支持产品的规模化落地,基于实践进一步优化迭代产品能力; 3、稳定性和性能优化: * 制定并实施系统稳定性保障策略。通过深入分析潜在的稳定性风险点,在系统架构设计和代码实现层面,构建高可用能力; *在规模化部署的实际业务场景中,进行端到端的性能分析,设计并实施针对性的优化措施,持续提升在高负载环境下的性能表现; 4、有一定学术能力,能跟踪最新研究进展。 加分项:发表过相关的高水平论文,比如CCF-A类会议,CNS以及子刊等。 职位要求 1. 教育背景 * 计算机科学、人工智能、机器学习、数据科学等相关专业博士; 2. 技术能力 * 熟悉RDMA相关协议及多路径传输相关技术; * 熟悉推理框架(如TensorFlow、PyTorch、PaddlePaddle)及其优化方法,有图优化经验者优先; * 了解高性能网络前沿技术方向(多路径传输优化、计算通信overlap、量化感知推理等); 3. 编程能力 * 熟练掌握Python/C++/Go等编程语言,有高性能计算经验者优先; 4. 经验要求 * 有大模型推理优化经验者优先,熟悉政企客户业务场景者加分; * 具备独立分析和解决问题的能力,能够快速学习新技术并应用到实际工作中; 5. 其他要求 * 具备良好的沟通能力和团队合作精神,能够与业务部门和技术团队高效协作; * 对人工智能技术有浓厚兴趣,具备较强的学习能力和技术钻研精神。
订阅后,新回复会通过你的通知中心匿名送达。
0 条回复
暂无回复 · 你可以订阅本帖等待新回复。