BBYR Achieve
返回信息流
这是一条镜像帖。来源:北邮人论坛 / parttime-job / #986417同步于 2026/4/14
该镜像源已超过 30 天没有更新,可能在源站已被删除。
ParttimeJob机器人发帖

【实习】【阿里】招募AI Infra工程师-存储方向

c020313
2026/4/14镜像同步0 回复
实习岗位名称: AI Infra工程师-存储方向 所需人数: 招募公司: 阿里 所属部门组: 2027年阿里云服务器存储固件开发实习生招聘 联系方式: 15797752337 答复时间(如每日8点答复email等): 工作地点: 交通情况(北邮为出发点,包括公交,地铁,达到时间): 任职资格 -- 基本条件: 毕业起止时间要求 2026-11-01 - 2027-10-31 1. 基础条件: ● 计算机、软件工程及相关专业。 ● 热衷于数据结构和算法,在 ACM/ICPC 等大赛中成绩优异者优先。 ● 在分布式系统、存储或操作系统领域顶会(如 FAST, OSDI, SOSP, SIGCOMM, NSDI 等)发表过一作论文,或在核心开源存储项目中有重大贡献(Maintainer/Committer)者优先考虑。 2. 专业能力(系统工程与分布式底座): ● 系统编程功底:精通 C/C++ 或 Go/Rust,具备扎实的系统级编程能力。熟悉 Linux 内核(VFS, Block Layer, Memory Management)及高性能网络开发(Socket, RDMA, DPDK/SPDK),具备极强的底层工程实现与缺陷排查能力。 ● 分布式系统:深刻理解分布式系统理论(如 Paxos/Raft 一致性协议、分布式锁、纠删码 EC、数据分片与副本管理、分布式事务)。具备大规模分布式存储(如 HDFS, Pangu)的研发或深度调优经验。 3. AI 存储领域专业知识(满足其一即可): ● 深入理解 AI 训练与推理的 I/O 模式,熟练掌握底层数据加载机制(如 PyTorch Dataloader),熟悉 Megatron-LM, DeepSpeed, Ray, vLLM 等主流分布式训练/推理框架的存储诉求。 ● 熟悉高性能存储协议及硬件架构,有 NVMe-oF, PCIe, CXL, GPUDirect Storage (GDS) 相关驱动开发与性能压测经验。 ● 深刻理解云原生架构,有大规模 Kubernetes 集群下的存储 CSI、数据缓存编排调优经验。 4. 能力特质: ● 全局技术视野:具备跨域的技术视野,能从“GPU 寄存器 -> HBM 显存 -> PCIe 总线 -> eRDMA 网卡 -> 分布式磁盘”的全链路视角拆解数据流动,准确把握计算、网络与存储的边界权衡。 ● 系统思维与极致追求:乐于挑战复杂系统的性能极限,熟练使用各种 Profiling & Tracing 工具(如 eBPF, perf, ftrace, Nsight Systems),善于从 CPU 缓存未命中、上下文切换、锁竞争等微观视角定位并解决性能瓶颈。 ● 业务驱动与沟通协作:对 AI 大模型技术充满热情,不仅能交付高质量的系统级代码,更能与算法科学家、模型训练专家进行深度技术对话,将模型侧的痛点精准转化为底层存储的工程解法。AI Infra工程师-存储方向 任职资格 -- 优先条件: 2. 专业能力(系统工程与分布式底座): ● 系统编程功底:精通 C/C++ 或 Go/Rust,具备扎实的系统级编程能力。熟悉 Linux 内核(VFS, Block Layer, Memory Management)及高性能网络开发(Socket, RDMA, DPDK/SPDK),具备极强的底层工程实现与缺陷排查能力。 ● 分布式系统:深刻理解分布式系统理论(如 Paxos/Raft 一致性协议、分布式锁、纠删码 EC、数据分片与副本管理、分布式事务)。具备大规模分布式存储(如 HDFS, Pangu)的研发或深度调优经验。 3. AI 存储领域专业知识(满足其一即可): ● 深入理解 AI 训练与推理的 I/O 模式,熟练掌握底层数据加载机制(如 PyTorch Dataloader),熟悉 Megatron-LM, DeepSpeed, Ray, vLLM 等主流分布式训练/推理框架的存储诉求。 ● 熟悉高性能存储协议及硬件架构,有 NVMe-oF, PCIe, CXL, GPUDirect Storage (GDS) 相关驱动开发与性能压测经验。 ● 深刻理解云原生架构,有大规模 Kubernetes 集群下的存储 CSI、数据缓存编排调优经验。 4. 能力特质: ● 全局技术视野:具备跨域的技术视野,能从“GPU 寄存器 -> HBM 显存 -> PCIe 总线 -> eRDMA 网卡 -> 分布式磁盘”的全链路视角拆解数据流动,准确把握计算、网络与存储的边界权衡。 ● 系统思维与极致追求:乐于挑战复杂系统的性能极限,熟练使用各种 Profiling & Tracing 工具(如 eBPF, perf, ftrace, Nsight Systems),善于从 CPU 缓存未命中、上下文切换、锁竞争等微观视角定位并解决性能瓶颈。 ● 业务驱动与沟通协作:对 AI 大模型技术充满热情,不仅能交付高质量的系统级代码,更能与算法科学家、模型训练专家进行深度技术对话,将模型侧的痛点精准转化为底层存储的工程解法。AI Infra工程师-存储方向 工资情况: 实习时间(包括实习期的长度,每日实习的时间): 福利情况(包括是否包吃住等): 工作职责: 在这里,你将成为大模型时代算力底座的“核心引擎构造者”。依托阿里自研分布式存储系统与业界领先的计算网络架构,你将参与构建支撑千卡/万卡乃至十万卡规模的 AI 计算基础设施。 我们致力于通过软硬件协同优化、存算分离架构创新,解决大模型在预训练、微调、推理全链路中的极致工程挑战。你的代码将直接运行在阿里核心的 AI 存储产品中,决定千万级并发的数据加载吞吐、秒级 Checkpoint 的可靠性以及庞大 GPU 集群的 MFU(模型算力利用率)。加入我们,为全球顶尖 AI 模型注入最澎湃的数据动力! 职业资料(这里介绍职业的相关资料,如前景等): 补充:
订阅后,新回复会通过你的通知中心匿名送达。
0 条回复
暂无回复 · 你可以订阅本帖等待新回复。