latchhire

Head of Machine Learning Infrastructure

AXQ Capital · Beijing; Shanghai
lead machine learning
Apply on AXQ Capital →
关于我们 安贤投资 ( AXQ Capital ) 致力于以严谨的量化研究与先进的信息技术驱动投资。我们打造科学高效的量化研究框架,构建 多市场多策略 投资体系。策略布局覆盖全球股票统计套利、 A 股指数增强、 CTA 、股票日内、期货高频等领域,在全球市场部署运行,覆盖多个地区、资产类别及交易周期。自 2018 年成立以来,安贤持续为海内外投资者创造长期稳健的投资回报,资产管理规模稳步增长。公司在 北京、上海、香港、纽约 设有办公室,为国内员工提供海外交流与培训机会。 岗位使命 作为 Head of Machine Learning Infrastructure ,你将向 CTO 汇报,负责公司面向机器学习和量化研究的核心计算与平台基础设施,包括 GPU/CPU 集群、分布式训练、研究计算平台、机器学习平台及开发者工具 。 核心目标是打造一套能够支撑 大规模特征工程与机器学习训练 的基础设施体系,支持 PB 级数据处理能力 ,并能够高效利用 数十 TB 级别训练数据进行模型训练与实验迭代 。系统需具备高性能、可扩展、可复现、易使用且成本高效的特性,持续提升研究与工程效率。 主要职责 负责机器学习基础设施团队建设、技术规划和项目推进,制定中长期平台路线。 建设和优化 GPU/CPU 集群、任务调度和分布式计算平台,支持大规模模型训练、特征计算和量化研究。 构建支持 PB 级数据规模的特征工程与数据处理平台 ,提升海量数据的计算、存储与访问效率。 支持基于 数十 TB 级训练数据 的分布式训练与实验体系,优化数据加载、并行训练与资源调度效率。 建设统一的机器学习平台,包括开发环境、实验管理、模型版本、依赖管理和模型部署流程。 优化训练与研究场景下的存储、网络、数据管道和计算性能,提高 GPU/CPU 资源利用率并控制基础设施成本。 建设模型训练、批量/在线推理及相关生产基础设施,提升模型从研究到生产的效率和可靠性。 持续优化开发者工具和研究工作流,提升大规模数据与模型实验的迭代效率。 建设平台监控、容量规划、权限、安全和自动化体系,保障大规模系统的稳定性与可维护性。 岗位要求 8 年以上机器学习基础设施、分布式系统、平台工程、高性能计算或云基础设施相关经验。 有基础设施或平台团队管理经验,以及复杂系统架构和落地能力。 扎实的 Linux、网络、存储、分布式系统和容器技术基础。 熟悉 GPU 计算、分布式训练和大规模机器学习工作负载,对任务调度、数据 I/O、特征工程和系统性能优化有实践经验。 熟悉 Python、Go、C++、Rust、Java 等至少一门编程语言。 熟悉 Kubernetes、Docker、CI/CD、Infrastructure as Code、监控和云计算基础设施。 具备较强的平台产品意识,能够深入理解量化研究员、机器学习研究员和工程师在大规模数据与模型训练场景下的需求。 加分项 有量化投资、对冲基金、机器学习平台或大规模研究计算平台经验。 有 GPU 集群、分布式训练或 HPC 平台建设经验。 熟悉 PyTorch Distributed、Ray、Slurm、NCCL、CUDA、RDMA 等技术。 有大规模特征工程平台、数据管道系统或 PB 级数据处理经验。 有 AWS、GCP、阿里云、腾讯云等云平台的 GPU 资源和成本优化经验。 熟悉 Claude Code、Codex、Cursor 等 AI coding tools,并有推动其团队化应用的经验。
Posted 2026-08-21