陇南项目运维工程师
项目运维工程师是负责项目的运营和维护的专业人员。他们负责确保项目的稳定运行,包括监控系统状态、处理日常的技术问题、及时修复系统故障、优化系统性能、升级软件版本等。他们还负责制定和执行项目的运维策略,确保项目的安全性和可靠性。同时,他们与开发团队紧密合作,提供技术支持和解决方案,以满足项目的需求。项目运维工程师需要具备扎实的技术背景和问题解决能力,熟悉常见的运维工具和技术,对系统和网络有深入的理解,能够快速响应和解决各类技术问题,保证项目的持续稳定运行。
薪酬概览
平均月薪
¥10600
中位数 ¥0 | 区间 ¥8200 - ¥13000
数据来源:样本数量过少,仅供参考;更新时间:2026年7月13日
月薪分布
80% 人群薪酬落在 8-15k

三大影响薪酬的核心维度
影响薪资的核心维度1:工作年限
影响薪资的核心维度2:学历背景
市场需求
8月新增岗位
15
对比上月:岗位新增7
数据由各大平台公开数据统计分析而来,仅供参考。
岗位需求趋势
不同经验岗位需求情况
| 工作年限 | 月度新增职位数 | 职位占比数 |
|---|---|---|
| 1-3年 | 7 | 43.8% |
| 3-5年 | 3 | 18.8% |
| 5-10年 | 3 | 18.8% |
| 不限经验 | 3 | 18.8% |
热招职位
岗位核心价值
负责公司大算力 AI 集群(含 B/H 系列高端卡、国产算力卡)的架构设计、搭建部署、运维优化与国产化适配,支撑大模型训练、自动驾驶等核心业务的高效稳定运行,打造高可用、高性价比的算力基础设施。
核心工作职责
1. 大算力集群自建与架构设计:主导超大规模 AI 算力集群(数千 P 级)的自建规划,包括硬件选型(GPU/B/H 系列卡、国产卡等)、网络拓扑设计(InfiniBand/ROCE)、存储架构(分布式存储)、集群调度系统搭建,确保集群性能达标、扩展性强。
2. 高端 GPU 加速与优化:具备 NVIDIA B 系列、H 系列高端算力卡的实战经验,负责卡级性能调优、并行计算加速(TensorRT/MPI/NCCL)、显存优化,解决大模型训练 / 推理中的算力瓶颈问题。
3. 国产算力卡适配落地:主导国产算力卡(阿里PPU、华为昇腾等)的适配工作,包括驱动安装、框架适配(TensorFlow/PyTorch/MindSpore)、模型迁移与性能调优,实现国产算力与业务场景的深度融合。
4. 集群运维与稳定性保障:负责算力集群的日常运维,包括硬件故障排查、集群监控告警(GPU / 网络 / 存储状态)、资源调度优化、灾备方案设计,保障集群全年高可用性(99.9% 以上)。
5. 技术沉淀与迭代:跟进业界大算力集群技术趋势(如新型 GPU、网络协议、调度系统),输出技术方案与最佳实践;搭建集群运维自动化工具,提升运维效率。
1、对部署效率负责,对相关工具的建设负责,实现多产品组合一键部署,无人值守安装,落地基于不可变基础设施的部署方案;
2、负责运维体系建设,包括可观测性体系,北极星指标体系,CMDB,工单系统,作业平台等;
3、参与制定SRE相关的规范和流程,并负责推广落地;
4、负责SRE团队技能建设,团队技术分享、团队技术选型、团队技术培训等;
5、作为团队技术专家,负责解决重大疑难问题,团队知识库建设,故障复盘,常见问题沉淀,预案体系建设,混沌工程建设。
1. 协助运维人员进行服务器、网络设备、存储设备等设备的日常运维工作,并及时处理出现的问题;
2. 协助运维人员编写文档,记录相应的操作流程、日常工作和服务器的维护情况等;
3. 参与服务器应用的安装、维护和升级工作,通过对生产环境进行技术测试和排查异常,为公司IT系统的稳定运行做好技术支持;
4. 参与公司IT系统的监控、数据备份等工作,及时处理并防止系统出现故障。
工作内容:
1、负责日常资源交付、变更、巡检、告警处置与故障恢复工作,沉淀输出标准化操作流程;
2、参与可观测体系、容量管理、混沌工程、流量调度等方向的平台与体系持续优化演进;
3、主导基于大语言模型(LLM)的运维智能体(AI Agent)、AI工作流方案设计,落地运维数字人、AI巡检、AI根因分析等AIOps业务场景。
任职资格:
1、本科及以上学历,拥有3年及以上AI开发或运维相关工作经验;
2、熟练掌握Python/Go至少一门编程语言者优先;
3、熟悉Linux操作系统,了解Kubernetes(K8s)基础概念;熟练使用Prometheus、DNS、CDN、CICD、Nginx等常用中间件与服务,具备传统运维故障排查、自动化脚本编写实操能力;
4、了解可观测、容量管理、高可用容灾架构、混沌工程、流量调度相关知识,拥有大规模集群稳定性保障实战经验优先;
5、熟悉LangChain、LangGraph、Dify等主流Agent开发框架,掌握MCP、技能插件(Skills)、Prompt&RAP、多智能体规划相关技术;
6、具备优秀的问题拆解、逻辑分析、跨团队沟通协作能力,学习主动性强、自驱力突出。
工作内容:
1、负责日常资源交付、变更、巡检、告警处置与故障恢复工作,沉淀输出标准化操作流程;
2、参与可观测体系、容量管理、混沌工程、流量调度等方向的平台与体系持续优化演进;
3、主导基于大语言模型(LLM)的运维智能体(AI Agent)、AI工作流方案设计,落地运维数字人、AI巡检、AI根因分析等AIOps业务场景。
任职资格:
1、本科及以上学历,拥有3年及以上AI开发或运维相关工作经验;
2、熟练掌握Python/Go至少一门编程语言者优先;
3、熟悉Linux操作系统,了解Kubernetes(K8s)基础概念;熟练使用Prometheus、DNS、CDN、CICD、Nginx等常用中间件与服务,具备传统运维故障排查、自动化脚本编写实操能力;
4、了解可观测、容量管理、高可用容灾架构、混沌工程、流量调度相关知识,拥有大规模集群稳定性保障实战经验优先;
5、熟悉LangChain、LangGraph、Dify等主流Agent开发框架,掌握MCP、技能插件(Skills)、Prompt&RAP、多智能体规划相关技术;
6、具备优秀的问题拆解、逻辑分析、跨团队沟通协作能力,学习主动性强、自驱力突出。
1、支持行业云平台和云产品在不同芯片架构和服务器下适配的技术方案,推动多部门协同,解决软硬件技术问题,向用户提供自主可控,安全可信的行业云平台。
2、推动行业云横向架构治理,支持特定云产品线的多芯架构升级,包括安全合规、资源共池等,以满足各类行业标准和规范。
3、推动云产品在不同芯片体系下的性能调优和应用迁移技术方案,实现行业云平台的平滑迁移。
1. 负责系统全流程实施,涵盖需求分析、方案设计、系统配置、测试、数据迁移及上线切换等核心环节;
2. 开展企业管理平台、SAP FICO等系统的用户培训,保障用户熟练掌握操作技能;
3. 负责企业一体化管理平台、SAP、司库系统、共享管理系统等系统的日常运维,及时响应并解决系统运行问题,保障系统稳定运行;
4. 深度理解业务场景,挖掘现有流程效率瓶颈与管理痛点,制定并推动优化方案落地;
5. 结合业务发展与用户反馈,持续优化负责模块的功能与流程,提升系统适配性和用户满意度。
1.搭建公司配置管理体系,定Git分支、基线规范,保障配置可追溯;
2.运维蓝鲸 / GitLab/Jenkins等DevOps平台,高效处理故障,管理团队资源权限;
3.用 Python/Shell 写脚本实现研发自动化,优化 “开发-发布”流程;
4.对接供应商推进平台升级,提供团队培训与技术支持。
1.参与过运维工具的设计,有运维平台产品经理经验者加分;
2.熟悉腾讯云服务,有相关运维经验者优先;
3.掌握至少一种编程语言,如Python、Shell等,能够编写自动化脚本;
4.了解容器化技术,如Docker、Kubernetes等,有实际应用经验者优先。
1、政企业务客户端安装、全业务7*24小时故障抢修、巡检,以及客户线路优化、勘察、割接、扩容等维护工作;
2、政企客户关系维护及专业技术维护指导;
3、政企业务客户端资产及资源的管理;
4、重要客户的活动保障及出具运行分析报告;
5、政企业务工程验收工作;
6、领导委派的其它工作。
任职要求1、遵守中国宪法和法律,具有对党忠诚的政治品格,具有职务所需的工作能力、文化水平、专业知识及身体条件;
2、大学本科及以上学历,计算机类、通信工程、电子信息类等相关专业可优先考虑,一般不超过35周岁;
3、具有一年及以上相关工作经验;
4、熟悉INTERNET、VPN、SDH、MSTP、IPTV、监控、无线、大屏等业务知识,掌握相关的技术原理,能快速定义各类网络故障类型及原因,提供解决措施或方案;
5、熟悉各类测试仪器的功能与使用方法,能运用各种测试仪器(例如光功率计、OTDR、场强仪等)迅速定位故障点,快速处理故障;
6、有一定的工程实施、项目管理能力,掌握网络产品安装、配置、测试等相关实施技术;
7、有一定的服务销售技术支持能力;具有良好的沟通能力、学习能力、团队协作精神;
8、具有良好职业操守、责任心、敬业精神;适应压力状态下工作,能适应轮班制;
9、具有一年以上驾龄,具备网络工程师、CCNA等证书者可优先考虑。
报名时间:自发布之日不少于5个工作日,招满即止。
备注:该岗位由上海市对外服务浙江有限公司( 简称上海外服)劳务派遣方式到我司工作。
1、负责公司ERP及相关信息系统的日常运维;
2、负责及时跟进业务部门的需求变更,优化信息系统的使用;
3、负责编写相关需求文档、配合开发进行功能测试、编写培训文档并对用户进行各种培训;
4、协助IT负责人支持集团多家公司各类ERP系统的项目调研、实施、各模块操作使用流程优化、用户培训、日常使用支持及系统的权限管理、数据备份等运维工作。
5、负责参与制定ERP与各系统软件集成方案的编写
1. 协助运维人员进行服务器、网络设备、存储设备等设备的日常运维工作,并及时处理出现的问题;
2. 协助运维人员编写文档,记录相应的操作流程、日常工作和服务器的维护情况等;
3. 参与服务器应用的安装、维护和升级工作,通过对生产环境进行技术测试和排查异常,为公司IT系统的稳定运行做好技术支持;
4. 参与公司IT系统的监控、数据备份等工作,及时处理并防止系统出现故障。
一. 网络运维与稳定性保障
1.负责公司内部网络日常运维管理,保障网络架构的高可用性与稳定性;
2.参与企业级网络架构设计与实施及技术方案落地;
3.快速响应并处理网络故障,主导故障排查、根因分析及应急处置,提升系统恢复效率;
4.跟踪主流网络技术发展趋势,持续提升技术能力。
二. 网络项目实施与交付
1.制定并输出标准化的技术实施文档、网络规范及运维手册,规范项目流程;
2.协助团队技术能力提升,通过项目实战进行技术分享与经验沉淀;
3.编写技术文档、操作手册及应急预案,参与网络设备过保替换、无线网络优化等网络项目的实施与交付。
三. 运维监控及自动化
1.负责公司内部网络基础设施的日常监控、维护与优化,保障网络高可用性与稳定性,整合监控、告警、指标采集及自动化运维工具能力;
2.建立统一的网络可观测性指标体系,实现对网络运行状态的实时监控、数据化管理及可视化展示;
3.推动网络运维自动化与智能化,参与编写脚本或使用运维工具提升运维效率。




