杭州服务器运维
服务器运维是负责保障企业或组织服务器稳定运行的职位。他们负责监控和维护服务器硬件设备,确保它们在良好的工作状态下运行。他们还负责监控服务器的性能指标,以及解决服务器故障或问题。这些问题可能包括网络连接中断、硬件故障、操作系统错误等。服务器运维人员还负责安装和配置服务器软件,确保服务器安全,并处理安全威胁。此外,他们还负责备份和恢复数据,以确保数据的安全和完整性。服务器运维人员需要具备良好的问题解决能力和技术技能,能够快速识别和解决服务器问题,以确保服务器的稳定和可靠性。
薪酬概览
平均月薪
¥13700
中位数 ¥10000 | 区间 ¥10700 - ¥16700
数据来源:样本数量过少,仅供参考;更新时间:2026年7月13日
月薪分布
33.3% 人群薪酬落在 15-30k

三大影响薪酬的核心维度
影响薪资的核心维度1:工作年限
影响薪资的核心维度2:学历背景
市场需求
12月新增岗位
12
对比上月:岗位新增2
数据由各大平台公开数据统计分析而来,仅供参考。
岗位需求趋势
不同经验岗位需求情况
| 工作年限 | 月度新增职位数 | 职位占比数 |
|---|---|---|
| 不限经验 | 12 | 100% |
热招职位
1. 负责服务器/交换机产品系统硬件设计,保证产品方案领先性、成本优势和综合竞争力,参与产品端到端交付;
2. 负责原始需求的分析、评估与分解,提前识别风险点,解决开发过程中遇到的问题;
3. 负责推动各领域按照硬件系统方案按期完成开发和测试工作,保证最终硬件系统的交付质量;
4. 负责持续跟踪和分析友商竞品的优劣势,为平头哥产品定义和设计提供参考依据;
5. 跟进业界技术发展趋势,参与平头哥芯片与硬件产品路标的规划;
1. 负责在Emulator上对产品进行验证;
2. 负责制定子系统以及SOC级硅前验证计划,例如Core,Mesh一致性总线,PCIE, DDR等,并在EMU上完成验证规划;
3. 重点承担在Core/总线/PCIE的系统大压力测试、场景验证以及性能验证,与EDA验证形成互补;
4. 与EDA验证团队合作,移植部分EDA用例,加大压力测试;
5. 负责建立SOC原型验证流程,并持续改进计划,以提高测试效率、工具性能,保证验证质量;
6.协同设计/验证/软件工程师,共同完成debug工作;
【团队介绍】
阿里巴巴中间件团队是集团基础技术的核心支撑力量,负责消息、服务发现与软负载、分布式协调、任务调度)、配置管理等核心中间件产品在集团内部的稳定性保障与运维体系建设。
这些中间件承载了阿里集团几乎所有在线业务的流量调度、服务通信与数据流转,覆盖电商、物流、本地生活、云计算、大文娱等 BU,日均处理万亿级消息、百万级服务节点调度,是每年双 11 大促的底层生命线。
团队当前重点方向:
1、稳定性工程 — 从准入规范、变更管控到容灾演练的全链路保障体系,目标全年中间件可用性
99.99%;
2、AI 智能运维(Agentic SRE) — 将运维经验沉淀为 Agent Skills,通过 LLM + MCP 实现告警自愈、风险治理、架构演进,通过 AI 提升中间件产品的稳定性
我们相信:下一代 SRE 不只是运维工程师,更是用 AI 重新定义运维的人。 如果你既有系统功底,又对用技术杠杆 10x 提效充满热情,这里是你的主场。
【职责描述】
1. 负责阿里巴巴集团核心中间件(软负载 / 消息 / ZooKeeper / 配置中心等)的稳定性保障,包括故障定位、性能调优、容量规划与成本治理;
2. 主导中间件重大风险识别、应急预案设计与容灾演练,确保分钟级恢复能力;
3. 建设中间件 + AI 智能运维体系(Agent / Skills / MCP),实现 10x 效率提升,将人工经验沉淀为可复用的自动化能力;
4. 面向业务需求提供中间件选型建议与架构方案,联动产品和开发推动落地;
5. 参与大规模集群建站、大促备容及架构升级,支撑集团业务持续增长。
-既具备扎实的技术背景,又能熟练地与客户沟通,理解客户需求,并能够将公司的技术产品或服务有效地推广给目标市场;
-建立并保持良好的客户关系,定期跟进项目进展,收集反馈信息。
-通过与潜在客户的深入交流,准确把握其业务需求和技术痛点,并结合公司产品特点,定制化设计解决方案;
-为客户提供AI芯片的技术支持,确保产品在客户业务场景中的顺利落地;
-向客户展示产品功能和优势,为客户提供全面的技术咨询和支持服务,解答有关AI芯片使用过程中的问题;
-组织并实施针对客户的技术培训和研讨会,帮助客户快速了解AI芯片产品的规格、特性和使用方法;
-收集并分析客户需求,并总结前代产品落地过程中遇到的各种问题将其转化为产品改进建议,与产品和研发团队合作推动产品升级;
-与市场营销团队合作,以支持AI芯片在市场中的推广和应用;
-持续关注AI领域市场及竞对最新动态和技术趋势,保持对公司产品的竞争力分析;
面向阿里集团内部业务提供AI Infra容器网络、服务网络等技术支持,支撑集团内部大模型训练、推理、Agent等工作workload形态,服务ATH、淘天、闪购、国际化等各个业务BU。
● 负责面向异构/多云等 AI 计算环境构建统一的 K8s 容器网络,支持 RDMA 高性能通信,保障大规模训练与推理场景的网络性能与稳定性;
● 负责容器网络的轻量化多租隔离能力建设,支撑 AI 业务、传统业务的统一部署;
● 负责面向 Agent 场景提供安全、高效的沙箱网络技术;
● 负责 CoreDNS、kube-proxy 等云原生网络服务的建设与优化,提升 K8s Service 的可用性与性能;
专业要求计算机软件等相关专业工作职责1、负责云平台边界网络日常维护及问题处理;
2、负责网络架构的规划、设计、优化与持续演进;
3、参与网络割接、巡检、应急工作;
4、编写规范的技术文档、运维手册、应急预案和技术方案;
任职要求1、招聘范围:遵守中国宪法和法律,符合岗位所需的学历、专业技能、身体条件人员;
2、年龄学历:大学本科及以上学历,计算机软件等相关专业,一般不超过35周岁;
3、工作经验:1年以上网络规划、实施与运维经验;
4、其他条件:精通TCP/IP、OSPF、BGP等路由技术;熟悉华为、华三或者思科等网络设备,熟悉负载均衡、防火墙等设备;熟悉Linux系统基本运维与常见网络协议分析工具;熟悉zabbix、cacti等网络监控工具;具备独立分析和解决问题的能力,有良好的计划制定及执行能力;持有CCIE、HCIE等证书者优先考虑。
1. 统筹管理:对区域各站点设备运维团队负责,监控和提升各城市团队的工作质量和效率,建立区域运维管理例会机制;
2. 数据看板与决策:主导搭建并持续迭代运维数据管理看板(设备可用率、MTTR、能耗趋势等),通过数据发现异常、引导团队工作方向,用数字准确呈现团队工作成果;
3. 智能工单管理:负责监控全区工程设备工单的处理全流程,推动工单系统从人工派单向自动化分级响应升级,管控工单处理进度、质量和成本;
4. IoT监控与预测维护:负责推进站点设备的IoT传感器接入与远程监控体系建设,探索基于设备运行数据的预测性维护模式,降低突发停机率;
5. 流程标准化迭代:负责运维组操作流程的梳理和持续迭代,根据成本支出变化和业务扩张节奏,更新维修标准手册和设备操作规程(SOP);
6. 新站验收管理:负责新站工程设备验收质量管控,完善验收清单标准,推动新站交付质量提升,确保设备带病开业率为零;
7. 设备全生命周期管理:统筹负责大区内站点工程设备(制冷系统、给排水、强弱电)的日常运行、维修、保养、巡检、改造等全面管理8. 节能降耗落地:管理大区站点设备能耗使用情况,结合数字化能耗平台数据提供节能优化方案,推动节能降耗KPI完成;
9. 培训体系建设:计划性巡查,现场调研培训需求,撰写培训课件,对设备维保人员进行技能培训和评估考核,打造区域标准化技能梯队;
10. 跨部门协同:建立与供应链、站长、采购、IT等相关方的协作机制,推动设备相关问题高效闭环;
11. 应急响应与保障:熟练掌握给排水、电气、制冷专业技术,制定应急预案,遇突发设备故障带领团队迅速处置,确保站点最短时间内恢复正常运营。
1、政企业务客户端安装、全业务7*24小时故障抢修、巡检,以及客户线路优化、勘察、割接、扩容等维护工作;
2、政企客户关系维护及专业技术维护指导;
3、政企业务客户端资产及资源的管理;
4、重要客户的活动保障及出具运行分析报告;
5、政企业务工程验收工作;
6、领导委派的其它工作。
任职要求1、遵守中国宪法和法律,具有对党忠诚的政治品格,具有职务所需的工作能力、文化水平、专业知识及身体条件;
2、大学本科及以上学历,计算机类、通信工程、电子信息类等相关专业可优先考虑,一般不超过35周岁;
3、具有一年及以上相关工作经验;
4、熟悉INTERNET、VPN、SDH、MSTP、IPTV、监控、无线、大屏等业务知识,掌握相关的技术原理,能快速定义各类网络故障类型及原因,提供解决措施或方案;
5、熟悉各类测试仪器的功能与使用方法,能运用各种测试仪器(例如光功率计、OTDR、场强仪等)迅速定位故障点,快速处理故障;
6、有一定的工程实施、项目管理能力,掌握网络产品安装、配置、测试等相关实施技术;
7、有一定的服务销售技术支持能力;具有良好的沟通能力、学习能力、团队协作精神;
8、具有良好职业操守、责任心、敬业精神;适应压力状态下工作,能适应轮班制;
9、具有一年以上驾龄,具备网络工程师、CCNA等证书者可优先考虑。
报名时间:自发布之日不少于5个工作日,招满即止。
备注:该岗位由上海市对外服务浙江有限公司( 简称上海外服)劳务派遣方式到我司工作。
1. 设计、实现、维护超大规模高性能、高稳定在线nosql分布式数据库系统Tair;
2. 应用先进的索引结构、协程、io_uring等技术,实现极致高效的存储内核;
3. 为读/写热点、cache一致性、读写一致性、高效分布式锁等典型场景提供解决方案;
4. 通过部署优化、自动扩缩、存算分离等技术,提升10万张规模表的资源利用效率及稳定性。
1. 计算机或相关专业本科及以上学历,2 年以上大型分布式系统开发经验;
2. 精通 Java 或 Python,深入理解 JVM、并发编程、网络通信机制,具备高并发、高可用系统实战经验;
3. 扎实的计算机基础:熟悉常用数据结构与算法,掌握数据库、缓存、消息队列等中间件原理与最佳实践;
4. 对 AI 工程化有浓厚兴趣,具备以下一项或多项经验者优先:
○ 参与过 AI Agent 系统的设计与开发(如 LangChain、AutoGPT、Transformers Agents 等框架);
○ 使用 LLM 实现代码生成、需求解析、测试用例生成等研发提效场景;
○ 具备 Prompt Engineering、RAG、Agent Planning 与 Tool Calling 等实践经验;
○ 关注 AIGC、Code Generation、Intelligent IDE 等方向的发展趋势并有实际尝试;
5. 对技术有热情,代码质量意识强,逻辑清晰,具备优秀的沟通能力和跨团队协作推动力;
6. 其他加分项:
○ 有营销、交易、玩法、招商、运营后台系统开发经验;
○ 具备全栈开发能力,熟悉前端技术栈(React / Vue、TypeScript、Webpack 等),能够独立完成复杂页面开发与性能优化;
○ 有数据挖掘、AB 实验分析、用户行为建模等相关经验;
○ 在开源社区贡献过 AI 相关项目或发表过技术博客;
○ 具备全链路视角,能从产品需求出发反推技术方案与 AI 落地路径。
1. 高潜场景挖掘:重点扫描全球范围内Token消耗规模大的高潜力应用赛道,识别未来的“杀手级”应用趋势。
2. 标杆研究:深度拆解海外AI 应用公司的产品逻辑与商业模式。
3. 商业/生态策略制定:基于对MaaS层和应用层的理解,协助制定公司在海外市场的生态卡位策略。
4. 行研与决策支持:输出高质量的行业Mapping,不仅关注热门行业趋势/应用,更要关注企业级工作流中的Agent应用,为管理层提供从技术到商业的完整判断链条。
1、有较强的业务理解能力,能够快速洞察业务场景中的痛点问题并结合AI的最新能力发展,挖掘契合点;
2、有1-3年AI产品经验并能持续保持对AI技术发展,行业领先AI产品的学习,对AI技术优势和边界等有深刻理解;
3、良好的沟通能力和问题分析解决能力,跨团队协作能力和推动能力强,承压能力佳;
4、有非常强的动手能力,可以自己直接上手完成构建Agent、skill,上线产品demo;
5、有电商、ToB、SaaS等相关经验,深度AI产品使用者优先;