岗位职责
1. 负责大数据平台( Hadoop/CDH 、Spark 、Flink 、Kafka 、HBase 、Hive 、StarRocks 、ClickHouse 等)的部署、运维、监控与优化,保障集群稳定高可用。
2. 负责集群容量规划、性能调优、故障排查与应急处理,持续提升资源利用率与作业执行效率。
3. 设计并完善大数据平台的监控告警体系、自动化运维工具与运维流程,推动运维标准化、自动化。
4. 负责数据安全、权限管理( Kerberos 、Ranger/Sentry )、备份恢复及灾备方案的落地。
5. 配合数据开发、数仓、算法团队,支撑离线/实时数据链路的稳定运行。
6. 跟踪大数据生态新技术,推动平台架构演进与降本增效。
任职要求
1. 本科及以上学历,计算机、软件工程等相关专业,5 年以上大数据运维经验。
2. 熟悉 Hadoop 生态( HDFS 、YARN 、Hive 、HBase 、Spark 、Flink 、Kafka 、ZooKeeper 等)的原理与运维。
3. 熟悉 CDH ( Cloudera Distribution Hadoop )平台的部署、运维与调优经验,熟悉 Cloudera Manager 。
4. 熟悉 StarRocks 与 ClickHouse 的生产环境运维经验,熟悉其架构原理、性能调优、扩缩容与故障处理。
5. 具备一定规模的大数据组件运维经验,需满足以下至少一项:
• Kafka 集群日均消息量 百亿级以上,或集群规模 30 节点以上;
• Spark/Flink 实时或离线作业日均调度 数千个以上;
• HBase 集群单表数据量 十亿行以上,或承载在线高并发读写场景;
• StarRocks/ClickHouse 集群规模 20 节点以上,或单集群数据量 百 TB 级以上;
• Hive/数仓 管理表数量 万级以上,日均查询作业 数千次以上。
6. 熟练掌握 Linux 系统管理与性能调优,熟悉 Shell/Python 等脚本语言,具备自动化运维开发能力。
7. 熟悉监控体系( Prometheus 、Grafana 、Zabbix 、ELK 等)及 CI/CD 、Ansible 等自动化工具。
8. 具备扎实的网络、存储基础知识,熟悉 Kerberos 、Ranger 等安全组件。
9. 有较强的故障排查、应急处理能力和抗压能力,责任心强,沟通协作良好。
加分项
• 熟悉云原生大数据( K8s 、Docker 、云上 EMR/CDP 等)部署与运维。
• 有数据湖( Iceberg 、Hudi 、Delta Lake )或 Doris 等其他 OLAP 引擎运维经验。
• 参与过大数据平台从 0 到 1 建设或重大架构升级项目。
非中国大陆地区,可以是中国台湾地区;
TG:@hr861
邮箱: [email protected]
1. 负责大数据平台( Hadoop/CDH 、Spark 、Flink 、Kafka 、HBase 、Hive 、StarRocks 、ClickHouse 等)的部署、运维、监控与优化,保障集群稳定高可用。
2. 负责集群容量规划、性能调优、故障排查与应急处理,持续提升资源利用率与作业执行效率。
3. 设计并完善大数据平台的监控告警体系、自动化运维工具与运维流程,推动运维标准化、自动化。
4. 负责数据安全、权限管理( Kerberos 、Ranger/Sentry )、备份恢复及灾备方案的落地。
5. 配合数据开发、数仓、算法团队,支撑离线/实时数据链路的稳定运行。
6. 跟踪大数据生态新技术,推动平台架构演进与降本增效。
任职要求
1. 本科及以上学历,计算机、软件工程等相关专业,5 年以上大数据运维经验。
2. 熟悉 Hadoop 生态( HDFS 、YARN 、Hive 、HBase 、Spark 、Flink 、Kafka 、ZooKeeper 等)的原理与运维。
3. 熟悉 CDH ( Cloudera Distribution Hadoop )平台的部署、运维与调优经验,熟悉 Cloudera Manager 。
4. 熟悉 StarRocks 与 ClickHouse 的生产环境运维经验,熟悉其架构原理、性能调优、扩缩容与故障处理。
5. 具备一定规模的大数据组件运维经验,需满足以下至少一项:
• Kafka 集群日均消息量 百亿级以上,或集群规模 30 节点以上;
• Spark/Flink 实时或离线作业日均调度 数千个以上;
• HBase 集群单表数据量 十亿行以上,或承载在线高并发读写场景;
• StarRocks/ClickHouse 集群规模 20 节点以上,或单集群数据量 百 TB 级以上;
• Hive/数仓 管理表数量 万级以上,日均查询作业 数千次以上。
6. 熟练掌握 Linux 系统管理与性能调优,熟悉 Shell/Python 等脚本语言,具备自动化运维开发能力。
7. 熟悉监控体系( Prometheus 、Grafana 、Zabbix 、ELK 等)及 CI/CD 、Ansible 等自动化工具。
8. 具备扎实的网络、存储基础知识,熟悉 Kerberos 、Ranger 等安全组件。
9. 有较强的故障排查、应急处理能力和抗压能力,责任心强,沟通协作良好。
加分项
• 熟悉云原生大数据( K8s 、Docker 、云上 EMR/CDP 等)部署与运维。
• 有数据湖( Iceberg 、Hudi 、Delta Lake )或 Doris 等其他 OLAP 引擎运维经验。
• 参与过大数据平台从 0 到 1 建设或重大架构升级项目。
非中国大陆地区,可以是中国台湾地区;
TG:@hr861
邮箱: [email protected]