在线咨询 400-826-1668
回到顶部
ARTICLE DETAIL

资讯详情

深耕国风建站与运营引流的一线实战洞察。

第 9 篇:「Fluss 运维实战」—— 部署、监控与故障排查

第 9 篇:「Fluss 运维实战」—— 部署、监控与故障排查 第 9 篇「Fluss 运维实战」—— 部署、监控与故障排查阅读本文你将了解Fluss 的三种部署方式、Kubernetes Helm Chart 部署、Prometheus Grafana 监控配置、日常运维操作扩缩容、备份恢复以及 Top 10 常见故障排查手册。9.1 部署方式9.1.1 Docker Compose开发/测试# docker-compose.ymlversion:3.8services:zookeeper:image:zookeeper:3.9ports:-2181:2181environment:ZOO_MY_ID:1ZOO_SERVERS:server.1zookeeper:2888:3888;2181volumes:-zk_data:/data-zk_log:/datalogcoordinator-server:image:apache/fluss:0.9.1command:coordinatorServerdepends_on:-zookeeperports:-9123:9123environment:ZOOKEEPER_ADDRESS:zookeeper:2181COORDINATOR_HOST:coordinator-serverCOORDINATOR_PORT:9123volumes:-coordinator_data:/datatablet-server-1:image:apache/fluss:0.9.1command:tabletServerdepends_on:-coordinator-serverenvironment:ZOOKEEPER_ADDRESS:zookeeper:2181TABLET_SERVER_HOST:tablet-server-1DATA_DIR:/data/tabletvolumes:-ts1_data:/datatablet-server-2:image:apache/fluss:0.9.1command:tabletServerdepends_on:-coordinator-serverenvironment:ZOOKEEPER_ADDRESS:zookeeper:2181TABLET_SERVER_HOST:tablet-server-2DATA_DIR:/data/tabletvolumes:-ts2_data:/datavolumes:zk_data:zk_log:coordinator_data:ts1_data:ts2_data:9.1.2 KubernetesHelm Chart# 添加 Fluss Helm Repositoryhelm repoaddfluss https://apache.github.io/fluss/ helm repo update# 安装 Fluss 集群helminstallfluss-cluster fluss/fluss\--namespacefluss\--create-namespace\--setcoordinator.replicas3\--settabletServer.replicas6\--settabletServer.resources.requests.memory16Gi\--settabletServer.resources.requests.cpu4\--setpersistence.size500Gi\--setzookeeper.enabledfalse\--sets3.endpointhttps://s3.amazonaws.com\--sets3.bucketmy-fluss-bucketHelm values 关键配置# values.yaml (关键部分)coordinator:replicas:3# 高可用3 个 Coordinatorresources:requests:memory:8Gicpu:2limits:memory:16Gicpu:4tabletServer:replicas:6resources:requests:memory:32Gi# TabletServer 需要较大内存cpu:8persistence:size:1Ti# 本地 SSD 用于 Hot Tierconfig:# JVM 配置heapSize:28gdirectMemorySize:4g# Arrow 使用堆外内存# RocksDB 配置kvStoreBlockCacheSize:8gkvStoreWriteBufferSize:256m9.1.3 裸机部署# 下载 Flusswgethttps://dlcdn.apache.org/fluss/0.9.1/fluss-0.9.1-bin.tar.gztar-xzffluss-0.9.1-bin.tar.gzcdfluss-0.9.1# 配置 conf/fluss-conf.yamlcatconf/fluss-conf.yamlEOF # ZooKeeper zookeeper.address: zk1:2181,zk2:2181,zk3:2181 # Coordinator coordinator.host: coord-1 coordinator.port: 9123 # TabletServer tablet.server.host: ts-1 data.dir: /data/fluss # 远程存储S3 remote.data.dir: s3://my-bucket/fluss/ s3.endpoint: https://s3.amazonaws.com s3.access-key: YOUR_KEY s3.secret-key: YOUR_SECRET # 日志 log.dir: /var/log/fluss EOF# 启动bin/fluss-coordinator.sh start bin/fluss-tablet-server.sh start# 验证bin/fluss-cluster.sh status9.2 集群关键配置参数9.2.1 CoordinatorServer 参数参数默认值推荐值说明coordinator.port91239123RPC 端口zookeeper.addresslocalhost:2181zk1:2181,zk2:2181ZK 地址zookeeper.session.timeout30000ms60000msZK 会话超时tablet.assignment.balance.interval300s300sRebalance 检查间隔coordinator.heap.size4g8g-16gJVM 堆大小9.2.2 TabletServer 参数参数默认值推荐值说明data.dir/tmp/fluss/data/fluss数据目录SSD推荐log.segment.size1GB1GB-4GBLog Segment 大小log.segment.retention.hours72h24h-72hSegment 保留时间kv.store.block.cache.size256MB4GB-16GBRocksDB Block Cachekv.store.write.buffer.size64MB128MB-256MB写缓冲区大小9.3 监控指标9.3.1 Fluss Metrics 架构Fluss 使用 fluss-metrics 模块暴露指标支持 Prometheus 格式 TabletServer 关键指标 ├── fluss_tablet_log_write_rate # 日志写入速率 (records/sec) ├── fluss_tablet_log_read_rate # 日志读取速率 ├── fluss_tablet_kv_put_rate # KV 写入速率 ├── fluss_tablet_kv_get_rate # KV 读取速率 ├── fluss_tablet_kv_get_latency_p99 # KV P99 延迟 ├── fluss_tablet_disk_usage_bytes # 磁盘使用量 ├── fluss_tablet_segment_count # Segment 数量 ├── fluss_tablet_active_connections # 活跃连接数 └── fluss_tablet_tiering_offset_lag # Tiering 延迟 CoordinatorServer 关键指标 ├── fluss_coordinator_active_tablets # 活跃 Tablet 数 ├── fluss_coordinator_under_replicated # 副本不足的 Tablet ├── fluss_coordinator_rebalance_count # Rebalance 次数 └── fluss_coordinator_request_latency # 请求延迟9.3.2 Prometheus 配置# prometheus.ymlscrape_configs:-job_name:fluss-coordinatorstatic_configs:-targets:[coord-1:9249,coord-2:9249,coord-3:9249]metrics_path:/metrics-job_name:fluss-tablet-serverstatic_configs:-targets:-ts-1:9250-ts-2:9250-ts-3:9250-ts-4:9250-ts-5:9250-ts-6:9250metrics_path:/metrics9.3.3 Grafana Dashboard关键告警规则# alerting_rules.ymlgroups:-name:fluss_alertsrules:-alert:TabletServerDownexpr:up{jobfluss-tablet-server} 0for:1mlabels:severity:criticalannotations:summary:TabletServer {{ $labels.instance }} is down-alert:HighKvLatencyexpr:fluss_tablet_kv_get_latency_p99100for:5mlabels:severity:warningannotations:summary:KvStore P99 latency 100ms on {{ $labels.instance }}-alert:DiskUsageHighexpr:fluss_tablet_disk_usage_bytes / fluss_tablet_disk_total_bytes0.85for:10mlabels:severity:warningannotations:summary:Disk usage 85% on {{ $labels.instance }}-alert:TieringLagexpr:fluss_tablet_tiering_offset_lag10000000for:15mlabels:severity:warningannotations:summary:Tiering lag 10M records on {{ $labels.instance }}9.4 Top 10 故障排查故障 1OOM内存溢出症状TabletServer 进程频繁重启日志中有 OutOfMemoryError 排查 1. 检查 JVM 堆配置bin/fluss-tablet-server.sh -Xmx? 2. 检查堆外内存Direct MemoryArrow RecordBatch 使用 Direct Memory 3. 检查 RocksDB Block Cache 大小 解决 # 增加 JVM 堆 export FLUSS_HEAP_OPTS-Xms16g -Xmx16g # 增加 Direct Memory export FLUSS_DIRECT_MEMORY-XX:MaxDirectMemorySize8g # 降低 Block Cache SET kv.store.block.cache.size 2g故障 2磁盘写满症状写入报错 No space left on device 排查 1. df -h 检查磁盘使用率 2. 检查 LogSegment 保留策略是否正确 3. 检查 Tiering 是否正常工作 解决 # 清理过期 Segment bin/fluss-cleanup.sh --older-than 24h # 或缩短保留时间 ALTER TABLE orders SET (log.segment.retention.hours 24); # 确保 Tiering 正常运行 # 查看 Tiering 延迟 curl http://coordinator:9249/metrics | grep tiering_offset_lag故障 3网络分区症状部分 TabletServer 不可达Leader 切换频繁 排查 1. ping/telnet 检查网络连通性 2. 检查 ZooKeeper 是否正常echo stat | nc zk 2181 3. 检查 Coordinator 日志中的连接超时 解决 # 增加网络超时 SET zookeeper.session.timeout 120000 # 重启受影响的 TabletServer bin/fluss-tablet-server.sh restart故障 4数据倾斜症状部分 TabletServer 负载过高I/O 和 CPU 不均衡 排查 1. 检查各 TabletServer 的 Tablet 数量分布 2. 检查热点 Bucket写入 QPS 最高的 Bucket 解决 # 增加 Bucket 数量 ALTER TABLE hot_table SET (bucket.num 64); # 触发手动 Rebalance bin/fluss-rebalance.sh --table hot_table故障 5Checkpoint 失败症状Flink 任务 Checkpoint 超时 排查 1. Flink UI 查看 Checkpoint 历史 2. Fluss 日志中是否有慢写入 解决 # 增加 Checkpoint 超时 env.enableCheckpointing(300000); // 5 分钟 # 减少 Flink 并行度或增加 Fluss TabletServer故障 6RocksDB Compaction 卡顿症状KvStore 写入延迟飙升 排查 1. 检查 RocksDB 日志中的 Compaction 统计 2. 检查是否触发了 Level 0 → Level 1 的大 Compaction 解决 # 增加写缓冲区 SET kv.store.write.buffer.size 256m SET kv.store.max.write.buffer.number 4 # 限制后台 Compaction 线程 SET kv.store.max.background.compactions 2故障 7ZooKeeper 连接超时症状CoordinatorServer 不断重连 ZooKeeper 解决 # 增加 ZK 超时 SET zookeeper.connection.timeout 30000 SET zookeeper.session.timeout 120000故障 8S3 上传失败症状Tiering Service 日志报 S3 错误 排查 1. 验证 S3 凭证是否过期 2. 检查网络是否可达 S3 endpoint 解决 # 更新凭证 SET s3.access-key NEW_KEY SET s3.secret-key NEW_SECRET # 使用 AssumeRole SET s3.credentials.provider STSAssumeRoleSessionCredentialsProvider SET s3.role.arn arn:aws:iam::123456789:role/FlussTieringRole故障 9Schema 不兼容症状写入报 Schema 错误 排查 1. 检查写入数据的 Schema 是否与表 Schema 匹配 2. 是否存在未知的新列 解决 # 添加缺失的列 ALTER TABLE my_table ADD COLUMN new_field STRING;故障 10Flink Connector 版本不匹配症状ClassNotFoundException 或 MethodNotFoundException 解决 # 确 Flink 与 Fluss 版本兼容 # Fluss 0.9.1 支持 Flink 1.18 / 1.19 / 1.20 / 2.2 dependency groupIdorg.apache.fluss/groupId artifactIdfluss-flink-${您的Flink主版本}/artifactId version0.9.1/version /dependency9.5 备份与恢复9.5.1 备份策略数据备份层次 Hot Tier (Fluss) ├── LogTablet通过 ISR 副本天然备份3 副本 └── KvTablet通过 WAL Remote Storage Snapshot 备份 Cold Tier (Iceberg/Paimon) └── Parquet 文件在 S3 上天然持久化 版本管理 Metadata (ZooKeeper) └── 定期备份 ZK 数据目录9.5.2 灾难恢复# 1. 恢复 ZooKeeper 元数据cp/backup/zookeeper/version-2/* /data/zookeeper/version-2/# 2. 启动新集群bin/fluss-coordinator.sh start bin/fluss-tablet-server.sh start# 3. 从 Remote Storage 恢复 KvStore# Fluss 自动检测本地缺失的 KvTablet 并从 Remote Storage 下载 Snapshot# 然后从 LogTablet 重放 WAL 恢复到最新状态# 4. 验证恢复bin/fluss-cluster.sh status bin/fluss-cluster.sh verify-tables9.6 总结与下一篇预告运维领域关键工具/参数部署Docker Compose、Helm Chart、裸机部署三种方式监控fluss-metrics → Prometheus → Grafana告警TabletServer Down、高延迟、磁盘满、Tiering 延迟故障排查10 大常见故障OOM、磁盘满、网络分区、数据倾斜等扩缩容ALTER TABLE bucket.num bin/fluss-rebalance.sh备份恢复ISR 副本 Remote Storage Snapshot WAL 重放下一篇也是最后一篇——我们将通过 5 个完整的生产级实战案例展示 Fluss 在电商大屏、特征存储、CDC 管道、风控系统、客户 360 等场景中的端到端解决方案。本文基于 Apache Fluss 0.9.1 运维实践。项目 GitHub: https://github.com/apache/fluss
返回列表