1.
小分段:1) 确认权限:SSH、DB 管理、CDN/云厂商控制台、负载均衡权限;2) 工具就绪:在运维机器上准备 ping、mtr、traceroute、tcpdump、kubectl、mysql、systemctl、rsync;3) 通讯链路:确认 on-call 群组、值班电话、故障单模板。
2.
小分段:1) 初步定位:执行 ping -c 10 <游戏服IP>,mtr -c 100
3.
小分段:1) 检查认证服务:systemctl status auth-service 或 kubectl -n prod get pods -l app=auth;2) 查看日志:tail -n 200 /var/log/game/auth.log 或 kubectl logs
4.
小分段:1) 检测:kubectl -n prod get pods --field-selector=status.phase=Failed;2) 拉取日志:kubectl logs
5.
小分段:1) 确认状态:mysql -h master -e "SHOW MASTER STATUS\G" 和 mysql -h slave -e "SHOW SLAVE STATUS\G";2) 若延迟可接受,重启 slave:STOP SLAVE; CHANGE MASTER TO MASTER_LOG_FILE='xx', MASTER_LOG_POS=yy; START SLAVE;3) 若主库损坏,使用最近备份恢复:停止写入,mysql -uroot -p < /backup/latest.sql,然后按 binlog 恢复:mysqlbinlog binlog.0000* | mysql -uroot -p;4) 验证一致性:对比 row count 或使用 pt-table-checksum;5) 完成后切换只读/读写标记并通知上游服务。
6.
小分段:1) 监控确认:观察流量曲线(云监控/ELB)并用 tcpdump 快速抓包;2) 启用云厂商防护:打开 ACL/黑洞,或启用 WAF/速率限制规则;3) CDN 缓解:在 CDN 控制台开启速率限制、WAF 并下发规则;4) 本地限流:在 Nginx/Haproxy 增加 limit_conn/limit_req;5) 事后分析:保存 pcap,提取 IP 列表,提交给云厂商做溯源与永久封禁。
7.
小分段:1) 备份:每日 mysqldump --single-transaction,rsync 到异地并验证 MD5;2) 滚动重启:按 zone 顺序逐台:kubectl cordon
8.
答:优先执行 ping + mtr 定位到哪一跳丢包,若在云商骨干外侧(跨境出口)则立即切换 DNS/负载均衡到备用区域并联系云商工单;若在本地机房或宿主机,抓包确认并重启网卡/弹性网卡或请求机房网管。
9.
答:先尝试通过 CHANGE MASTER TO 恢复同步;若无法恢复或数据损坏,应使用最近备份重建从库:停止 slave,恢复备份后按主库当前 binlog 位点快照拉起新的从库,避免直接在主库上做危险操作。
10.
答:运维先执行缓解(云端黑洞/CDN限流),同时告知产品发布时间窗口与影响范围,产品在游戏内/社交渠道发布简短公告并提供预计恢复时间,客服准备统一话术并记录受影响玩家以便后续补偿。