分类: 阿里云
-
阿里云 ECS 20GB 系统盘使用率升至 81% 并持续触发告警后,对服务器磁盘占用进行逐项排查。确认 PHP 8.5、Nginx 1.30.4、Redis 8.10.0 当前生产运行路径后,清理升级遗留的构建目录、源码、回滚备份和旧 OneinStack 归档,同时处理 824MB PHP-FPM 异常日志、约 2GB systemd journal,以及已经完成使命的 WordPress 历史文章处理目录。最终系统盘使用率从 81% 降至 42%,可用空间增加至约 11GB,并完成 Nginx、PHP-FPM、Redis 运行状态验证。
-
阿里云 ECS 再次频繁触发 CPU 告警后,我结合云监控与 EdgeOne 离线日志,确认自动化抓取和大量回源 MISS 是主要诱因,而 W3TC 未预缓存归档分页只是放大因素。考虑到服务器长期运行在 1 核 2G、内存占用接近 60%,且后续还要部署 Go Tour,最终将实例升级为 2 核 4G。本文记录了告警分析、规格选择、快照备份、升配重启,以及 Nginx、PHP-FPM、Redis、W3TC 和三个域名的完整验证过程。
-
在一次 WordPress 502 故障排查结束后,我继续完善阿里云 ECS 的主机监控与报警体系。排查发现原有云监控 Agent 2.1.56 已停止运行,导致 CPU、内存、磁盘等操作系统级指标长期没有数据。随后通过传统云监控「主机监控」将 Agent 升级至 4.0.0,恢复 CPU、内存、Load、磁盘、网络和公网带宽等监控,并分别为 CPU、内存、磁盘及公网流出带宽设置 Info、Warn、Critical 三级报警。结合恢复后的实际监控数据,现阶段 1 核 2G ECS 与 2 Mbps 公网带宽仍有明显余量,因此暂不升级服务器,而是先通过持续监控积累长期运行基线,让服务器运维从“故障后排查”转向“异常前预警”。
-
一次 WordPress 生产站间歇性 502 故障排查记录。阿里云 ECS 一度出现 CPU 100%、Load 超过 9、PHP-FPM Socket 队列达到 510/511,大量请求返回 499 和 502。通过分析 Nginx 日志发现,最近 20000 条请求中有 18455 条携带 Sogou web spider/4.0 User-Agent,并以每分钟约 500~700 次的频率持续遍历网站。随后在 EdgeOne 中通过 *Sogou* User-Agent 规则进行边缘拦截,Sogou UA 请求降至 0,PHP-FPM 队列恢复为 0/511,CPU 空闲率最高恢复到 97%,后台连续请求全部返回 HTTP 200。此次排查说明,服务器出现性能瓶颈时,不应急于升级配置,应先确认异常流量和真正的资源消耗来源。
-
针对WordPress脚本误删标签导致数据库严重损毁且历史备份失效的问题,本文记录了利用阿里云RDS库表时间点恢复功能进行数据修复的实操过程。通过锁定故障前时间节点,完整恢复数据库及全表数据至新库,重赋账号权限并修改站点配置,最终校验数据量与关联关系恢复正常,实现了不重建实例情况下的精准数据还原。
-
针对阿里云DMS查询结果集翻页最多支持10000行且传统导出功能生成多个文件的问题,文章介绍了通过“数据导出”工单系统突破限制的方案。该流程包括执行基础SQL查询后创建数据导出工单,将格式设置为CSV并立即执行。最终在主文件夹生成包含全部数据的单个CSV文件,有效解决了大数据集分页限制与合并导出的需求。
-
针对 WordPress 站点全球访问速度问题,本文记录了使用国内拨测和海外 WebPageTest 进行性能基准测试的过程。测试发现,国内跨运营商延迟较高,而海外节点受限于高延迟和大量请求,LCP 指标未达标。基于分析,文章对比了阿里云 CDN 与 Cloudflare 的优缺点,最终确定以海外加速为主,优先接入 Cloudflare 免费版并计划通过智能 DNS 分流兼顾国内体验。
-
针对在 Ubuntu 终端连接阿里云 ECS 时频繁输入密码及连接闲置中断的问题,本文分享了在阿里云 ECS 控制台创建并绑定密钥对,以及在本地配置 SSH 客户端和 ServerAliveInterval 参数的完整过程。该方案实现了免密登录与心跳保活,有效解决了输密码繁琐和十分钟无操作导致卡死的困扰,提升了开发体验。
-
针对基于阿里云ECS和OneinStack环境的WordPress站点出现的504错误,文章记录了排查与优化过程。面对CPU满载和后台响应缓慢,发现PHP-FPM慢日志配置冲突及Nginx超时设置缺失。通过修正PHP-FPM参数为动态模式,调整Nginx超时时间,并开启慢日志监控,最终使CPU使用率回落,站点恢复正常,同时提出了升级硬件和引入CDN等后续建议。
-
个人博客出现 504 Gateway Timeout,排查发现服务器因恶意扫描和分布式爬虫导致严重过载。内存被过多的 PHP-FPM 进程耗尽,引发负载飙升。通过降低 PHP-FPM 进程数以适配硬件配置,在 Nginx 层面封禁恶意扫描 IP 及爬虫 IP 段,并重启 ECS 清理积压进程,最终解决了资源耗尽问题,恢复了服务正常响应。
