没有不值得去解决的问题,也没有不值得去学习的技术!

分类: 阿里云

  • 阿里云 ECS 20GB 系统盘使用率升至 81% 并持续触发告警后,对服务器磁盘占用进行逐项排查。确认 PHP 8.5、Nginx 1.30.4、Redis 8.10.0 当前生产运行路径后,清理升级遗留的构建目录、源码、回滚备份和旧 OneinStack 归档,同时处理 824MB PHP-FPM 异常日志、约 2GB systemd journal,以及已经完成使命的 WordPress 历史文章处理目录。最终系统盘使用率从 81% 降至 42%,可用空间增加至约 11GB,并完成 Nginx、PHP-FPM、Redis 运行状态验证。

  • 阿里云 ECS 再次频繁触发 CPU 告警后,我结合云监控与 EdgeOne 离线日志,确认自动化抓取和大量回源 MISS 是主要诱因,而 W3TC 未预缓存归档分页只是放大因素。考虑到服务器长期运行在 1 核 2G、内存占用接近 60%,且后续还要部署 Go Tour,最终将实例升级为 2 核 4G。本文记录了告警分析、规格选择、快照备份、升配重启,以及 Nginx、PHP-FPM、Redis、W3TC 和三个域名的完整验证过程。

  • 在一次 WordPress 502 故障排查结束后,我继续完善阿里云 ECS 的主机监控与报警体系。排查发现原有云监控 Agent 2.1.56 已停止运行,导致 CPU、内存、磁盘等操作系统级指标长期没有数据。随后通过传统云监控「主机监控」将 Agent 升级至 4.0.0,恢复 CPU、内存、Load、磁盘、网络和公网带宽等监控,并分别为 CPU、内存、磁盘及公网流出带宽设置 Info、Warn、Critical 三级报警。结合恢复后的实际监控数据,现阶段 1 核 2G ECS 与 2 Mbps 公网带宽仍有明显余量,因此暂不升级服务器,而是先通过持续监控积累长期运行基线,让服务器运维从“故障后排查”转向“异常前预警”。

  • 一次 WordPress 生产站间歇性 502 故障排查记录。阿里云 ECS 一度出现 CPU 100%、Load 超过 9、PHP-FPM Socket 队列达到 510/511,大量请求返回 499 和 502。通过分析 Nginx 日志发现,最近 20000 条请求中有 18455 条携带 Sogou web spider/4.0 User-Agent,并以每分钟约 500~700 次的频率持续遍历网站。随后在 EdgeOne 中通过 *Sogou* User-Agent 规则进行边缘拦截,Sogou UA 请求降至 0,PHP-FPM 队列恢复为 0/511,CPU 空闲率最高恢复到 97%,后台连续请求全部返回 HTTP 200。此次排查说明,服务器出现性能瓶颈时,不应急于升级配置,应先确认异常流量和真正的资源消耗来源。

  • 针对WordPress脚本误删标签导致数据库严重损毁且历史备份失效的问题,本文记录了利用阿里云RDS库表时间点恢复功能进行数据修复的实操过程。通过锁定故障前时间节点,完整恢复数据库及全表数据至新库,重赋账号权限并修改站点配置,最终校验数据量与关联关系恢复正常,实现了不重建实例情况下的精准数据还原。

  • 针对阿里云DMS查询结果集翻页最多支持10000行且传统导出功能生成多个文件的问题,文章介绍了通过“数据导出”工单系统突破限制的方案。该流程包括执行基础SQL查询后创建数据导出工单,将格式设置为CSV并立即执行。最终在主文件夹生成包含全部数据的单个CSV文件,有效解决了大数据集分页限制与合并导出的需求。

  • 针对 WordPress 站点全球访问速度问题,本文记录了使用国内拨测和海外 WebPageTest 进行性能基准测试的过程。测试发现,国内跨运营商延迟较高,而海外节点受限于高延迟和大量请求,LCP 指标未达标。基于分析,文章对比了阿里云 CDN 与 Cloudflare 的优缺点,最终确定以海外加速为主,优先接入 Cloudflare 免费版并计划通过智能 DNS 分流兼顾国内体验。

  • 针对在 Ubuntu 终端连接阿里云 ECS 时频繁输入密码及连接闲置中断的问题,本文分享了在阿里云 ECS 控制台创建并绑定密钥对,以及在本地配置 SSH 客户端和 ServerAliveInterval 参数的完整过程。该方案实现了免密登录与心跳保活,有效解决了输密码繁琐和十分钟无操作导致卡死的困扰,提升了开发体验。

  • 针对基于阿里云ECS和OneinStack环境的WordPress站点出现的504错误,文章记录了排查与优化过程。面对CPU满载和后台响应缓慢,发现PHP-FPM慢日志配置冲突及Nginx超时设置缺失。通过修正PHP-FPM参数为动态模式,调整Nginx超时时间,并开启慢日志监控,最终使CPU使用率回落,站点恢复正常,同时提出了升级硬件和引入CDN等后续建议。

  • 个人博客出现 504 Gateway Timeout,排查发现服务器因恶意扫描和分布式爬虫导致严重过载。内存被过多的 PHP-FPM 进程耗尽,引发负载飙升。通过降低 PHP-FPM 进程数以适配硬件配置,在 Nginx 层面封禁恶意扫描 IP 及爬虫 IP 段,并重启 ECS 清理积压进程,最终解决了资源耗尽问题,恢复了服务正常响应。

👨‍💻 个人品牌

王世强|PHP / Go 技术顾问

15+ 年 Web 后端开发经验,专注于系统维护、架构优化、性能调优及 Linux 运维。

持续运营技术博客 10+ 年,累计发布 1000+ 篇原创技术文章。

为创业团队、中小企业及独立开发者提供长期技术支持与远程合作服务。

👉 关于我 & 合作

.env (14) add (16) AI 翻译 (30) Apache (13) Array (19) A Tour of Go (67) Cache (13) CentOS (23) ChatGPT (20) ChatGPT Plus (15) chrome (19) Cloudflare (33) Codex (22) composer (42) composer.json (22) composer install (13) composer update (14) console (16) Container (25) curl (16) delete (31) Docker (32) Dockerfile (15) EdgeOne (33) environment variable (19) error (24) file (15) filter (20) Git (27) GitHub (23) Gitlab (15) GLM-5.2 (26) Go (61) go-tour-i18n (14) Google AdSense (29) Go 语言 (24) GraphQL (24) GraphQL API (14) Gutenberg (34) http (21) https (22) Interface (19) Jquery (13) json (24) Laravel (37) Laravel 6 (55) Laravel 9 (25) Lighthouse (17) Lighthouse 5 (14) Linux (22) Migrate (13) Module (17) MySQL (78) MySQL 5.7 (22) Nginx (63) normalize.css (28) OKX (15) OneinStack (21) PHP (67) php-fpm (19) php.ini (24) PHP 7.1.12 (22) PHP 7.4 (26) phpmyadmin (15) PhpStorm (24) Polylang (58) postman (18) Query (17) queue (16) Rancher (24) Redis (50) RESTful (27) RESTful API (23) Shopify (19) SlyTranslate (20) SQL (24) String (14) TortoiseGit (14) Twenty Twenty-Five (20) Ubuntu (40) update (20) VPN (17) W3 Total Cache (38) Windows 10 (46) WireGuard (28) WordPress (132) WordPress 多语言 (13) WPCode (23) Wstunnel (15) Yii (40) Yii 2 (70) Yii 2.0 (51) ZgoCloud (13) 多语言网站 (13) 多语言翻译 (35) 技术博客 (15) 故障排查 (15) 数据库迁移 (16) 浏览器 (14) 阿里云 (19)

2026 年 9 月
 123456
78910111213
14151617181920
21222324252627
282930