بیشتر قطعی‌هایی که دیدم از کمبود دانش لینوکس نبودند. از نداشتن یک قرارداد مشخص برای تغییر بودند.

#الگوهای تکراری

  1. آپدیت بدون backup قابل برگشت
  2. باز بودن SSH روی پورت ۲۲ با پسورد
  3. لاگ‌هایی که هیچ‌کس نمی‌خواند تا وقتی سرویس می‌خوابد

#چیزی که نگه داشتم

هر تغییر تولیدی باید سه چیز داشته باشد: مسیر برگشت، زمان مشخص برای بررسی، و یک دستور ساده برای فهمیدن وضعیت سرویس.

اگر این سه مورد نباشد، حتی یک تغییر کوچک هم تبدیل به حادثه می‌شود.