Infrastructure Monitoring: Monitor VPS HealthStatus Uptime
Infrastructure Monitoring คือการเฝ้าระวัง VPS และเซิร์ฟเวอร์ทั้งฝั่ง hardware resource และ service availability เพื่อให้รู้ล่วงหน้าว่าระบบกำลังจะล่ม หรือ…
บทความหมวด Monitoring จากทีม Dot Enterprise · ทั้งหมด 56 บทความ
หมวด Monitoring หนูรวมไว้ 56 บทความค่ะ พิมพ์คำที่อยากรู้ได้เลย หนูจะหาให้เฉพาะในหมวดนี้นะคะ เมี้ยว!
Infrastructure Monitoring คือการเฝ้าระวัง VPS และเซิร์ฟเวอร์ทั้งฝั่ง hardware resource และ service availability เพื่อให้รู้ล่วงหน้าว่าระบบกำลังจะล่ม หรือ…
ปัญหาที่พบบ่อยที่สุดของทีม oncall คือ notification ท่วมท้นจน engineer เริ่มเพิกเฉย ส่วนใหญ่เกิดจากการตั้งเงื่อนไขแจ้งเตือนที่ไม่ actionable — ปลุกคนกลางดึก…
Alertmanager เป็นส่วนประกอบสำคัญของ Prometheus ecosystem ที่ทำหน้าที่รับสัญญาณจาก Prometheus server แล้วจัดการตั้งแต่การ deduplicate, grouping, silencing…
Alert Management เป็นหัวใจของการทำ on-call ที่ดี — แค่ส่งการแจ้งเตือนเข้า email หรือ Slack ยังไม่พอ เพราะเมื่อมีหลาย service หลายทีม notification จะท่วมท้น…
Elastic APM เป็นเครื่องมือ Application Performance Monitoring ที่ทำงานร่วมกับ ELK Stack (Elasticsearch, Kibana, Beats, Logstash) ให้ความสามารถในการเก็บ…
Application Performance Monitoring หรือ APM เป็นหมวดเครื่องมือที่ช่วยให้ทีม DevOps และวิศวกรซอฟต์แวร์ติดตามประสิทธิภาพของแอปพลิเคชันในระดับลึก ทั้งเวลา…
OpenTelemetry (OTel) เป็นมาตรฐาน Observability ที่รวม Traces, Metrics และ Logs ไว้ในเครื่องมือเดียว ก่อนหน้านี้ผู้พัฒนาต้องใช้ SDK หลายตัว เช่น Prometheus…
Jaeger เป็นหนึ่งใน distributed tracing platform ที่ได้รับความนิยมสูงสุดในกลุ่ม cloud-native ด้วยสถาปัตยกรรมที่ยืดหยุ่น รองรับ storage หลายรูปแบบ และมี UI…
ในระบบ microservices หนึ่ง request ของผู้ใช้อาจวิ่งผ่าน service 5-10 ตัวก่อนได้ response กลับ — ถ้าเกิด latency สูงผิดปกติ หรือ error ขึ้นในช่วงใดช่วงหนึ่ง…
Log files เป็นข้อมูลสำคัญที่ช่วยให้ทีม ops และ dev ติดตามปัญหา, debug, และเข้าใจพฤติกรรมของระบบ แต่ในขณะเดียวกันถ้าปล่อยให้ log โตขึ้นเรื่อย ๆ โดยไม่จัดการ…
ในระบบที่ต้องส่ง logs จำนวนมากจากหลายเซิร์ฟเวอร์ไปเก็บที่ Elasticsearch ส่วนกลาง การเขียนสคริปต์ส่งเองหรือใช้ tool หนัก ๆ อย่าง Logstash บนทุกเครื่องไม่ใช่…
เมื่อองค์กรเติบโตจนมี microservices หลักสิบหรือหลักร้อย service กระจายอยู่บนหลายเซิร์ฟเวอร์ การ SSH เข้าไปดู log แต่ละเครื่องทีละตัวเป็นสิ่งที่เป็นไปไม่ได้…