Skip to content

docs(redis): 7편 replication, failover, slowlog, monitoring 운영 실험 #154

Description

@devy1540

상위 이슈

목적

Redis를 운영할 때 필요한 관측 지표를 해석하고, 장애 분석 시 무엇을 먼저 봐야 하는지 정리한다.

토폴로지(단일/Sentinel/Cluster), 리더 승격, failover 시 데이터 정합성, "죽었을 때" 대처는 #168(HA·토폴로지편)에서 다룬다. 이 편은 관측/모니터링에 집중한다.

다룰 질문

  • replica lag는 INFO replication으로 어떻게 관측하고, 어느 정도면 위험 신호인가?
  • slowlog는 언제 봐야 하고 결과를 어떻게 해석하는가?
  • Redis에서 CPU, memory, connected_clients, keyspace hit ratio를 어떻게 해석하는가?
  • INFO stats / INFO commandstats에서 무엇을 읽어야 하는가?
  • 운영 알람은 어떤 지표를 기준으로 걸어야 하는가?

실험 산출물

  • local replication 구성 기록
  • replica lag 관찰 기록
  • SLOWLOG GET, INFO stats, INFO replication, INFO commandstats 결과
  • 운영 알람 후보 지표표

완료 조건

  • 장애 분석 시 먼저 볼 Redis 지표를 정리한다.
  • 각 지표(replica lag, hit ratio, connected_clients 등)의 정상/위험 기준을 설명한다.
  • 운영 알람 후보 지표표를 완성한다.

다음 세션 시작 지점

INFO/slowlog 결과와 알람 후보 지표를 먼저 확인한다.

Metadata

Metadata

Assignees

No one assigned

    Labels

    area: blogBlog listing, post rendering, search, tags, or seriesarea: contentBlog post content changesdocumentationImprovements or additions to documentationtrack: redisRedis learning and mastery tracktype: experimentHands-on experiment or verification task

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions