УЛИКА #01 — Zabbix Queue 170000

Мы разбираем инфраструктуру по фактам: Linux, Zabbix, мониторинг, диагностика и архитектура. От симптома — к проверяемому выводу: что именно доказывает метрика, какие гипотезы остаются и как подтвердить решение. Без догадок там, где можно проверить. Если нужно понимать не только что сделать, но и почему — вам сюда.

Zabbixqueuebottleneck

В очереди Zabbix:

170 000 items

Цифра выглядит как готовый диагноз.
Но пока это только симптом.

Большая Queue говорит о том, что часть проверок не выполняется в ожидаемый срок.
Она не отвечает на главный вопрос:
почему система не успевает?

Причина может находиться в разных местах:

  • pollers;
  • SNMP pollers;
  • unreachable hosts;
  • proxies;
  • preprocessing;
  • database;
  • storage;
  • network latency;
  • timeout;
  • слишком тяжёлых или слишком частых checks;
  • шаблонах и discovery-сценариях.

Поэтому такая логика слишком короткая:

Queue растёт
        ↓
pollers мало
        ↓
увеличиваем StartPollers

Правильнее сначала локализовать задержку:

Queue растёт
        ↓
какие checks опаздывают?
        ↓
какие процессы их обслуживают?
        ↓
какие process types насыщены?
        ↓
есть ли latency / timeout?
        ↓
что изменилось перед появлением проблемы?

Только после этого появляется проверяемая гипотеза о bottleneck.

Главное

Queue = симптом
Queue ≠ root cause

Большая очередь — важная улика.
Но размер очереди сам по себе ещё не говорит, где именно находится причина задержки.

#УликиИнфры #Zabbix #Troubleshooting

Читайте так же