Кейс

Proxmox: умер диск в «почти RAID», виртуальные машины на local-lvm

Узел из трёх дисков, mdadm «на глаз», VM на local-lvm. Один диск ушёл в failed, гости начали сыпать I/O errors. Кластера не было — был один хост в серверной.

  • Небольшая производственная площадка, ~25 ВМ, МО
  • Срок: 36 часов до штатной нагрузки
  • Стек: Proxmox VE, LVM, qcow2, Windows/Linux guests

Исходное состояние

Что было на площадке

Хост Proxmox 8, VM крутились с local-lvm. Зеркало собрали «когда ставили», документации нет. SMART одного диска давно орал, мониторинг смотрел только ping узла.

После ребута по питанию диск не поднялся. Часть VM стартовала в read-only, 1С на госте начала откатывать транзакции. Бэкап vzdump писал на тот же узел в каталог, который тоже сидел на пострадавшей VG.

Рамки

Ограничения и задача

  • Второго узла Proxmox нет, live-миграция некуда.
  • Складские терминалы завязаны на одну VM с SQL.
  • Нельзя «просто mdadm --force»: риск добить второй диск.
  • Лицензии Windows на гостях — OEM-след, клоны нужно делать аккуратно.

Работы

Что сделали

  1. Остановили гостей с ошибками I/O, сняли smartctl и dmesg, пометили диск failed, не пытаясь «починить fsck на горячую».
  2. Вынесли vzdump последних удачных архивов на USB-диск и отдельный NAS, пока второй диск ещё читался.
  3. Собрали новый узел на нормальном RAID1/ZFS mirror с отдельным boot, перенесли VM через backup+restore, не через копирование сырых lv «на всякий случай».
  4. Проверили гостей: Windows — chkdsk в снапшоте не делали на бою; Linux — fsck на копии. 1С прогнали тест перепроведения.
  5. Включили SMART и свободное место VG в Zabbix, расписание vzdump — на другое хранилище, retention с проверкой restore одной VM в месяц.

Факт

Результат

  • Простой склада — одну смену. Данные SQL целы: последний удачный vzdump был за 11 часов до отказа, плюс логи SQL.
  • Хранение VM больше не на «диске, который ещё не умер».
  • Появился регламент: нет мониторинга дисков — нет права считать хост боевым.

Практика

Выводы

  • local-lvm на одном узле без внешнего backup — это один диск между вами и простоем бизнеса.
  • Ping гипервизора зелёный, пока контроллер ещё отвечает. Диски умирают тише.
  • Restore VM нужно прогонять до инцидента: в ночь отказа вы не хотите узнавать, что архив битый.

Стек

Технологии в этом кейсе

  • Proxmox VE
  • LVM
  • vzdump
  • Zabbix
  • SMART

Практика

Материалы по теме

Перелинковка

Связанные услуги

Соседние направления, которые обычно закрывают зависимости и усиливают результат выбранной услуги.

Услуга

Обслуживание Proxmox

Поддерживаем узлы Proxmox VE, виртуальные машины, хранилища и сетевую конфигурацию с обязательным планом отката изменений.

Подробнее

Услуга

Мониторинг серверов

Настраиваем наблюдаемость для доступности, ресурсов, сервисов и резервного копирования, исключая поток бесполезных тревог.

Подробнее

Консультация

Разбрать похожую ситуацию

Опишите инфраструктуру и ожидаемый результат. Уточним вводные и предложим следующий практический шаг.