Triển khai, quản trị hạ tầng ảo hóa Proxmox VE

I. Giới thiệu khóa học:

Khóa học " Triển khai, quản trị hạ tầng ảo hóa Proxmox VE" được thiết kế trong 5 ngày học (khoảng 35–40 giờ bao gồm lý thuyết và thực hành), giúp người học làm chủ toàn diện nền tảng ảo hóa mã nguồn mở Proxmox Virtual Environment (Proxmox VE) — một giải pháp server virtualization platform kết hợp đầy đủ sức mạnh của KVM hypervisor và LXC container, chạy trực tiếp trên Debian Linux.

Khóa học xoay quanh hai nền tảng công nghệ cốt lõi:

  • KVM (Kernel-based Virtual Machine) — ảo hóa đầy đủ (full virtualization) cho hệ điều hành khách Windows/Linux/BSD.
  • LXC (Linux Containers) — ảo hóa mức hệ điều hành (OS-level virtualization), nhẹ và hiệu năng cao cho workload Linux.

Sau khi hoàn thành, học viên sẽ tự tin vận hành một hạ tầng Proxmox hoàn chỉnh trong doanh nghiệp: từ cài đặt một node đơn, lên cluster đa node, cấu hình High Availability đảm bảo dịch vụ luôn sống, tích hợp Ceph distributed storage, lập chiến lược backup/restore toàn diện và xử lý sự cố trong tình huống thực tế.

II. Thời lượng: 40 giờ (5 ngày)
III. Hình thức đào tạo:

Đào tạo trực tiếp tại lớp học, đào tạo online tương tác với giảng viên, đào tạo kết hợp online và trực tiếp tại lớp học, đào tạo tại văn phòng khách hàng theo yêu cầu

IV.  Mục tiêu khóa học:

Sau khi hoàn thành khóa học, học viên sẽ đạt được các năng lực cụ thể sau:

  1. Cài đặt & khởi tạo: Tự tin tự cài đặt, cấu hình và khởi tạo hệ thống Proxmox VE từ đầu — cả trên phần cứng vật lý và môi trường ảo hóa, bao gồm chuẩn bị hạ tầng Debian, partition ZFS/LVM, đăng ký enterprise/no-subscription repository, và bảo mật node ban đầu.
  2. Migration: Nắm vững kỹ thuật chuyển dịch hệ thống (Migration) mượt mà từ VMware/Hyper-V sang Proxmox bằng nhiều công cụ: qcow2/vmdk conversion, virt-v2v, V2A, bare-metal restore — giữ nguyên dữ liệu, cấu hình mạng và tối thiểu hóa downtime.
  3. Tính năng nâng cao: Cấu hình thành thạo các tính năng nâng cao: Clustering (Corosync/PVE Cluster), High Availability (HA) với fencing & quorum, Live Migration giữa các node mà không gián đoạn dịch vụ.
  4. Storage & Networking: Quản trị tốt hệ thống Lưu trữ (Local/LVM-thin/ZFS, NFS, iSCSI, SAN, Ceph RBD) và Mạng (Linux bridge, VLAN 802.1Q, Open vSwitch, bonding/LACP) trên Proxmox — bao gồm both Datacenter-level và per-VM network.
  5. Backup/Restore & Monitoring: Làm chủ quy trình Sao lưu/Khôi phục (vzdump, Proxmox Backup Server — PBS, deduplication, encryption, replication ZFS) và Giám sát (Monitoring) hệ thống bằng Prometheus + Grafana, Zabbix, pvestatd, cluster log.
  6. Troubleshooting: Khả năng xử lý sự cố (Troubleshooting) nhanh chóng khi hệ thống gặp lỗi: mất quorum, node fence, storage fail, network storm, OOM killer, kernel panic — kèm quy trình root-cause analysis và rollback.
V.  Đối tượng tham gia:

Trung cấp (Intermediate)

Hồ sơ học viên: Đã có kinh nghiệm quản trị hệ thống/mạng (Windows Server, Linux cơ bản), hiểu khái niệm ảo hóa nhưng chưa từng vận hành Proxmox.

Mục tiêu đầu ra chính: Tự cài đặt, cấu hình, vận hành hệ thống Proxmox VE trong môi trường production nhỏ–vừa.

Nâng cao (Advanced)

Hồ sơ học viên: Đã vận hành tốt các nền tảng ảo hóa khác (VMware vSphere, Hyper-V, XenServer), cần tối ưu hiệu năng, cấu hình HA, Clustering và bảo mật chuyên sâu.

Mục tiêu đầu ra chính: Thiết kế và vận hành hạ tầng Proxmox cluster + Ceph + HA ở quy mô doanh nghiệp lớn, tối ưu hiệu năng và bảo mật.

VI.  Điều kiện tiên quyết:

Học viên nên có kiến thức nền tảng sau trước khi tham gia khóa học:

  • Kiến thức Linux cơ bản: dòng lệnh (CLI), quyền file, package manager (apt), quản lý service (systemd).
  • Hiểu khái niệm networking: IP, subnet, gateway, DNS, VLAN, switch L2/L3.
  • Hiểu khái niệm storage: partition, filesystem, LVM, RAID, NFS, iSCSI.
  • Đã từng dùng ít nhất một nền tảng ảo hóa (VMware Workstation/ESXi, Hyper-V, VirtualBox).
  • Tiếng Anh đọc hiểu tài liệu kỹ thuật (tài liệu chính thức của Proxmox bằng tiếng Anh).
VII. Nội dung khóa học:

Ngày 1 — Nền tảng: Cài đặt & Khởi tạo Proxmox VE

Mục tiêu ngày: Học viên tự tay cài đặt một node Proxmox VE hoàn chỉnh trên phần cứng vật lý (hoặc nested), nắm vững kiến trúc, cấu hình mạng và storage cơ bản, tạo được VM và container đầu tiên.

Module 1.1: Tổng quan Proxmox VE

  • Lịch sử, giấy phép (AGPLv3), mô hình subscription enterprise vs no-subscription.
  • Kiến trúc tổng thể: PVE daemon (pvedaemon, pvestatd, pveproxy, pve-cluster), API REST, web GUI noVNC/SPICE.
  • KVM vs LXC: khi nào dùng cái nào; so sánh với VMware ESXi và Hyper-V.
  • Cấu trúc thư mục: /etc/pve (pmxcfs/sqlite cluster fs), /var/lib/vz, /var/lib/pve-cluster.

Module 1.2: Chuẩn bị & Cài đặt

  • Yêu cầu phần cứng: CPU VT-x/AMD-V + EPT/NPT, RAM, disk, NIC, firmware/BIOS settings.
  • Lựa chọn filesystem target: ext4 (đơn giản), LVM (linh hoạt), ZFS (snapshot/RAID-Z — khuyến nghị).
  • Cài đặt từ ISO: partition ZFS mirror (RAID1), swap, boot pool; đặt root password, network (IP tĩnh, gateway, DNS, hostname/FQDN).
  • Sau cài đặt: truy cập https://<IP>:8006, đăng ký repository no-subscription (pve-no-subscription), tắt enterprise repo.
  • Update hệ thống (apt update && apt full-upgrade), cài đặt qemu-guest-agent, đổi port GUI (tùy chọn).

Module 1.3: Web GUI & cấu hình ban đầu

  • Datacenter vs Node: cấp phân cấp cấu hình trong PVE.
  • Cấu hình SSH key, console (noVNC, SPICE, xterm.js), two-factor authentication (TFA) với TOTP.
  • Cài đặt updates qua GUI vs CLI (pveam update, apt).

LAB 1.1 — Cài đặt node Proxmox đầu tiên

  1. Boot ISO Proxmox VE mới nhất trên lab node; cài đặt với ZFS mirror trên 2 SSD.
  2. Cấu hình IP tĩnh, hostname=pve01.lab.local, timezone Asia/Ho_Chi_Minh.
  3. Đăng nhập web GUI, đổi sang no-subscription repo, update toàn bộ gói.
  4. Bật TFA cho root, upload SSH key, kiểm tra console noVNC.

Kết quả mong đợi: 1 node PVE chạy khỏe, web GUI truy cập được, hệ thống up-to-date.

Module 1.4: Networking cơ bản

  • /etc/network/interfaces: cú pháp, bridge vmbr0, SLAAC/static, IPv4/IPv6.
  • Tạo Linux bridge vmbr0 gắn với NIC vật lý, cho VM sử dụng.
  • Cấu hình VLAN cơ bản qua interface (enXs0.10) và bridge VLAN-aware (giới thiệu).
  • MTU 9000 (jumbo frame) cho storage network — giới thiệu để đào sâu Ngày 3.

Module 1.5: Storage cơ bản

  • Các loại storage trong PVE: directory, LVM, LVM-thin, ZFS, NFS, Ceph RBD, iSCSI, PBS, ZFS over iSCSI.
  • Phân biệt image disk format: raw, qcow2, vmdk; khi nào dùng cái nào.
  • Thêm storage Local (directory) và LVM-thin; mount NFS share từ NAS.
  • Storage tiering: nơi lưu ISO/template/backup/snippets vs nơi lưu disk VM.

Module 1.6: Tạo VM và Container đầu tiên

  • Upload ISO Ubuntu Server / Debian / Windows Server 2019/2022.
  • Tạo VM KVM: CPU type (host vs kvm64), memory balloon, virtio-scsi, virtio-net, EFI disk, QEMU Guest Agent.
  • Tạo LXC container từ template Debian/Ubuntu; bind-mount thư mục; ưu tiên LXC cho workload Linux nhẹ.
  • Bật balloon, auto-start, start-at-boot; xem log /var/log/syslog và pvedaemon.

LAB 1.2 — Triển khai workload đầu tiên

  1. Tạo VM 100 (Ubuntu Server) với 4 vCPU, 4GB RAM, 40GB disk (virtio-scsi single, LVM-thin).
  2. Tạo LXC 200 (Debian) với 2 vCPU, 1GB RAM, 8GB disk; cài nginx làm web server lab.
  3. Cấu hình cả 2 auto-start, bật QEMU Guest Agent, kiểm tra IP DHCP.
  4. Snapshot thủ công cả 2; khởi động lại node và xác nhận tự động start đúng thứ tự.

Kết quả mong đợi: 1 VM Linux + 1 LXC web server chạy khỏe sau reboot node.

Tổng kết Ngày 1 & Q&A

  • Recap các khái niệm: cluster fs pmxcfs, virtio drivers, ZFS basics.
  • Preview Ngày 2: snapshots, clone, template, storage nâng cao.
  • Phân tích nhanh các vấn đề học viên gặp trong lab.

Ngày 2 — Máy ảo, Container & Quản trị Lưu trữ

Mục tiêu ngày: Đi sâu vào vận hành VM/CT (snapshot, clone, template, cloud-init), quản trị toàn diện các loại storage phổ biến (LVM, ZFS, NFS, iSCSI, Ceph RBD giới thiệu).

Module 2.1: KVM nâng cao

  • CPU types: host (best perf, mất migration cross-CPU), x86-64-v2/AES (bảo mật+perf), kvm64 (compatible).
  • Memory: balloon driver, memory hot-plug, hugepages cho DB workload.
  • Disk: virtio-scsi single vs scsi; cache mode (none/writeback/writethrough/unsafe); discard/TRIM; SSD emulation; I/O thread.
  • Network: virtio-net, multiqueue, MAC filter, rate limit.
  • Bảo mật: QEMU version pinning, machine type (pc/q35), Secure Boot + TPM v2.0 cho Windows 11.

Module 2.2: LXC container nâng cao

  • LXC vs VM: đặc quyền (privileged vs unprivileged), id-mapping, security profile.
  • Resource limits (cgroups v2): CPU, memory, swap, I/O.
  • Mount: bind mount, volume mount; networking veth + bridge.
  • Khi nào KHÔNG dùng LXC: workload cần kernel module riêng, systemd version mismatch, app Windows.

Module 2.3: Snapshot, Clone, Template & Cloud-init

  • Snapshot: internal vs external; ZFS/LVM-thin/RBD hỗ trợ snapshot tức thì; vmstate snapshot (RAM) cho live snapshot.
  • Clone: full clone vs linked clone; tree của snapshot.
  • Convert VM thành template; template deploy nhanh nhiều instance.
  • Cloud-init: tạo cloud-init image Ubuntu/Debian; đặt hostname, SSH key, network, user-data; deploy VM chỉ trong vài giây.

LAB 2.1 — Cloud-init golden image

  1. Download Ubuntu cloud image (qcow2) về storage; tạo VM 300 dùng cloud-init drive.
  2. Cấu hình cloud-init: user=ops, SSH key, IP tĩnh, hostname tự sinh.
  3. Convert VM 300 thành template.
  4. Clone 3 VM (web1/2/3) từ template; verify SSH login bằng key (không cần password).

Kết quả mong đợi: Workflow triển khai VM tự động < 30s/máy bằng cloud-init.

Module 2.4: ZFS on Proxmox

  • ZFS concepts: pool, vdev, mirror/RAIDZ1/2/3, dataset, snapshot, clone, send/receive.
  • Tạo ZFS pool trên Proxmox; ZFS dataset cho VM disk; compression (lz4/zstd); atime off.
  • ARC/L2ARC/SLOG: tối ưu cache ZFS; SLOG (ZIL) trên SSD/NVMe cho sync write.
  • ZFS send/receive để backup offsite; zfs-auto-snapshot cho snapshot định kỳ.
  • Quan trọng: scrub định kỳ, smartd, monitoring pool health.

Module 2.5: NFS, iSCSI, SAN

  • NFS: mount NFS share, dùng cho ISO/backup/template; locking và hiệu năng.
  • iSCSI: cấu hình target (tgt/targetcli), initiator PVE, LUN, dùng với LVM để có thin provisioning.
  • SAN Fiber Channel (giới thiệu): zoning, LUN masking, multipath (mpath).
  • ZFS over iSCSI: export ZFS volume qua iSCSI cho nhiều PVE node.

Module 2.6: Ceph RBD giới thiệu

  • Ceph là gì: distributed object store, RADOS, RBD, CephFS, RGW.
  • Lợi ích Ceph trên Proxmox: thin provisioning, snapshot, live migration, no single point of failure.
  • Chi tiết triển khai Ceph cluster dành cho Ngày 4.

LAB 2.2 — ZFS pool + snapshot automation

  1. Tạo ZFS pool rpool-vm từ 2 SSD spare ở mirror; tạo dataset vm-disks với lz4 + atime=off.
  2. Di chuyển VM 100 sang pool mới; chạy fio benchmark (randread 4k, randwrite 4k).
  3. Cài zfs-auto-snapshot: snapshot mỗi 15 phút, giữ 4 bản; verify snapshot tree.
  4. Thực hiện zfs send | receive một dataset sang backup disk ngoài để mô phỏng offsite backup.

Kết quả mong đợi: Hiểu vòng đời snapshot ZFS + cơ chế backup dựa trên snapshot.

Tổng kết Ngày 2 & Q&A

  • Recap: virtio tuning, cloud-init, ZFS internals.
  • Preview Ngày 3: networking nâng cao (VLAN, OVS, bonding) và migration VMware/Hyper-V.

Ngày 3 — Mạng nâng cao & Chuyển dịch hệ thống (Migration)

Mục tiêu ngày: Làm chủ kiến trúc mạng Proxmox cho datacenter thật (VLAN-aware bridge, OVS, bonding/LACP, multi-NIC). Thành thạo chuyển dịch workload từ VMware vSphere, Hyper-V và server vật lý sang Proxmox.

Module 3.1: Linux Bridge VLAN-aware

  • VLAN-aware bridge (vmbr0 vlan-aware yes): một bridge duy nhất cho nhiều VLAN.
  • Cấu hình trunk port, access port; gán VLAN tag cho VM/CT (net0 tag=10).
  • DHCP/DHCPv6/SLAAC trên từng VLAN; firewall per-VLAN (giới thiệu).

Module 3.2: Open vSwitch (OVS)

  • Khi nào dùng OVS: SDN, tunnel (VXLAN/GRE), OpenFlow, integration SDN controller.
  • Tạo OVS bridge, OVS IntPort, OVS Bond; so sánh với Linux bridge về hiệu năng.
  • Bài toán: chọn Linux bridge vs OVS cho datacenter của bạn.

Module 3.3: Bonding, LACP & Multi-NIC

  • Bonding modes: active-backup, balance-tlb, balance-alb, 802.3ad (LACP — cần switch).
  • Cấu hình LACP bond trên Proxmox + switch LACP; mii-monitor, lacp-rate.
  • Network design: management network, storage network (jumbo frame), migration network, cluster (Corosync) network — tách vật lý/VLAN.
  • PVE SDN (Software Defined Network) plugin — giới thiệu: VNet, Zone, Subnet, IPAM.

Module 3.4: PVE Firewall

  • 3 cấp firewall: Datacenter → Node → VM/CT; quy tắc kế thừa.
  • Cấu hình rules IN/OUT; IPSet, Alias; bật firewall per-VM NIC.
  • Lưu ý: không tự lock mình ra khỏi node (cho phép SSH/web GUI từ management subnet).

LAB 3.1 — Multi-VLAN + bonding

  1. Cấu hình bonding mode=802.3ad trên 2 NIC (hoặc active-backup trong nested lab).
  2. Tạo vmbr0 VLAN-aware trunk; cho phép VLAN 10,20,30.
  3. Tạo 3 VM/CT: VM A VLAN10, VM B VLAN20, VM C VLAN30; verify không ping xuyên VLAN.
  4. Bật PVE Firewall tại Datacenter; chặn port 22 trên VM B và verify ssh fail.

Kết quả mong đợi: Mô hình mạng doanh nghiệp nhỏ hoàn chỉnh trên 1 node.

Module 3.5: Tổng quan chiến lược migration

  • Đánh giá (assessment): danh mục VM, dependency, storage size, licensing.
  • Các phương án migration: cold migration, warm migration, near-zero-downtime, re-platform.
  • Rủi ro và giảm thiểu: MAC change, virtio driver, licensing Windows OEM, driver DB, IP change.

Module 3.6: Migration từ VMware vSphere/ESXi

  • Cách 1 — Offline: export OVA/OVF → convert sang qcow2 (qemu-img convert) → import vào PVE.
  • Cách 2 — virt-v2v: chuyển Windows/Linux VM từ ESXi trực tiếp sang libvirt/PVE; tự thay driver.
  • Cách 3 — StarWind V2V Converter / V2A: GUI tool chuyển VMDK → qcow2/img, hỗ trợ ESXi trực tiếp.
  • Xử lý VMware Tools: gỡ bỏ, cài qemu-guest-agent; đề phòng service không start.
  • Lưu ý Windows: sysprep không cần nếu giữ cấu hình; activation có thể mất (rearm).

Module 3.7: Migration từ Microsoft Hyper-V

  • Export VHDX → convert sang qcow2 (qemu-img convert -O qcow2 file.vhdx file.qcow2).
  • Hoặc StarWind V2V Converter trực tiếp từ Hyper-V host.
  • Đổi controller disk từ IDE sang virtio-scsi; network từ Hyper-V vSwitch sang virtio-net.
  • Tương thích Windows guest: cài virtio-win ISO (Fedora) trước khi migration để có driver sẵn.

Module 3.8: P2V — Physical to Virtual

  • Clonezilla / Rescuezilla: boot ISO trên server vật lý, capture disk → image → restore vào VM.
  • Bản Windows: Sysprep + disk2vhd (Microsoft); Linux: dd/rsync sang block device.
  • Cập nhật driver, fstab (UUID), network config, reinstall bootloader (grub).

LAB 3.2 — Migration thực chiến

PHẦN A — VMware → Proxmox:

  1. Trên ESXi lab: tạo 1 VM Windows Server + 1 VM Debian; cài đặt workload đơn giản (IIS/nginx).
  2. Export sang OVA; dùng qemu-img convert → qcow2; import vào PVE.
  3. Cài qemu-guest-agent; gỡ VMware Tools; verify dịch vụ vẫn chạy.

PHẦN B — Hyper-V → Proxmox:

  1. Trên Hyper-V lab: export VHDX; convert sang qcow2.
  2. Import vào PVE, đổi controller sang virtio-scsi (cài virtio-win trước đó), boot & verify.

PHẦN C — P2V:

  1. Demo Clonezilla capture 1 phân vùng → restore vào VM mới; fix grub & fstab.

Kết quả mong đợi: 3 workload từ 3 nguồn khác nhau chạy khỏe trên Proxmox.

Tổng kết Ngày 3 & Q&A

  • Recap: VLAN-aware bridge, bonding, migration tooling.
  • Preview Ngày 4: Cluster + HA + Ceph — vượt ra ngoài 1 node đơn.

Ngày 4 — Clustering, High Availability & Ceph

Mục tiêu ngày: Nâng cấp hạ tầng từ 1 node lên cluster đa node với High Availability (đảm bảo VM tự khởi động lại khi node chết) và Ceph distributed storage — đây là phần cốt lõi cho học viên Advanced.

Module 4.1: Proxmox Cluster architecture

  • Cluster concept: nhiều node PVE hợp nhất thành 1 quản lý; /etc/pve đồng bộ qua pmxcfs (sqlite + Corosync).
  • Thành phần: Corosync Cluster Engine (token ring messaging), Kronos (votequorum), PVE Cluster daemon (pvecm).
  • Quorum: số node vote > N/2; split-brain; vote weight; witness node (QDevice).
  • Yêu cầu cluster: hostname unique, time sync (chrony), SSH key cross-node, network dự phòng.

Module 4.2: Tạo cluster & join node

  • Trên node 1: Datacenter → Cluster → Create Cluster; lưu join information.
  • Trên node 2, 3: Cluster → Join Cluster; nhập join info + root password.
  • Verify: pvecm status, pvecm nodes, /etc/pve/corosync.conf.
  • Best practice: cluster network riêng (10GbE dedicated); Corosync over separate VLAN/subnet.

Module 4.3: Live Migration & Storage Migration

  • Live Migration: chuyển VM đang chạy từ node A → B mà không downtime (cần shared storage hoặc storage replication).
  • Storage Migration: di chuyển disk VM giữa các storage (local → shared, hoặc local ↔ local).
  • Cơ chế: pre-copy RAM iteration + stop-and-copy cuối; downtime ~ 100–500ms.
  • Yêu cầu: CPU compatible (đặc biệt nếu CPU khác gen), shared storage hoặc ZFS replication.

LAB 4.1 — Dựng cluster 3 node + Live Migration

  1. Chuẩn bị 3 node PVE (pve01, pve02, pve03) trên lab; sync time bằng chrony.
  2. Tạo cluster lab-cluster trên pve01; join pve02 và pve03.
  3. Verify quorum 3 vote; pvecm status; kiểm tra web GUI thấy 3 node.
  4. Add storage shared (NFS) cho cả 3 node; tạo VM 400 trên pve01.
  5. Live migrate VM 400 pve01 → pve02; đo downtime bằng ping liên tục.
  6. Storage migrate disk VM 400 từ NFS sang local ZFS (offline storage migration).

Kết quả mong đợi: Cluster 3 node khỏe; live migration downtime < 500ms.

Module 4.4: High Availability (HA) trên Proxmox

  • Mục tiêu HA: VM/CT tự động khởi động lại trên node khác khi node bị mất (hardware failure).
  • Yêu cầu HA bắt buộc: cluster ≥ 3 node, shared storage (Ceph RBD khuyến nghị), quorum ổn định.
  • Thành phần: pve-ha-crm (resource manager), pve-ha-lrm (local resource manager), watchdog timer (hardware/software).
  • HA Group: tập node ưu tiên cho VM; HA restart policy (cold/migrate/atomic).
  • Fencing: khi node mất quorum → self-fence (reboot) nhờ watchdog; đảm bảo không 2 node cùng chạy 1 VM.
  • Rủi ro HA & mitigation: storage lock, stale lock, split-brain; cách khôi phục thủ công.

Module 4.5: Ceph Cluster trên Proxmox

  • Kiến trúc Ceph: Monitor (MON), OSD (Object Storage Daemon), Manager (MGR), MDS (cho CephFS).
  • Placement Group (PG), CRUSH map, replication size (thường size=3 min_size=2).
  • Triển khai Ceph qua PVE GUI: Ceph → Install; tạo MON trên 3 node; add OSD từ raw disk.
  • Tạo Ceph pool rbd-pool; add vào PVE storage type 'RBD'; thin provisioning tự động.
  • Ceph BlueStore vs FileStore; WAL/DB trên SSD riêng; crush device class (ssd vs hdd).
  • Tối ưu: pg_num autoscaler, ceph balancer (upmap), PG ratio per OSD, recovery tuning.
  • Monitoring Ceph: ceph -s, ceph osd df, ceph df, PVE Ceph dashboard.

LAB 4.2 — HA + Ceph end-to-end

PHẦN A — Ceph:

  1. Trên cluster 3 node: cài Ceph (Nautilus/Reef) qua PVE GUI; tạo MON trên 3 node.
  2. Add 2 OSD/node từ raw disk (hoặc LV; không dùng OS disk).
  3. Tạo pool rbd-vm size=3 min_size=2; add làm storage RBD trong PVE.
  4. Tạo VM 500 với disk trên rbd-vm; verify disk thin-provisioned.

PHẦN B — HA:

  1. Tạo HA group ha-grp1 gồm pve01,pve02,pve03.
  2. Add VM 500 vào HA với restart policy=migrate.
  3. SIMULATE FAILURE: kill -9 pve-ha-lrm / poweroff cứng pve01.
  4. Quan sát VM 500 tự restart trên pve02/pve03 trong < 2 phút.
  5. Khôi phục pve01; verify cluster rejoin và HA status back to normal.

Kết quả mong đợi: Hạ tầng cluster+Ceph+HA hoàn chỉnh, chịu được failure 1 node.

Tổng kết Ngày 4 & Q&A

  • Recap: quorum, fencing, CRUSH, replication factor.
  • Preview Ngày 5: Backup/Restore (PBS), Monitoring, Security, Troubleshooting.

Ngày 5 — Backup, Monitoring, Bảo mật & Troubleshooting

Mục tiêu ngày: Đóng gói toàn bộ vòng đời vận hành Proxmox: backup/restore với PBS, monitoring toàn diện, hardening bảo mật, performance tuning và workshop troubleshooting thực chiến.

Module 5.1: vzdump & Backup cơ bản

  • vzdump: backup VM/CT thành file .vma.zst / .pbs.didx; modes: stop, suspend, snapshot.
  • Backup schedule (jobs) ở Datacenter → Backup; retention policy (keep-last, keep-daily, keep-weekly...).
  • Restore: full restore vs file-level restore (chỉ với PBS).

Module 5.2: Proxmox Backup Server (PBS)

  • PBS là gì: deduplication backup server riêng; tiết kiệm 90%+ dung lượng cho backup hằng ngày.
  • Kiến trúc PBS: datastore, chunk store, namespace, tape backup (tùy chọn).
  • Cài đặt PBS (separate server hoặc VM); add PBS vào PVE làm Storage type 'PBS'.
  • Backup encryption (client-side AES-256); key management; prune & garbage collection.
  • Verification job: kiểm tra integrity backup định kỳ; restore test (rảnh rỗi thì test).
  • Tape backup cho archival dài hạn (LTO); tape pool, media set.

Module 5.3: ZFS Replication & pvesr

  • ZFS replication: async replicate dataset sang node khác bằng zfs send/receive định kỳ.
  • pvesr (PVE Storage Replication): cron-like schedule (mỗi 1–15 phút); cho HA without shared storage.
  • Trade-off: ZFS replication không phải shared storage thật — VM phải restart khi failover.

LAB 5.1 — PBS + replication

  1. Triển khai PBS như một VM riêng trong cluster; add làm storage PBS.
  2. Cấu hình backup job hằng giờ cho VM 400 & 500; retention keep-last=5, keep-daily=7.
  3. Verify dedup ratio sau 3 lần backup liên tiếp (cùng template).
  4. Bật encryption; backup 1 VM; restore sang VM mới và verify dữ liệu.
  5. Cấu hình pvesr: replicate VM 100 từ pve01 → pve02 mỗi 5 phút; verify RPO.

Kết quả mong đợi: Có 3 lớp backup (vzdump, PBS, ZFS replication) cho workload production.

Module 5.4: Monitoring với Prometheus + Grafana

  • Cài pve-exporter (node_exporter + pve_exporter) trên mỗi node PVE.
  • Prometheus scrape config; Grafana dashboard Proxmox VE official (dashboard ID 10347).
  • Metrics quan trọng: CPU per-VM, memory balloon, disk latency (await), network throughput, Ceph ops/sec, iostat.
  • Alerting: Alertmanager + PagerDuty/Slack/Telegram; cảnh báo disk full, quorum lost, Ceph degraded.
  • Thay thế: Zabbix agent 2 + Zabbix template Proxmox; Check_MK; NetData.

Module 5.5: Security hardening

  • IAM: tạo user riêng (realm PAM/OpenID/LDAP), role-based access control (RBAC), pool/tenant isolation.
  • MFA bắt buộc (TOTP + WebAuthn/YubiKey) cho admin.
  • TLS: đổi certificate web GUI sang Let's Encrypt (acme.sh) hoặc internal CA; TLS 1.3 only.
  • PVE Firewall full mesh: chỉ mở port cần thiết (8006, 22/SSH restricted, Corosync, Ceph internal).
  • Ceph: cephx authentication, network isolation, OSD encryption (dmcrypt).
  • Audit log: /var/log/audit, pveproxy access log; forward sang SIEM (Wazuh, ELK).
  • Kernel hardening: AppArmor, KSPP, không cho module unload, secure boot.

Module 5.6: Performance tuning

  • CPU pinning & NUMA cho workload HPC/DB; cpufreq governor 'performance'.
  • Memory: hugepages, KSM (cân nhắc tắt cho security), swapiness.
  • Disk I/O: scheduler (none/mq-deadline), virtio-scsi + iothread, cache mode chọn đúng workload.
  • Network: multiqueue virtio-net, SR-IOV (nếu NIC hỗ trợ), jumbo frame storage net.
  • Benchmark bằng fio, iperf3, stress-ng trước/sau tuning.

Module 5.7: Troubleshooting workshop

Workshop xử lý sự cố — giảng viên sẽ mô phỏng các tình huống thật, học viên phải root cause và fix:

  • Case 1 — Mất quorum cluster: chỉ 1 node sống, không thể thao tác GUI; fix bằng pvecm expected 1 (emergency mode) và khôi phục cluster.
  • Case 2 — Node fence liên tục: watchdog reboot; debug corosync latency, network storm.
  • Case 3 — Ceph degraded + slow requests: 1 OSD chết, rebalance chậm; tune recovery, add OSD.
  • Case 4 — VM không boot sau snapshot rollback: qcow2 corrupt, ZFS snapshot inconsistency.
  • Case 5 — OOM killer giết QEMU: memory overcommit quá cao; giải pháp balloon + reserve.
  • Case 6 — Performance degradation sau migration: CPU mismatch, virtio chưa được cài.
  • Công cụ debug: journalctl, dmesg, pveperf, pve-firewall, ceph log, /etc/pve, qm/ pct commands.

LAB 5.2 — Capstone workshop

Học viên chia nhóm, mỗi nhóm nhận 1 tình huống sự cố ngẫu nhiên (từ Module 5.7) trên môi trường lab.

  1. Đọc log, thu thập symptoms.
  2. Đề xuất ≥ 2 hypothesis về root cause.
  3. Verify hypothesis bằng công cụ phù hợp.
  4. Áp dụng fix tối thiểu, verify system phục hồi.
  5. Trình bày root cause + lesson learned (5 phút/nhóm).

Kết quả mong đợi: Học viên tự tin ứng phó ≥ 80% sự cố production thường gặp.

Tổng kết khóa học & Next steps

  • Recap toàn bộ 6 Learning Outcomes
  • Đánh giá học viên: quiz cuối khóa + bài tập capstone.
  • Lộ trình tiếp theo: tham gia forum.proxmox.com, Proxmox VE Admin Guide, Proxmox Certified Engineer (sát hạch Proxmox).
  • Khuyến nghị: thiết lập 1 cluster PVE + Ceph + PBS trong môi trường thật trong vòng 1 tháng sau khóa học.
  • Học trực tuyến

  • Học tại Hồ Chí Minh

  • Học tại Hà Nội


Các khóa học khác