Tại VietITPro, mỗi tuần chúng tôi tiếp nhận hàng chục trường hợp khách hàng mất sạch dữ liệu quan trọng chỉ vì ổ cứng "đột tử" mà không có dấu hiệu báo trước. Thực tế, ổ cứng không bao giờ chết bất ngờ; nó luôn phát đi những tín hiệu cảnh báo thông qua bảng thông số S.M.A.R.T (Self-Monitoring, Analysis, and Reporting Technology). Bài viết này sẽ hướng dẫn bạn cách đọc vị những con số này bằng công cụ CrystalDiskInfo, phân biệt đâu là ngưỡng an toàn và đâu là lúc bạn cần sao lưu dữ liệu ngay lập tức.
S.M.A.R.T là gì và tại sao CrystalDiskInfo lại là "tiêu chuẩn vàng"?
S.M.A.R.T là hệ thống giám sát tích hợp trong firmware của mọi ổ cứng HDD và SSD hiện đại. Nó theo dõi hàng trăm thông số về hiệu suất, lỗi đọc/ghi, nhiệt độ và độ bền cơ học.
CrystalDiskInfo (CDI) không tự tạo ra thông số, nó chỉ là một trình thông dịch (interpreter) đọc dữ liệu thô (Raw Data) từ controller của ổ cứng và hiển thị nó dưới dạng bảng biểu dễ hiểu. Điểm mạnh của CDI là khả năng đọc được cả các thông số ẩn mà Windows Disk Management không hiển thị, đồng thời hỗ trợ xuất log chi tiết cho các kỹ thuật viên phân tích sâu hơn.
Cách cài đặt và thiết lập chuẩn kỹ thuật
Để có cái nhìn chính xác nhất, hãy tải phiên bản Portable từ trang chủ chính thức của Crystal Dew World.
1. Thiết lập cập nhật thời gian thực: Sau khi mở phần mềm, hãy vào menu Function -> Resident (chọn cả "Resident" và "Startup") để phần mềm luôn chạy ngầm và cảnh báo ngay khi ổ cứng có dấu hiệu bất thường.
2. Thiết lập ngưỡng cảnh báo: Vào Function -> Advanced Feature -> Alarm Setting. Tại đây, hãy chọn các thông số quan trọng (như Reallocated Sectors Count, Current Pending Sector Count) để phần mềm phát ra âm thanh cảnh báo ngay khi giá trị vượt ngưỡng.
Giải mã các thông số S.M.A.R.T quan trọng trên HDD
HDD là thiết bị cơ học, do đó các thông số S.M.A.R.T tập trung nhiều vào độ bền của đầu đọc và đĩa từ. Nếu thấy các ID sau đây thay đổi, hãy cẩn trọng:
05: Reallocated Sectors Count (Số lượng sector được tái định vị)
Đây là thông số nguy hiểm nhất. Khi bề mặt đĩa từ bị xước hoặc lỗi từ tính, ổ cứng sẽ không thể đọc/ghi vào đó. Controller sẽ đánh dấu sector đó là "hỏng" và thay thế bằng các sector dự phòng trong vùng Spare Area.
- Dấu hiệu: Nếu Raw Data > 0, ổ cứng đã bắt đầu quá trình "tự hủy".
- Quyết định: Sao lưu ngay lập tức. Nếu con số này tăng dần theo thời gian, đó là bằng chứng thép cho việc ổ cứng sắp hỏng hoàn toàn.
0A: Spin Retry Count (Số lần thử khởi động lại động cơ)
Thông số này chỉ ra rằng động cơ quay đĩa không đạt được tốc độ vòng quay tiêu chuẩn (ví dụ 5400 hoặc 7200 RPM) trong lần thử đầu tiên.
- Nguyên nhân: Thường do lỗi cơ khí, bạc đạn bị khô dầu hoặc nguồn cấp (dây SATA/nguồn PSU) không ổn định.
- Hành động: Kiểm tra lại nguồn cấp điện trước, nếu vẫn lỗi thì ổ cứng đã bị xuống cấp phần cơ.
C5: Current Pending Sector Count
Đây là các sector "chờ xử lý". Chúng là các sector mà ổ cứng nghi ngờ bị lỗi (không đọc được dữ liệu). Nó chưa được thay thế ngay vì ổ cứng đang đợi ghi lại dữ liệu vào đó xem lỗi có biến mất hay không.
- Kinh nghiệm thực tế: Đây là "báo động đỏ". Nếu bạn để máy chạy tiếp, các sector này sẽ chuyển thành 05 (Reallocated Sectors).
C6: Uncorrectable Sector Count
Số lượng sector lỗi mà ngay cả thuật toán sửa lỗi phần cứng (ECC) cũng không thể khôi phục. Dữ liệu nằm ở các sector này coi như đã mất.
Giải mã các thông số S.M.A.R.T quan trọng trên SSD
SSD không có linh kiện cơ học, vì vậy các thông số tập trung vào độ bền của các chip nhớ NAND Flash và Controller.
05: Reallocated NAND Block Count
Tương tự như HDD, nhưng thay vì sector từ tính, đây là các block nhớ NAND Flash bị hỏng. SSD có một lượng block dự phòng (Over-provisioning). Khi con số này tăng, nghĩa là SSD đang "ăn mòn" vùng dự phòng của nó.
B1: Wear Leveling Count
Đây là thông số sống còn của SSD. Nó cho biết mức độ "lão hóa" của các chip nhớ. Thông thường, giá trị này sẽ giảm dần từ 100 xuống 1. Khi con số này xuống thấp (dưới 10-20), SSD sắp hết tuổi thọ ghi.
E8: Available Reserved Space
Đây là phần trăm dung lượng dự phòng còn lại của SSD. Nếu con số này giảm mạnh, SSD đã ghi quá nhiều dữ liệu và các cell nhớ đang chết dần.
F1/F2: Total Host Writes / Reads
Tổng dung lượng đã ghi/đọc. Dựa vào thông số này và TBW (Total Bytes Written) ghi trên datasheet của nhà sản xuất, bạn có thể tính toán được thời gian sống sót còn lại của SSD.
Bảng đối chiếu tình trạng sức khỏe (Health Status) trong CrystalDiskInfo
Quy trình kiểm tra thực tế của kỹ thuật viên VietITPro
Khi một khách hàng mang máy đến với tình trạng máy chạy chậm, treo hoặc "đơ" chuột, đây là các bước chúng tôi thực hiện:
1. Kiểm tra Physical Connection: Không bao giờ tin tưởng hoàn toàn vào phần mềm. Chúng tôi kiểm tra cáp SATA/cáp nguồn trước. Một sợi cáp SATA kém chất lượng có thể gây ra lỗi C7: UltraDMA CRC Error Count. Nếu con số này tăng, hãy thay cáp ngay trước khi kết luận ổ cứng hỏng.
2. Đọc log chi tiết: Trong CrystalDiskInfo, chọn Edit -> Copy để lấy log chi tiết. Chúng tôi chú ý đặc biệt đến các giá trị Raw Data. Lưu ý: Một số hãng như Samsung hay Intel hiển thị giá trị Raw Data dưới dạng Hex (hệ 16), bạn cần chuyển sang Decimal (hệ 10) để hiểu chính xác số lượng sector lỗi.
3. Stress Test: Sau khi đọc S.M.A.R.T, nếu vẫn nghi ngờ, chúng tôi sử dụng phần mềm Victoria hoặc HDDScan để thực hiện lệnh "Read Test" bề mặt. Nếu xuất hiện các block có thời gian phản hồi > 500ms hoặc các block đỏ (Error), ổ cứng đó đã không còn an toàn để chứa dữ liệu quan trọng.
Các câu hỏi thường gặp (FAQ)
1. Tại sao ổ cứng vẫn báo "Good" nhưng máy vẫn bị treo?
Có thể do lỗi Controller trên ổ cứng không tự nhận diện được lỗi phần mềm (firmware bug) hoặc do bộ nhớ đệm (Cache) bị lỗi. Cũng có khả năng lỗi đến từ mainboard (chip cầu nam hoặc cổng SATA) chứ không phải do ổ cứng.
2. Có cách nào "reset" thông số S.M.A.R.T về 0 để bán lại ổ cứng không?
Có một số tool chuyên dụng có thể reset được, nhưng tại VietITPro, chúng tôi cảnh báo: Tuyệt đối không mua ổ cứng cũ nếu bạn thấy các thông số S.M.A.R.T bị reset về 0 một cách bất thường (ví dụ: Power On Hours chỉ vài giờ nhưng số lần bật tắt lại hàng chục ngàn lần). Đó là dấu hiệu ổ cứng đã qua sửa chữa firmware.
3. Thông số "09: Power On Hours" có đáng tin không?
Nó cho biết số giờ ổ cứng đã chạy. Tuy nhiên, nó không phản ánh cường độ làm việc. Một ổ cứng chạy 20.000 giờ trong môi trường máy chủ (nhiệt độ ổn định, không rung lắc) vẫn tốt hơn ổ cứng chạy 1.000 giờ trong laptop hay bị va đập.
4. HDD bị "Caution" có thể sửa bằng cách format không?
Không. Format chỉ là việc ghi đè cấu trúc file hệ thống. Nếu sector đã hỏng vật lý, format không thể làm nó "lành" lại. Bạn chỉ có thể dùng lệnh chkdsk /r để đánh dấu các sector đó là "bad" (không sử dụng), nhưng đây chỉ là giải pháp tạm thời.
Lời khuyên cuối cùng từ kỹ sư
Đừng đợi đến khi CrystalDiskInfo báo "Bad" mới lo lắng. Quy tắc vàng của chúng tôi tại VietITPro là quy tắc 3-2-1: Lưu giữ ít nhất 3 bản sao dữ liệu, trên 2 phương tiện lưu trữ khác nhau, và 1 bản sao nằm ngoài địa điểm (như Cloud hoặc ổ cứng di động cất ở nơi khác).
Công nghệ S.M.A.R.T là công cụ hỗ trợ tuyệt vời, nhưng nó không thay thế được thói quen sao lưu dữ liệu của bạn. Nếu bảng thông số bắt đầu xuất hiện các giá trị "Caution", hãy coi đó là hồi chuông cảnh báo sớm để bạn chuẩn bị ngân sách thay thế ổ cứng mới trước khi thảm họa mất dữ liệu xảy ra.




