Dòng card đồ họa EVGA GeForce RTX 2080 Super (đặc biệt là các phiên bản FTW3 Ultra và XC Ultra) nổi tiếng với hiệu năng đỉnh cao trong kiến trúc Turing, nhưng đồng thời cũng là nỗi ác mộng của nhiều kỹ thuật viên sửa chữa phần cứng vì mật độ linh kiện dày đặc, thiết kế mạch VRM phức tạp và hệ thống quản lý công suất (Power Limit) khắt khe. Khi một chiếc RTX 2080 Super rơi vào trạng thái "chết nguồn" – hoàn toàn không có đèn báo, quạt không quay, ngắn mạch đường 12V chính từ nguồn máy tính (PSU) – việc cắm điện ép xung hoặc thay thế linh kiện mò mẫm sẽ chỉ dẫn đến việc cháy nổ bo mạch PCB nhiều lớp (multilayer PCB).
Bài viết này là tài liệu kỹ thuật Masterclass độc bản dành riêng cho các kỹ sư phần cứng và thợ sửa chữa chuyên sâu tại VietITPro.vn. Chúng ta sẽ cùng nhau bóc tách toàn diện từ sơ đồ nguyên lý (schematic), phân tích các điểm yếu kinh điển của dòng EVGA RTX 2080 Super, phương pháp đo đạc không nguồn và có nguồn, cho đến quy trình sử dụng trạm hàn BGA, chạy phần mềm MATS/MODS, và xử lý dứt điểm lỗi firmware quạt tản nhiệt độc quyền của EVGA.
1. Giải Phẫu Kiến Trúc Nguồn EVGA RTX 2080 Super: Sơ Đồ Khối và Cấu Trúc VRM
Để sửa chữa được bất kỳ bo mạch đồ họa nào, bước đầu tiên và quan trọng nhất là nắm vững sơ đồ khối phân phối nguồn điện (Power Tree). EVGA RTX 2080 Super sử dụng nhân đồ họa TU104-410-A1 sản xuất trên tiến trình 12nm FinFET của TSMC, kết hợp với các chip nhớ GDDR6 từ Micron hoặc Samsung.
1.1. Các Mức Điện Áp Chuẩn Trên Bo Mạch Khi Hoạt Động Bình Thường
Khi cấp nguồn và kích hoạt lệnh khởi động từ khe cắm PCI Express, bo mạch phải tuần tự sản sinh ra các mức điện áp theo đúng thứ tự thời gian (Power Sequencing). Bảng dưới đây thể hiện ma trận điện áp chuẩn mà một kỹ sư cần ghi nhớ khi tiến hành đo đạc thực tế trên bo mạch của EVGA RTX 2080 Super.
1.2. Phân Tích Khối VCORE và Mạch Quản Lý Công Suất (Power Limit) Trên EVGA FTW3
Dòng EVGA RTX 2080 Super FTW3 Ultra sử dụng thiết kế mạch nguồn cực kỳ hầm hố với cấu hình lên tới 8+2 pha hoặc 10+2 pha (tùy phiên bản thiết kế PCB tùy biến của hãng so với bản Reference Founder's Edition).
- IC Điều Khởi Xung (PWM Controller): Sử dụng chip Monolithic Power Systems MP2888A hoặc uPI Semiconductor uP9512 hỗ trợ đa pha kỹ thuật số (Digital Multi-phase PWM). IC này giao tiếp trực tiếp với GPU qua đường bus I2C/PMBus để giám sát dòng điện, nhiệt độ và công suất tiêu thụ thực tế.
- Tầng Công Suất (DrMOS/Power Stage): Các DrMOS thường là Vishay SiC632A hoặc AOZ5311NQI tích hợp cả High-Side MOSFET, Low-Side MOSFET và Driver IC trong một gói nhỏ gọn QFN. Khi một DrMOS bị "thủng" (short-circuit giữa cực Drain và Source), nó sẽ kéo sập toàn bộ đường nguồn 12V đầu vào xuống 0V, làm đứt cầu chì bảo vệ.
- Mạch Giới Hạn Công Suất (Power Limit Circuitry): Điểm khác biệt lớn nhất của EVGA so với các hãng khác nằm ở các điện trở lấy mẫu dòng điện (Current Sense Resistors - Shunt Resistors) có trị số siêu nhỏ (thường là 0.002 Ohm hoặc 0.005 Ohm) được đặt dọc theo các đường 12V từ khe PCIe và đầu nguồn 8-pin. Các tín hiệu điện áp rơi trên điện trở này được đưa về các IC giám sát dòng (như Texas Instruments INA3221 hoặc các mạch Op-Amp chuyên dụng). Nếu dòng điện vượt quá mức Power Limit được lập trình trong VBIOS (ví dụ: vượt quá 260W cho bản FTW3), mạch bảo vệ sẽ ngay lập tức gửi tín hiệu ngắt đến chân Enable của IC PWM hoặc ép GPU giảm xung nhịp (Thermal/Power Throttling). Lỗi ở khối này thường khiến card khởi động nhưng sập ngay khi chạy ứng dụng 3D nặng.
2. Quy Trình Chẩn Đoán thực tế: Bóc Tách Pan Bệnh "Chết Nguồn" Từ A Đến Z
Khi một chiếc EVGA RTX 2080 Super được đưa lên bàn kỹ thuật với triệu chứng "chết nguồn hoàn toàn", kỹ thuật viên tuyệt đối không được cắm nguồn thử ngay mà phải tuân thủ quy trình kiểm tra tĩnh (Cold Testing) trước khi cấp nguồn động (Hot Testing).
2.1.Bước 1: Kiểm Tra Tĩnh Bằng Đồng Hồ Vạn Năng (Multimeter - Chế Độ Đo Thông Mạch / Diode)
1. Kiểm tra đầu vào 12V chính: Đặt đồng hồ ở chế độ đo thông mạch (buzzer) hoặc đo diode. Đặt que đỏ vào chân mát (GND - vỏ cổng xuất hình hoặc cạnh khe PCIe), que đen đặt lần lượt vào các chân dương 12V trên jack nguồn 8-pin và các chân đồng của khe PCIe.
- Kết quả bình thường: Đồng hồ kêu tít một tiếng rồi ngắt, hiển thị giá trị điện trở cao (vài kΩ đến hàng MΩ).
- Kết quả lỗi: Đồng hồ kêu liên tục (thông mạch 0 Ω) hoặc hiển thị giá trị điện trở cực thấp gần bằng 0 (dưới 10 Ω). Đây là dấu hiệu của việc chập khối DrMOS VCORE hoặc chập tụ gốm lọc nguồn đầu vào.
2. Kiểm tra các đường nguồn phụ (Secondary Rails):
- Đo trở kháng tại các cuộn cảm (chokes) của VCORE: Trở kháng bình thường của VCORE trên RTX 2080 Super rất thấp, thường chỉ từ 0.6 Ω đến 1.8 Ω. Đây là hiện tượng vật lý bình thường do lõi GPU TU104 có điện trở trong cực nhỏ, không được nhầm lẫn là chập nguồn.
- Đo trở kháng tại cuộn cảm VRAM (VDD_VRAM): Giá trị chuẩn dao động từ 30 Ω đến 80 Ω. Nếu tụt xuống dưới 10 Ω, chip VRAM hoặc DrMOS cấp nguồn VRAM đã bị đánh thủng.
- Đo trở kháng tại cuộn cảm PEX_VDD (0.9V) và 1.8V: Giá trị chuẩn dao động từ 150 Ω đến 500 Ω.
2.2.Bước 2: Xử Lý Lỗi Cầu Chì Chính (Fuse) và Diode TVS Bảo Vệ
Nếu phát hiện chập ngắn mạch đường 12V, tuyệt đối không được câu tắt cầu chì (jump fuse) bằng dây đồng hay chì hàn. Cầu chì đứt là hệ quả của việc một linh kiện phía sau đã bị chập ngắn mạch.
- Xác định vị trí cầu chì chính: Trên bo mạch EVGA RTX 2080 Super, cầu chì chính thường là một linh kiện dán màu trắng hoặc hồng nhạt có ký hiệu chữ cái (ví dụ: chữ "F" hoặc mã dòng chịu tải cao như 10A - 15A) nằm ngay phía sau chân cấp nguồn 8-pin và khe PCIe.
- Kiểm tra Diode TVS (Transient Voltage Suppression): Các diode dán bảo vệ quá áp (thường mang mã như SMCJ12A hoặc các dòng diode Zen/TVS công suất lớn) nằm song song với đường nguồn 12V. Khi nguồn điện từ PSU bị sốc điện (voltage spike) hoặc sét đánh lan truyền, diode TVS sẽ hy sinh thân mình bằng cách tự chập ngắn mạch để bảo vệ toàn bộ mạch bên trong, khiến cầu chì đứt.
- Quy trình xử lý:
1. Dùng mỏ hàn nhiệt độ cao hoặc máy khò hơi nóng tháo bỏ diode TVS bị chập.
2. Đo lại đường 12V xem đã hết hiện tượng chập ngắn mạch hay chưa.
3. Nếu đã hết chập, tiến hành thay thế diode TVS mới có thông số tương đương và thay thế cầu chì chính hãng (hoặc cầu chì dán SMD đúng dòng định mức 12A - 15A).
4. Cấp nguồn thử nghiệm qua bóng đèn bảo vệ dòng (Bulb Tester / Dim Bulb Test) để tránh phát nổ lần hai nếu còn sót điểm chập.
2.3.Bước 3: Đo Đạc Động (Hot Testing) Khi Card Đã Có Điện Áp Chờ (Standby)
Sau khi phục hồi xong đường nguồn 12V và đảm bảo không còn chạm chập, đặt card lên Mainboard test chuyên dụng (hoặc riser card kiểm tra chuyên sâu có hiển thị đèn LED báo trạng thái các nguồn).
1. Bật nguồn máy tính (nhưng chưa boot vào hệ điều hành).
2. Kiểm tra điện áp 3.3V_PCIe tại chân cấp nguồn của khe cắm.
3. Kiểm tra điện áp 5V tại tụ lọc của IC nguồn phụ.
4. Kiểm tra điện áp 1.8V_AON tại chân tụ gần chip GPU.
5. Kiểm tra lệnh EN (Enable) đi từ vi điều khiển phụ hoặc từ khe PCIe tới các IC PWM (uP9512 / MP2888A). Nếu mất lệnh Enable, IC PWM sẽ không mở nguồn VCORE, dẫn đến tình trạng card cắm vào quạt không quay, màn hình không lên, dù đường 12V hoàn toàn khỏe mạnh.
3. Chẩn Đoán Sâu VRAM và Nhân GPU Bằng Phần Mềm Chuyên Dụng NVIDIA MATS/MODS
Nhiều trường hợp EVGA RTX 2080 Super bật lên có hình, quạt quay bình thường nhưng bị treo máy (crash) khi chơi game, xuất hiện màn hình xanh (BSOD) với mã lỗi liên quan đến DirectX, hoặc xuất hiện các sọc rác hình vuông (artifacts). Lúc này, vấn đề không nằm ở nguồn cấp chính mà nằm ở chất lượng tín hiệu của chip nhớ VRAM hoặc lỗi kết nối chân BGA giữa nhân GPU và bo mạch.
3.1. Thiết Lập Môi Trường Chạy MATS/MODS Cho Kiến Trúc Turing (TU104)
Phần mềm chẩn đoán phần cứng độc quyền của NVIDIA là MATS (Memory Area Test System) chạy trên nền DOS (thường tạo USB boot qua FreeDOS hoặc Rufus). Đối với dòng RTX 2080 Super, phiên bản MATS tương thích tốt nhất nằm trong gói MODS phiên bản từ 400.xx trở lên.
1. Chuẩn bị một USB đã nạp sẵn bộ công cụ MATS/MODS.
2. Tháo card RTX 2080 Super ra khỏi hệ thống chính, cắm vào khe PCIe x16 chính của một Mainboard phụ trợ (khuyên dùng các dòng chipset Intel thế hệ cũ như H61, B75 chạy CPU có tích hợp đồ họa để xuất hình qua cổng Onboard, giữ cho chiếc RTX 2080 Super chạy ở chế độ phụ trợ không xuất hình, giúp MATS test trọn vẹn toàn bộ dung lượng VRAM 8GB GDDR6).
3. Khởi động máy tính vào DOS từ USB.
3.2. Cú Pháp Lệnh MATS Chuẩn Cho RTX 2080 Super (8GB GDDR6)
Để kiểm tra toàn bộ 8GB VRAM chia thành các kênh (FBIO channels), gõ lệnh thực thi sau tại dấu nhắc lệnh DOS:
dos mats -e 40 -i 20 -v
Giải thích các tham số kỹ thuật:
-e 40: Kiểm tra toàn bộ dung lượng bộ nhớ (với 8GB GDDR6 trên RTX 2080 Super).-i 20: Bỏ qua một số bước kiểm tra nhiệt độ quá khắc nghiệt nếu hệ thống tản nhiệt chưa áp sát hoàn hảo.-v: Chế độ hiển thị chi tiết (Verbose).
3.3. Đọc Hiểu Bảng Log Lỗi MATS và Xác Định Chip VRAM Hỏng
Sau khi chương trình hoàn tất quá trình kiểm tra (thường mất khoảng 2 đến 5 phút), kết quả sẽ trả về một bảng ma trận chia theo các kênh bộ nhớ (A1, A2, B1, B2, C1, C2, D1, D2 tùy vào cách bố trí bus width 256-bit của chip TU104).
4. Kỹ Thuật Phục Hồi Phần Cứng Chuyên Sâu: BGA Rework Station & Xử Lý Bo Mạch Nổ Than
Khi kết quả MATS báo lỗi phần cứng liên quan đến đứt mạch ngầm dưới GPU/VRAM hoặc bo mạch bị chập cháy dẫn đến nổ than tại khu vực nguồn, kỹ thuật viên phải sử dụng các kỹ thuật gia công cơ khí chính xác cao.
4.1. Quy Trình Cân Nhiệt Profile Chuẩn Cho Trạm Hàn BGA (IR/Hot Air Rework Station)
Nhân đồ họa TU104 trên RTX 2080 Super sử dụng đế gốm kích thước lớn, chứa hàng ngàn chân tiếp xúc dạng vi bi chì (Micro-BGA solder balls). Việc tháo lắp không đúng biên độ nhiệt sẽ làm cong vênh bo mạch PCB hoặc làm rộp phồng nhân GPU (GPU Die Delamination).
- Thiết lập Profile nhiệt độ chuẩn (4 vùng nhiệt):
1. Preheat (Gia nhiệt sơ bộ toàn mạch): Nâng nhiệt độ toàn bộ bo mạch PCB từ từ từ nhiệt độ phòng lên đến 150°C trong vòng 3 đến 4 phút với tốc độ tăng nhiệt 2°C - 3°C/giây nhằm loại bỏ hoàn toàn độ ẩm ẩn chứa bên trong lớp sợi thủy tinh của PCB, tránh hiện tượng phồng rộp (Popcorning).
2. Soak (Ủ nhiệt đồng đều): Duy trì nhiệt độ toàn mạch ở mức 150°C - 170°C trong 90 giây để nhiệt độ truyền đều từ tâm ra các góc của bo mạch.
3. Reflow (Nấu chảy bi chì): Đẩy nhiệt độ bề mặt điểm tiếp xúc đạt đỉnh từ 220°C đến 235°C (tùy thuộc vào việc sử dụng bi chì không chì SAC305 hay bi chì pha chì truyền thống) trong thời gian ngắn từ 40 đến 60 giây.
4. Cooling (Làm nguội cưỡng bức): Bật hệ thống quạt gió làm mát kết hợp khí nơ-tôn hoặc khí nén sạch để hạ nhiệt độ xuống dưới 60°C với tốc độ kiểm soát, tránh tạo ra các mối hàn sần sùi (cold solder joints).
4.2. Kỹ Thuật Xử Lý Bo Mạch Bị Nổ Than (PCB Carbonization Removal)
Trong các trường hợp EVGA RTX 2080 Super chết nguồn do chập DrMOS gây phóng điện mạnh, lớp nhựa epoxy và sợi thủy tinh của bo mạch PCB tại vị trí đó sẽ bị cháy đen thành than dẫn điện. Nếu không xử lý triệt để lớp than này, dù có thay linh kiện mới thì hiện tượng chập ngắn mạch vẫn sẽ tái diễn do tính dẫn điện của than carbon.
1. Khoét bỏ vùng bị cháy: Sử dụng dao mổ y tế chuyên dụng hoặc mũi phay siêu nhỏ trên máy mài tốc độ cao (Dremel) để khoét bỏ hoàn toàn phần nhựa PCB bị đen cháy thành than. Phải khoét sâu vào bên trong cho đến khi lộ ra phần sợi thủy tinh sạch có màu nguyên bản (xanh lá hoặc đen tùy bản mạch EVGA).
2. Cách điện và lấp đầy: Sử dụng keo UV chuyên dụng (UV curing solder mask) để tạo lớp cách điện bảo vệ các lớp mạch ngầm bên trong vừa bị lộ ra. Chiếu đèn UV để làm khô cứng lớp keo.
3. Câu mạch vi phẫu (Micro-Jumping): Nếu đường mạch đồng bên trong bị đứt do quá trình khoét than, sử dụng sợi dây đồng siêu mảnh (dây đồng tráng men đường kính 0.01mm - 0.02mm) kết hợp kính hiển vi quang học soi nổi để câu nối lại đúng sơ đồ nguyên lý của đường mạch đó.
5. Xử Lý Triệt Để Lỗi Firmware Quạt Tản Nhiệt Đặc Trù Trên EVGA RTX 2080 Super
Một trong những "bệnh kinh điển" khiến người dùng dòng EVGA RTX 2080 Super đau đầu là lỗi quạt tản nhiệt: Quạt lúc quay lúc không, phát ra tiếng kêu tạch tạch do xung đột tín hiệu PWM, hoặc quạt quay hết tốc lực 100% không thể điều khiển (Jet Engine effect), thậm chí một quạt ngừng quay hoàn toàn dù nhiệt độ GPU đã lên đến 85°C.
5.1. Nguyên Nhân Gốc Rễ Từ IC Quản Lý Quạt Và Firmware (VBIOS)
Khác với các dòng card khác chỉ sử dụng một kênh PWM chung cho toàn bộ quạt, các phiên bản EVGA FTW3 Ultra sở hữu hệ thống iCX Technology độc quyền với sự hiện diện của hàng loạt cảm biến nhiệt độ độc lập rải rắc khắp bo mạch (cảm biến tại khu vực VCORE, cảm biến tại khu vực VRAM, cảm biến tại khu vực nguồn phụ) và được quản lý bởi một vi điều khiển phụ (MCU - Microcontroller Unit) riêng biệt trên bo mạch.
- Lỗi Firmware MCU Quạt: Khi firmware của chip MCU quản lý quạt bị lỗi (do cập nhật sai phiên bản VBIOS hoặc bị treo trạng thái EEPROM), hệ thống không đọc được tín hiệu từ các cảm biến nhiệt độ iCX, dẫn đến việc MCU đưa ra lệnh điều khiển sai lệch, làm quạt quay điên cuồng hoặc đứng im.
- Lỗi Phần Cứng Mạch Điều Khiển PWM Quạt: IC đệm tín hiệu PWM (thường là các dòng IC cổng logic hoặc transistor chuyển mạch nhỏ nằm ngay cạnh chân cắm cáp quạt 4-pin trên PCB) bị đánh thủng do sốc tĩnh điện (ESD) khi người dùng cắm rút giắc quạt lúc máy đang hoạt động.
5.2. Các Bước Khắc Phục Lỗi Firmware Và Phần Cứng Quạt
1. Nạp lại Firmware chuẩn cho MCU / VBIOS:
- Sử dụng công cụ NVFlash phiên bản mới nhất hỗ trợ dòng RTX 20xx để backup và flash lại đúng mã VBIOS tương thích chính xác với số Serial Number của phiên bản EVGA RTX 2080 Super (lưu ý phân biệt rõ bản FTW3 Ultra, XC Ultra, Black Edition vì cấu hình điện năng và hệ thống quạt khác nhau hoàn toàn).
- Đối với dòng MCU iCX, nếu gặp lỗi không nhận diện cảm biến nhiệt độ, cần sử dụng phần cứng chuyên dụng (như mạch nạp ISP lập trình lại trực tiếp cho vi điều khiển phụ trên bo mạch nếu nhà sản xuất cung cấp file dump firmware).
2. Kiểm tra đường tín hiệu quạt 4-pin:
- Chân 1: GND (Mát)
- Chân 2: 12V (Nguồn cấp quạt)
- Chân 3: Sense (Tốc độ phản hồi Tachometer)
- Chân 4: PWM Control (Tín hiệu điều tốc từ GPU/MCU)
- Sử dụng máy hiện sóng (Oscilloscope) đo tại chân số 4 để kiểm tra xung vuông PWM. Nếu không có xung dao động thay đổi theo nhiệt độ, cần kiểm tra đường mạch dẫn từ GPU/MCU đến chân cắm quạt, thay thế transistor kéo dòng hoặc IC đệm PWM tương ứng.
6. Tiêu Chuẩn Tản Nhiệt, Keo Tản Nhiệt Và Thermal Pad Cho EVGA RTX 2080 Super
Một công đoạn sửa chữa phần cứng hoàn hảo không thể dừng lại ở việc card xuất hình và chạy được, mà phải đảm bảo độ bền bỉ dài lâu trong môi trường vận hành khắc nghiệt. Việc thay thế sai độ dày Thermal Pad hoặc sử dụng keo tản nhiệt kém chất lượng sẽ khiến GPU nhanh chóng đạt ngưỡng nhiệt độ Hotspot nguy hiểm, dẫn đến việc card tự động sập nguồn do cơ chế bảo vệ quá nhiệt (Thermal Shutdown).
6.1. Bảng Thông Số Chuẩn Độ Dày Thermal Pad Cho EVGA RTX 2080 Super (FTW3 Ultra)
Độ dày của miếng đệm tản nhiệt (Thermal Pad) trên dòng EVGA FTW3 Ultra đòi hỏi độ chính xác tuyệt đối tính bằng mi-li-mét. Sai lệch dù chỉ 0.5mm cũng khiến tản nhiệt không áp sát hoàn toàn vào chip VRAM hoặc các Mosfet DrMOS, gây cháy nổ linh kiện do quá nhiệt cục bộ.
6.2. Lựa Chọn Keo Tản Nhiệt Cho Nhân GPU TU104
Nhân GPU kiến trúc Turing tỏa ra lượng nhiệt rất lớn tại vùng tâm (Core Die). Do đó, chất liệu tiếp xúc giữa bề mặt đế GPU và đế đồng của tản nhiệt phải đạt hiệu suất cao nhất:
- Thermal Grizzly Kryonaut: Hệ số dẫn nhiệt cực cao (12.5 W/mK), là lựa chọn hàng đầu cho các kỹ thuật viên chuyên nghiệp. Tuy nhiên, cần lưu ý dòng keo này có tuổi thọ giảm dần nếu nhiệt độ vận hành liên tục vượt quá 80°C (hiện tượng bơm keo - pump-out effect).
- Honeywell PTM7950 (Phase Change Material): Giải pháp vật liệu đổi pha xuất sắc nhất hiện nay cho card đồ họa cao cấp. Ở nhiệt độ phòng, PTM7950 ở trạng thái rắn dễ cắt dán; khi đạt nhiệt độ hoạt động (trên 45°C), vật liệu chuyển sang trạng thái lỏng nhớt, lấp đầy mọi vi khe hở giữa GPU và tản nhiệt với hiệu năng tản nhiệt gần như tương đương kim loại lỏng nhưng hoàn toàn không dẫn điện, loại bỏ hoàn toàn rủi ro chập mạch.
- Kim Loại Lỏng (Liquid Metal - Conductonaut): TUYỆT ĐỐI KHÔNG SỬ DỤNG cho EVGA RTX 2080 Super trừ khi đế tản nhiệt hoàn toàn bằng đồng mạ niken và kỹ thuật viên có tay nghề dán ron cách điện chuyên dụng bằng băng dính kapton. Kim loại lỏng gặp hợp kim nhôm hoặc rớt xuống các linh kiện xung quanh sẽ tạo ra phản ứng hóa học ăn mòn và gây chập cháy tức thì.
7. Các Câu Hỏi Thường Gặp (FAQ) Về Sửa Chữa EVGA RTX 2080 Super
1. Tại sao card RTX 2080 Super của tôi cắm vào mainboard bị sập nguồn PSU ngay lập tức, nhưng khi rút cáp nguồn 8-pin ra thì máy tính lại khởi động bình thường?
Trả lời: Đây là dấu hiệu kinh điển của hiện tượng ngắn mạch (chập) hoàn toàn trên đường nguồn chính 12V_EXT. Nguyên nhân chủ yếu nằm ở việc một hoặc nhiều linh kiện trong khối DrMOS của tầng nguồn VCORE bị đánh thủng (short-circuit giữa cực Drain và Source), hoặc diode TVS bảo vệ đầu vào bị đánh thủng do sốc điện. Khi bạn cắm nguồn 8-pin vào, dòng điện 12V từ nguồn máy tính gặp đoạn chập trực tiếp xuống mát (GND) nên mạch bảo vệ quá dòng (OCP/SCP) của nguồn máy tính sẽ kích hoạt ngắt điện ngay lập tức để bảo vệ hệ thống. Khi bạn rút cáp 8-pin, đường 12V chính không còn được cấp điện nên mainboard không bị sập, nhưng tất nhiên card sẽ không thể khởi động vì mất nguồn nuôi trung tâm.
2. Phần mềm MATS báo lỗi trên kênh FBIO A1, nhưng khi tôi thay chip VRAM mới vào vị trí đó thì lỗi vẫn không hết, nguyên nhân do đâu?
Trả lời: Lỗi hiển thị trên MATS quy về một kênh bộ nhớ cụ thể (ví dụ: FBIO A1) không chỉ xuất phát từ bản thân con chip VRAM đó mà còn có thể do các nguyên nhân sâu xa sau:
- Đứt mạch ngầm tín hiệu đường truyền dữ liệu (Data lines / Address lines) từ nhân GPU đi qua lớp PCB để đến chip VRAM đó.
- Chân tiếp xúc dưới đế nhân GPU TU104 tại vị trí tương ứng với đường truyền của kênh A1 bị oxy hóa, nứt chân hoặc mất liên kết sau một thời gian dài card chịu nhiệt độ cao và bị cong vênh nhẹ.
- Lỗi nguồn cấp riêng cho khối VRAM (VDD_VRAM hoặc nguồn phụ VPP) có biên độ dao động điện áp quá lớn hoặc bị nhiễm nhiễu tần số cao do tụ lọc nguồn VRAM bị khô.
Cách xử lý: Phải kiểm tra kỹ đường mạch bằng kính hiển vi, tiến hành reballing (đóng lại chân bi) cho cả chip VRAM lẫn nhân GPU TU104.
3. Làm thế nào để phân biệt lỗi do chip GPU TU104 chết hẳn hay chỉ bị bong chân BGA cần đóng lại?
Trả lời: Để phân biệt chính xác, kỹ thuật viên cần dựa vào các dấu hiệu thực tế sau:
- Lỗi bong chân BGA (Cold/Broken Solder Joints): Card vẫn nhận diện trong Device Manager nhưng có dấu hiệu chấm than vàng (Mã lỗi Code 43), màn hình xuất hiện sọc rác hình học ngay khi vào màn hình BIOS, hoặc khi dùng tay ấn nhẹ vào góc nhân GPU thì card xuất hình trở lại bình thường hoặc thay đổi trạng thái lỗi. Chạy MATS báo lỗi ở một số địa chỉ nhất định.
- Lỗi chết nhân GPU (Internal Die Damage): Đường nguồn VCORE chạm chập nội bộ bên trong nhân GPU (đo trở kháng cuộn cảm VCORE tụt xuống sát mức 0.0 Ω - 0.2 Ω, tháo toàn bộ DrMOS ra mà trở kháng nhân GPU vẫn thấp bất thường). Card hoàn toàn không nhận diện trên bất kỳ hệ thống nào, không xuất tín hiệu sinh mã POST code, hoặc nhân GPU bị phù rộp, nứt vỡ bề mặt vật lý. Trường hợp này bắt buộc phải thay thế nhân GPU mới.
4. Tại sao sau khi sửa xong nguồn, quạt tản nhiệt của EVGA RTX 2080 Super FTW3 lại quay hết tốc lực 100% không giảm tốc độ dù máy đang ở chế độ chờ?
Trả lời: Hiện tượng này xảy ra do hai nguyên nhân chính:
- Mất kết nối đường tín hiệu PWM (Chân số 4): Đường mạch truyền xung điều tốc từ vi điều khiển MCU trên bo mạch đến chân cắm quạt bị đứt, hoặc IC đệm tín hiệu PWM bị chết, khiến quạt không nhận được xung lệnh giảm tốc và mặc định chạy ở chế độ tối đa để đảm bảo an toàn.
- Lỗi giao tiếp giữa chip MCU iCX và VBIOS: Nếu bạn đã nạp nhầm phiên bản VBIOS không đúng mã chuẩn của dòng FTW3 (ví dụ nạp nhầm VBIOS bản XC Ultra hoặc bản Reference), vi điều khiển phụ quản lý tản nhiệt iCX sẽ không nhận diện được tập lệnh tương thích, dẫn đến trạng thái lỗi an toàn (Fail-safe mode) khiến quạt luôn quay max tốc độ. Giải pháp là nạp lại đúng file VBIOS gốc (Original VBIOS) trùng khớp hoàn toàn với Part Number của card.
5. Nhiệt độ Hotspot của EVGA RTX 2080 Super bao nhiêu là đạt chuẩn và khi nào cần phải tiến hành bảo dưỡng thay keo, thay thermal pad?
Trả lời:
- Nhiệt độ chuẩn khi hoạt động tải nặng (Full Load):
- Nhiệt độ nhân GPU (Core Temp): Dưới 75°C.
- Nhiệt độ điểm nóng (Hotspot Temp): Dưới 88°C - 90°C.
- Nhiệt độ VRAM (Memory Temp): Dưới 85°C.
- Ngưỡng cần bảo dưỡng: Khi nhiệt độ Hotspot chênh lệch với nhiệt độ Core trung bình quá lớn (trên 15°C - 20°C), hoặc nhiệt độ Hotspot chạm ngưỡng 105°C khiến card tự động bóp xung (Thermal Throttling) để giảm nhiệt. Lúc này, lớp keo tản nhiệt đã bị khô hoàn toàn (dry-out) hoặc thermal pad đã bị lão hóa, mất tính đàn hồi và khả năng dẫn nhiệt. Bạn cần tiến hành vệ sinh toàn bộ, thay thế keo tản nhiệt chất lượng cao (như Honeywell PTM7950) và bộ thermal pad đúng chuẩn độ dày đã phân tích ở mục 6.

