Tối ưu hóa GPU (NVIDIA)
Chuyển code Python khoa học đang chạy chậm trên CPU sang GPU NVIDIA, kèm kiểm chứng tính đúng đắn và đo tốc độ thực tế.
Lập trìnhNâng cao★ 33,030⑂ 3,248Điểm AI 9/10Cập nhật lần cuối: 9 thg 8, 2026
Skill này làm gì
Coi việc tăng tốc GPU là một quá trình tối ưu dựa trên bằng chứng, không phải viết lại code một cách mù quáng.
- Bảng chọn thư viện phù hợp: CuPy (NumPy/SciPy), cuDF (pandas), cuML (scikit-learn), nx-cugraph (NetworkX), cuCIM (xử lý ảnh, WSI), cuVS (tìm kiếm vector), KvikIO (đọc file trực tiếp vào GPU), Warp/Newton (mô phỏng vật lý), Numba-CUDA (kernel tùy chỉnh), RAFT.
- Đi từ nhẹ đến nặng: thử chế độ tăng tốc
cudf.pandas,cuml.accel,nx-cugraphtrước; chỉ dùng API native hoặc kernel tùy chỉnh khi thật cần. - Kiểm chứng số học: so sánh kết quả CPU/GPU với sai số cho phép, xử lý NaN, dtype, thứ tự; với ANN thì báo recall@k thay vì chỉ so tốc độ.
- Đo benchmark đúng cách: dùng CUDA events,
cupyx.profiler.benchmark,nsys,ncu, có warm-up và tính cả chi phí truyền dữ liệu. - Dám từ chối port: nếu GPU không nhanh hơn, skill giải thích nguyên nhân (kích thước bài toán, truyền dữ liệu, fallback về CPU, thiếu bộ nhớ...).
Skill cũng cảnh báo các project đã ngừng phát triển như cuxfilter (bản cuối 26.06) và cuSpatial (đóng băng ở 25.04).
Dành cho ai
- Nhà nghiên cứu / data scientist có pipeline xử lý mảng, dataframe cực lớn
- Người mới với hệ sinh thái RAPIDS, chưa biết chọn thư viện nào
- Người làm mô phỏng vật lý, phân tích đồ thị, tìm kiếm vector cho RAG, xử lý ảnh y khoa
- Ai từng chuyển sang GPU nhưng code vẫn không nhanh hơn và cần chẩn đoán nguyên nhân
Ví dụ sử dụng
- Tăng tốc pipeline pandas: đưa script tổng hợp 50 triệu dòng CSV → skill bật
cudf.pandas, kiểm tra cảnh báo fallback CPU, viết lại phần nghẽn bằng cuDF native rồi báo benchmark trước/sau kèm chi phí truyền dữ liệu. - Chuyển tìm kiếm vector: thay
NearestNeighborscủa sklearn bằng cuVS cho pipeline RAG, đồng thời báo recall@k so với tìm kiếm chính xác để đánh giá chất lượng. - Mô phỏng hạt: JIT-compile vòng lặp Python sang kernel Warp và dùng timeline
nsysđể loại bỏ các lần chuyển dữ liệu host↔device dư thừa.
· · · Hướng dẫn cài đặt · · ·
Cài vào ứng dụng Claude (không cần terminal)
- Tải tệp ZIP bằng nút bên dưới.
- Trong Claude, mở Settings → Capabilities và bật 'Code execution and file creation'. (chỉ một lần)
- Vào Customize → Skills → + → 'Upload a skill' rồi tải tệp ZIP lên.
Cài vào Claude Code
Để Claude làm — dán câu dưới đây vào Claude Code
Hãy cài skill mình tìm thấy trên Claude Skill Mart. Copy thư mục skills/optimize-for-gpu từ repo GitHub K-Dense-AI/scientific-agent-skills vào ~/.claude/skills/optimize-for-gpu/ của mình. Sau khi cài xong, cho mình biết skill này làm được gì trong một câu.
Cài bằng lệnh thủ công
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git && mkdir -p ~/.claude/skills && cp -r scientific-agent-skills/skills/optimize-for-gpu ~/.claude/skills/⚠ Đây là skill do người khác tạo. Hãy kiểm tra repo gốc trước khi cài.
- Kiểm tra bạn có GPU NVIDIA trên Linux hoặc WSL2: chạy
nvidia-smitrong terminal để xem driver và phiên bản CUDA. - Đảm bảo đã cài Claude Code và có thư mục skill:
mkdir -p ~/.claude/skills - Clone repository:
git clone https://github.com/K-Dense-AI/scientific-agent-skills.git - Copy toàn bộ thư mục skill:
cp -r scientific-agent-skills/skills/optimize-for-gpu ~/.claude/skills/- Phải copy cả thư mục
references/vì skill đọc các file tham chiếu này trước khi viết code.
- Phải copy cả thư mục
- Khởi động lại Claude Code, rồi thử yêu cầu: "Tối ưu đoạn code NumPy này lên GPU".
- Nếu muốn chạy thật, cài Python 3.11+ và các wheel RAPIDS/CuPy khớp CUDA 12 hoặc 13 (xem
references/installation.md, cần kết nối mạng).
Xem mã nguồn trên GitHub ↗Giấy phép: MIT