CUDA einrichten für KI-Inferenz: Vollständige Anleitung

Von Helmut Artmeier  •   2 Minuten gelesen

CUDA einrichten für KI-Inferenz – Anleitung Ubuntu (KI-generiertes Symbolbild)

CUDA einrichten für KI-Inferenz: Vollständige Anleitung

Symbolbild, KI-generiert (gpt-image-1)

CUDA (Compute Unified Device Architecture) ist die Plattform von NVIDIA für GPU-beschleunigte Berechnungen. Alle wichtigen KI-Frameworks – PyTorch, TensorFlow, ONNX Runtime – setzen auf CUDA auf. Diese Anleitung beschreibt cuda einrichten ki inferenz auf Ubuntu 22.04 LTS vollständig: von der CUDA-Installation bis zum ersten funktionierenden Inferenz-Test.

Voraussetzungen

  • Ubuntu 22.04 LTS mit installiertem NVIDIA-Treiber (Version ≥ 520 empfohlen)
  • NVIDIA GPU mit CUDA-Unterstützung (alle GeForce GTX 10xx+, RTX 20xx+, Quadro-Varianten)
  • Internetzugang

CUDA-Version und Treiber-Kompatibilität

Treiber-Version und CUDA-Version müssen kompatibel sein:

CUDA-Version Mindest-Treiber (Linux)
CUDA 12.3 545.x
CUDA 12.2 535.x
CUDA 12.0 525.x
CUDA 11.8 520.x

Aktuelle Treiber-Version prüfen:

nvidia-smi | grep "Driver Version"

CUDA Toolkit installieren

# NVIDIA Repository einbinden
wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-keyring_1.1-1_all.deb
sudo dpkg -i cuda-keyring_1.1-1_all.deb
sudo apt update

# CUDA 12.3 Toolkit installieren
sudo apt install cuda-toolkit-12-3

# Umgebungsvariablen setzen (~/.bashrc)
echo 'export PATH=/usr/local/cuda/bin:$PATH' >> ~/.bashrc
echo 'export LD_LIBRARY_PATH=/usr/local/cuda/lib64:$LD_LIBRARY_PATH' >> ~/.bashrc
source ~/.bashrc

# Installation prüfen
nvcc --version

cuDNN installieren

cuDNN (CUDA Deep Neural Network Library) beschleunigt Faltungsoperationen in neuronalen Netzen erheblich:

sudo apt install libcudnn8 libcudnn8-dev libcudnn8-samples

PyTorch mit CUDA

python3 -m venv /opt/torch-env
source /opt/torch-env/bin/activate

# PyTorch für CUDA 12.1
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

CUDA-Verfügbarkeit testen:

import torch

print(f"CUDA verfügbar: {torch.cuda.is_available()}")
print(f"GPU: {torch.cuda.get_device_name(0)}")
print(f"VRAM: {torch.cuda.get_device_properties(0).total_memory / 1e9:.1f} GB")

# Tensor-Berechnung auf GPU
x = torch.randn(1000, 1000).cuda()
y = torch.mm(x, x)
print(f"GPU-Berechnungstest: {y.shape}")

Erstes KI-Inferenz-Modell testen

YOLOv8 als praxisnahes Inferenz-Testbeispiel:

pip install ultralytics
from ultralytics import YOLO
import torch

# Gerät auswählen
device = 'cuda' if torch.cuda.is_available() else 'cpu'
print(f"Inferenz auf: {device}")

# YOLOv8n laden (kleinste Variante, gut für ersten Test)
model = YOLO('yolov8n.pt')
model.to(device)

# Inferenz auf Testbild
results = model('/path/to/test-image.jpg')
print(f"Erkannte Objekte: {len(results[0].boxes)}")
print(f"Inferenzzeit: {results[0].speed['inference']:.1f} ms")

GPU-Auslastung überwachen

Während der Inferenz:

watch -n 1 nvidia-smi

Zeigt: GPU-Auslastung (%), Speicherverbrauch, Temperatur, Leistungsaufnahme. Für Produktivsysteme: gpustat für kompaktere Darstellung.

ONNX Runtime für optimierte Inferenz

ONNX Runtime mit GPU-Beschleunigung bietet eine framework-neutrale Inferenz-Engine:

pip install onnxruntime-gpu
import onnxruntime as ort
import numpy as np

# GPU-Provider prüfen
print(ort.get_available_providers())
# ['CUDAExecutionProvider', 'CPUExecutionProvider'] → GPU verfügbar

session = ort.InferenceSession(
    'model.onnx',
    providers=['CUDAExecutionProvider']
)

Fazit

CUDA für KI-Inferenz auf Ubuntu in Betrieb zu nehmen ist ein linearer Prozess: Treiber → CUDA Toolkit → Framework. Die Kompatibilität zwischen Treiber-Version und CUDA-Version ist die häufigste Fehlerquelle – vor der Installation prüfen.

Passende PCIe AI-Karten: PCIe AI-Karten GPU-Karten.

Weiterführende Dokumentation

Zurück zum Wiki-Inhaltsverzeichnis.


Zurück Weiter