CUDA einrichten für KI-Inferenz: Vollständige Anleitung
Symbolbild, KI-generiert (gpt-image-1)
CUDA (Compute Unified Device Architecture) ist die Plattform von NVIDIA für GPU-beschleunigte Berechnungen. Alle wichtigen KI-Frameworks – PyTorch, TensorFlow, ONNX Runtime – setzen auf CUDA auf. Diese Anleitung beschreibt cuda einrichten ki inferenz auf Ubuntu 22.04 LTS vollständig: von der CUDA-Installation bis zum ersten funktionierenden Inferenz-Test.
Voraussetzungen
- Ubuntu 22.04 LTS mit installiertem NVIDIA-Treiber (Version ≥ 520 empfohlen)
- NVIDIA GPU mit CUDA-Unterstützung (alle GeForce GTX 10xx+, RTX 20xx+, Quadro-Varianten)
- Internetzugang
CUDA-Version und Treiber-Kompatibilität
Treiber-Version und CUDA-Version müssen kompatibel sein:
| CUDA-Version | Mindest-Treiber (Linux) |
|---|---|
| CUDA 12.3 | 545.x |
| CUDA 12.2 | 535.x |
| CUDA 12.0 | 525.x |
| CUDA 11.8 | 520.x |
Aktuelle Treiber-Version prüfen:
nvidia-smi | grep "Driver Version"
CUDA Toolkit installieren
# NVIDIA Repository einbinden
wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-keyring_1.1-1_all.deb
sudo dpkg -i cuda-keyring_1.1-1_all.deb
sudo apt update
# CUDA 12.3 Toolkit installieren
sudo apt install cuda-toolkit-12-3
# Umgebungsvariablen setzen (~/.bashrc)
echo 'export PATH=/usr/local/cuda/bin:$PATH' >> ~/.bashrc
echo 'export LD_LIBRARY_PATH=/usr/local/cuda/lib64:$LD_LIBRARY_PATH' >> ~/.bashrc
source ~/.bashrc
# Installation prüfen
nvcc --version
cuDNN installieren
cuDNN (CUDA Deep Neural Network Library) beschleunigt Faltungsoperationen in neuronalen Netzen erheblich:
sudo apt install libcudnn8 libcudnn8-dev libcudnn8-samples
PyTorch mit CUDA
python3 -m venv /opt/torch-env
source /opt/torch-env/bin/activate
# PyTorch für CUDA 12.1
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
CUDA-Verfügbarkeit testen:
import torch
print(f"CUDA verfügbar: {torch.cuda.is_available()}")
print(f"GPU: {torch.cuda.get_device_name(0)}")
print(f"VRAM: {torch.cuda.get_device_properties(0).total_memory / 1e9:.1f} GB")
# Tensor-Berechnung auf GPU
x = torch.randn(1000, 1000).cuda()
y = torch.mm(x, x)
print(f"GPU-Berechnungstest: {y.shape}")
Erstes KI-Inferenz-Modell testen
YOLOv8 als praxisnahes Inferenz-Testbeispiel:
pip install ultralytics
from ultralytics import YOLO
import torch
# Gerät auswählen
device = 'cuda' if torch.cuda.is_available() else 'cpu'
print(f"Inferenz auf: {device}")
# YOLOv8n laden (kleinste Variante, gut für ersten Test)
model = YOLO('yolov8n.pt')
model.to(device)
# Inferenz auf Testbild
results = model('/path/to/test-image.jpg')
print(f"Erkannte Objekte: {len(results[0].boxes)}")
print(f"Inferenzzeit: {results[0].speed['inference']:.1f} ms")
GPU-Auslastung überwachen
Während der Inferenz:
watch -n 1 nvidia-smi
Zeigt: GPU-Auslastung (%), Speicherverbrauch, Temperatur, Leistungsaufnahme. Für Produktivsysteme: gpustat für kompaktere Darstellung.
ONNX Runtime für optimierte Inferenz
ONNX Runtime mit GPU-Beschleunigung bietet eine framework-neutrale Inferenz-Engine:
pip install onnxruntime-gpu
import onnxruntime as ort
import numpy as np
# GPU-Provider prüfen
print(ort.get_available_providers())
# ['CUDAExecutionProvider', 'CPUExecutionProvider'] → GPU verfügbar
session = ort.InferenceSession(
'model.onnx',
providers=['CUDAExecutionProvider']
)
Fazit
CUDA für KI-Inferenz auf Ubuntu in Betrieb zu nehmen ist ein linearer Prozess: Treiber → CUDA Toolkit → Framework. Die Kompatibilität zwischen Treiber-Version und CUDA-Version ist die häufigste Fehlerquelle – vor der Installation prüfen.
Passende PCIe AI-Karten: PCIe AI-Karten GPU-Karten.
Weiterführende Dokumentation
- NVIDIA CUDA Toolkit – Offizielle Dokumentation
- NVIDIA cuDNN – Deep Neural Network Library
- PyTorch – CUDA-Installation und Kompatibilitätstabelle
- ONNX Runtime – GPU-Beschleunigte Inferenz
Zurück zum Wiki-Inhaltsverzeichnis.