Wie Sie das Deepseek Large Model lokal bereitstellen (detaillierte Anleitung)
Die von Deepseek AI veröffentlichten Open-Source-Großmodelle haben aufgrund ihrer herausragenden Leistung und Offenheit breite Aufmerksamkeit erregt. Die lokale Bereitstellung dieser leistungsstarken Modelle schützt nicht nur die Datenprivatsphäre und ermöglicht die Offline-Nutzung, sondern erlaubt auch die Anpassung und Optimierung an individuelle Bedürfnisse, was Entwicklern und Forschern große Vorteile bietet.
Wird gerendert...
# Einleitung
Dieser Artikel bietet eine detaillierte Anleitung zur lokalen Bereitstellung der Deepseek-Großmodelle für die drei gängigen Betriebssysteme macOS, Windows und Linux. Wir stellen drei gängige Bereitstellungsmethoden vor: **Ollama** (am einfachsten zu bedienen), **llama.cpp** (hervorragende Leistung, GGUF-Format) und **Hugging Face Transformers** (natives Python, hohe Flexibilität), um Ihnen zu helfen, die am besten geeignete Lösung für Ihre Bedürfnisse auszuwählen.
# I. Vorbereitungen vor der lokalen Bereitstellung
Stellen Sie vor Beginn der Bereitstellung sicher, dass Ihr System die folgenden grundlegenden Anforderungen erfüllt.
## 1.1 Hardwareanforderungen
Die lokale Bereitstellung von Großmodellen hat bestimmte Hardwareanforderungen, insbesondere an Arbeitsspeicher und Videospeicher.
* **CPU:** 8 Kerne oder mehr empfohlen, mit hoher Taktfrequenz.
* **Arbeitsspeicher (RAM):** Mindestens 16 GB, 32 GB oder mehr empfohlen. Größere Modelle erfordern mehr Arbeitsspeicher.
* **GPU (Grafikkarte):** **NVIDIA-Grafikkarten werden dringend empfohlen** mit mindestens 8 GB Videospeicher, 12 GB, 16 GB oder mehr sind empfehlenswert. GPUs können den Inferenzprozess erheblich beschleunigen.
* **NVIDIA-Benutzer:** Stellen Sie sicher, dass die neuesten Grafikkartentreiber und das CUDA Toolkit installiert sind.
* **AMD-Benutzer:** Einige Methoden (wie llama.cpp) unterstützen ROCm, aber die Kompatibilität ist nicht so gut wie bei NVIDIA.
* **macOS-Benutzer:** Apple Silicon-Chips (M-Serie) bieten eine hervorragende GPU-Beschleunigung über das Metal-Framework.
* **Speicherplatz:** Reservieren Sie ausreichend Festplattenspeicher (normalerweise Dutzende bis Hunderte von GB), abhängig von der Größe des von Ihnen gewählten Modells. SSDs werden für schnellere Ladezeiten empfohlen.
## 1.2 Softwareanforderungen (Allgemein)
Die folgende Software sind Basistools, die für die meisten Bereitstellungsmethoden universell sind.
* **Betriebssystem:**
* macOS (Monterey 12.0 oder höher)
* Windows 10/11 (64-Bit)
* Linux (Ubuntu 20.04+, Debian 11+, CentOS 7+ usw.)
* **Git:** Wird zum Klonen von Code-Repositories verwendet.
* **macOS:** Installieren Sie die Xcode Command Line Tools (`xcode-select --install`) oder Homebrew (`brew install git`).
* **Windows:** Laden Sie es von der [offiziellen Git-Website](https://git-scm.com/download/win) herunter und installieren Sie es.
* **Linux:** `sudo apt update && sudo apt install git` (Debian/Ubuntu) oder `sudo yum install git` (CentOS).
* **Python (3.8+) und pip:** Wird für Python-basierte Bereitstellungsmethoden verwendet.
* **macOS/Linux:** Normalerweise vorinstalliert, die Verwendung von `pyenv` oder `conda` zur Verwaltung von Umgebungen wird empfohlen.
* **Windows:** Laden Sie es von der [offiziellen Python-Website](https://www.python.org/downloads/windows/) herunter und installieren Sie es. Stellen Sie sicher, dass Sie "Add Python to PATH" aktivieren.
* **C++-Compiler:** Wird hauptsächlich zum Kompilieren von llama.cpp verwendet.
* **macOS:** Xcode Command Line Tools (`xcode-select --install`).
* **Windows:** Visual Studio Build Tools oder MinGW-w64.
* **Linux:** `build-essential` (`sudo apt install build-essential`).
* **CUDA Toolkit (NVIDIA GPU-Benutzer):** Laden Sie die mit Ihrem Grafikkartentreiber kompatible Version von der [offiziellen NVIDIA-Website](https://developer.nvidia.com/cuda-downloads) herunter und installieren Sie sie.
# II. Auswahl des Deepseek-Modells
Deepseek bietet mehrere Open-Source-Modelle, darunter:
* **Deepseek-Coder:** Konzentriert sich auf die Codegenerierung und das Codeverständnis.
* **Deepseek-V2:** Ein universelles Großmodell mit leistungsstarker Leistung.
Sie finden die von Deepseek offiziell veröffentlichten Modelle auf dem [Hugging Face Hub](https://huggingface.co/deepseek-ai).
**Modellformatwahl:**
* **GGUF-Format:** Geeignet für `ollama` und `llama.cpp`. Es ist normalerweise quantisiert, hat kleinere Dateien und geringere Hardwareanforderungen, kann aber geringfügige Genauigkeitseinbußen bedeuten.
* **PyTorch-Format:** Geeignet für die Hugging Face `transformers`-Bibliothek. Dies ist das native Format des Modells, hat größere Dateien und höhere Hardwareanforderungen, bietet aber die beste Leistung und Flexibilität.
# III. Bereitstellungsmethode 1: Verwendung von Ollama (Empfohlen, am einfachsten)
Ollama ist ein leichtgewichtiges Framework, das den Prozess der lokalen Ausführung von Großmodellen vereinfachen soll. Es bietet eine einheitliche API und eine Befehlszeilenschnittstelle und unterstützt Modelle im GGUF-Format.
## 3.1 Ollama-Einführung
* **Vorteile:** Einfache Installation, bequeme Nutzung, plattformübergreifende Unterstützung, integrierter API-Dienst.
* **Nachteile:** Die Modellauswahl ist auf die Ollama-Bibliothek beschränkt, geringer Anpassungsgrad.
## 3.2 Ollama installieren
#### macOS
1. **Verwendung von Homebrew (empfohlen):**
```bash
brew install ollama
```
2. **Oder Download von der offiziellen Website:**
Besuchen Sie die [offizielle Ollama-Website](https://ollama.com/download), laden Sie das macOS-Installationspaket herunter und ziehen Sie es in den Anwendungsordner.
#### Windows
1. Besuchen Sie die [offizielle Ollama-Website](https://ollama.com/download) und laden Sie das Windows-Installationspaket herunter.
2. Doppelklicken Sie auf das Installationspaket und folgen Sie den Anweisungen zur Installation.
#### Linux
1. Öffnen Sie ein Terminal und führen Sie den folgenden Befehl aus:
```bash
curl -fsSL https://ollama.com/install.sh | sh
```
Dieses Skript erkennt automatisch Ihr System und installiert Ollama.
## 3.3 Deepseek-Modell herunterladen und ausführen
Die Ollama-Community bietet GGUF-Versionen von Deepseek-Modellen. Sie können auf der [Modellbibliothek der offiziellen Ollama-Website](https://ollama.com/library) nach Deepseek suchen.
Am Beispiel von `deepseek-coder:latest`:
1. Öffnen Sie ein Terminal (Windows-Benutzer verwenden PowerShell oder CMD).
2. Führen Sie den folgenden Befehl aus, um das Modell herunterzuladen und zu starten:
```bash
ollama run deepseek-coder:latest
```
Wenn das Modell nicht heruntergeladen ist, beginnt Ollama automatisch mit dem Download. Nach Abschluss des Downloads gelangen Sie in eine interaktive Dialogoberfläche.
```
>>> Send a message (/? for help)
```
3. Geben Sie Ihre Frage ein, und das Modell generiert eine Antwort.
```
>>> Hallo, stell dich bitte vor.
Ich bin Deepseek-Coder, ein großes Sprachmodell, das von Deepseek AI trainiert wurde und sich auf Codegenerierung, -verständnis und Fragen und Antworten spezialisiert hat.
```
4. Geben Sie `/bye` ein, um den interaktiven Modus zu beenden.
## 3.4 Zugriff über API
Ollama startet im Hintergrund einen lokalen API-Dienst (Standardport `11434`), über den Sie bequem per HTTP-Anfrage mit dem Modell interagieren können.
**Beispiel (mit curl):**
```bash
curl http://localhost:11434/api/generate -d '{
"model": "deepseek-coder:latest",
"prompt": "Schreibe eine Python-Funktion, die die ersten n Elemente der Fibonacci-Folge berechnet.",
"stream": false
}'
```
Sie können diese API auch mit HTTP-Bibliotheken in Python oder anderen Programmiersprachen aufrufen.
# IV. Bereitstellungsmethode 2: Verwendung von llama.cpp (Hervorragende Leistung, GGUF-Format)
`llama.cpp` ist eine Inferenz-Engine, die in C/C++ geschrieben ist und für ihre effiziente CPU- und GPU-Inferenz (einschließlich NVIDIA CUDA, AMD ROCm, Apple Metal) bekannt ist und Modelle im GGUF-Format unterstützt.
## 4.1 llama.cpp-Einführung
* **Vorteile:** Hervorragende Leistung, geringer Ressourcenverbrauch, Unterstützung für verschiedene Hardwarebeschleunigungen, aktive Community.
* **Nachteile:** Manuelle Kompilierung erforderlich, hat bestimmte Anforderungen an die Umgebungskonfiguration.
## 4.2 Umgebungs vorbereiten
#### Allgemeine Schritte
1. **Git installieren:** Befolgen Sie die Anweisungen unter "I. Vorbereitungen vor der lokalen Bereitstellung".
2. **C++-Compiler installieren:**
* **macOS:** `xcode-select --install`
* **Windows:** Installieren Sie die [Visual Studio Build Tools](https://visualstudio.microsoft.com/zh-hans/downloads/) (wählen Sie die Workload "Desktopentwicklung mit C++") oder [MinGW-w64](https://www.mingw-w64.org/doku.php/download).
* **Linux:** `sudo apt install build-essential` (Debian/Ubuntu) oder `sudo yum groupinstall "Development Tools"` (CentOS).
#### GPU-Beschleunigung (Optional)
* **macOS (Apple Silicon):** Keine zusätzliche Konfiguration erforderlich, `llama.cpp` unterstützt Metal standardmäßig.
* **NVIDIA GPU:** Stellen Sie sicher, dass die neuesten NVIDIA-Treiber und das **CUDA Toolkit** installiert sind.
* **AMD GPU:** Stellen Sie sicher, dass **ROCm** installiert ist.
## 4.3 llama.cpp klonen und kompilieren
1. **Repository klonen:**
```bash
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp
```
2. **Kompilieren:**
* **Allgemeine CPU-Kompilierung:**
```bash
make
```
* **macOS (Apple Silicon Metal-Beschleunigung):**
```bash
make LLAMA_METAL=1
```
* **NVIDIA GPU (CUDA-Beschleunigung):**
```bash
make LLAMA_CUDA=1
```
*Wenn Probleme mit dem CUDA-Pfad auftreten, müssen Sie möglicherweise die Umgebungsvariable `CUDA_PATH` setzen oder sie im `make`-Befehl angeben.*
* **AMD GPU (ROCm-Beschleunigung):**
```bash
make LLAMA_ROCM=1
```
Nach erfolgreicher Kompilierung sehen Sie ausführbare Dateien wie `main` (Linux/macOS) oder `main.exe` (Windows) im Verzeichnis `llama.cpp`.
## 4.4 Deepseek GGUF-Modell herunterladen
1. Besuchen Sie den [Hugging Face Hub](https://huggingface.co/models).
2. Suchen Sie nach `deepseek` und `GGUF`. Normalerweise konvertieren Community-Mitglieder Deepseek-Modelle in das GGUF-Format.
* Suchen Sie zum Beispiel nach `deepseek-coder-6.7b-instruct GGUF`.
* Finden Sie einen zuverlässigen Modell-Uploader (z. B. `TheBloke`), und gehen Sie zu dessen Modellseite.
3. Wählen Sie die von Ihnen benötigte Quantisierungsversion (z. B. `Q4_K_M` ist eine gängige Wahl, die Leistung und Genauigkeit ausbalanciert).
4. Laden Sie die `.gguf`-Datei herunter.
* **Es wird empfohlen, `wget` oder `curl` zum Herunterladen in das Verzeichnis `llama.cpp/models` zu verwenden:**
```bash
# Beispiel: Herunterladen von deepseek-coder-6.7b-instruct.Q4_K_M.gguf
mkdir -p models
wget -P models https://huggingface.co/TheBloke/deepseek-coder-6.7B-Instruct-GGUF/resolve/main/deepseek-coder-6.7b-instruct.Q4_K_M.gguf
```
* **Oder manuell herunterladen und dann in das Verzeichnis `llama.cpp/models` verschieben.**
## 4.5 Deepseek-Modell ausführen
1. Stellen Sie sicher, dass Sie sich im Verzeichnis `llama.cpp` befinden.
2. Führen Sie das Modell aus:
```bash
./main -m models/deepseek-coder-6.7b-instruct.Q4_K_M.gguf -p "Hallo, stell dich bitte vor." -n 512 --temp 0.7
```
* `-m <path_to_model>`: Gibt den Pfad zur GGUF-Modelldatei an.
* `-p "<prompt>"`: Ihr Eingabe-Prompt.
* `-n <tokens>`: Maximale Anzahl von generierten Tokens.
* `--temp <value>`: Abtasttemperatur, höhere Werte führen zu zufälligeren Ergebnissen (0.0-2.0).
* `-t <threads>`: Anzahl der verwendeten CPU-Threads.
* `-ngl <layers>`: Wie viele Schichten des Modells auf die GPU (NVIDIA/Metal) geladen werden sollen. Zum Beispiel bedeutet `-ngl 30`, dass 30 Schichten auf die GPU geladen werden und der Rest auf der CPU. **Dies ist der Schlüsselparameter zur Nutzung der GPU-Beschleunigung.**
**Beispiel (mit GPU-Beschleunigung):**
```bash
# macOS (Metal)
./main -m models/deepseek-coder-6.7b-instruct.Q4_K_M.gguf -p "Schreibe eine Python-Funktion, die die ersten n Elemente der Fibonacci-Folge berechnet." -n 512 --temp 0.7 -ngl 999 # 999 bedeutet, so viel wie möglich auf die GPU zu laden
# NVIDIA (CUDA)
./main -m models/deepseek-coder-6.7b-instruct.Q4_K_M.gguf -p "Schreibe eine Python-Funktion, die die ersten n Elemente der Fibonacci-Folge berechnet." -n 512 --temp 0.7 -ngl 999
```
# V. Bereitstellungsmethode 3: Verwendung von Hugging Face Transformers (Natives Python, hohe Flexibilität)
Die Hugging Face `transformers`-Bibliothek ist das Standardwerkzeug für die Bereitstellung und Verwendung verschiedener vortrainierter Großmodelle. Sie bietet maximale Flexibilität und eignet sich für Szenarien, in denen Modell-Fine-Tuning, Integration in komplexe Anwendungen oder die Nutzung neuester Modellfunktionen erforderlich sind.
## 5.1 Transformers-Einführung
* **Vorteile:** Offizielle Unterstützung, größte Modellauswahl, einfache Integration in Python-Projekte, Unterstützung für PyTorch/TensorFlow/JAX, einfaches Fine-Tuning.
* **Nachteile:** Höchste Hardwareanforderungen (insbesondere Videospeicher), Modell-Dateien sind normalerweise groß, Installation von Abhängigkeiten kann zahlreich sein.
## 5.2 Umgebungs vorbereiten
#### Allgemeine Schritte
1. **Python (3.8+) und pip installieren:** Befolgen Sie die Anweisungen unter "I. Vorbereitungen vor der lokalen Bereitstellung".
2. **Virtuelle Umgebung erstellen und aktivieren (dringend empfohlen):**
```bash
python -m venv deepseek_env
# macOS/Linux
source deepseek_env/bin/activate
# Windows
.\deepseek_env\Scripts\activate
```
3. **Kernabhängigkeiten installieren:**
```bash
pip install torch transformers accelerate
```
* `torch`: PyTorch Deep Learning Framework.
* `transformers`: Hugging Face Modellbibliothek.
* `accelerate`: Zur Optimierung der Modellleistung auf Multi-GPU oder CPU.
#### GPU-Beschleunigung (Optional)
* **NVIDIA GPU-Benutzer:**
* Holen Sie sich den richtigen Installationsbefehl von der [offiziellen PyTorch-Website](https://pytorch.org/get-started/locally/) entsprechend Ihrer CUDA Toolkit-Version.
* **Beispiel (CUDA 12.1):**
```bash
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
```
* Überprüfen Sie nach der Installation mit `python -c "import torch; print(torch.cuda.is_available())"`, ob CUDA verfügbar ist.
* **macOS (Apple Silicon) Benutzer:**
* Installieren Sie eine PyTorch-Version, die Metal Performance Shaders (MPS) unterstützt:
```bash
pip install --pre torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/nightly/cpu
```
*Hinweis: Manchmal müssen Sie die Nightly-Version installieren, um die neueste MPS-Unterstützung zu erhalten.*
* Überprüfen Sie nach der Installation mit `python -c "import torch; print(torch.backends.mps.is_available())"`, ob MPS verfügbar ist.
## 5.3 Deepseek-Modellgewichte herunterladen
Die Hugging Face `transformers`-Bibliothek lädt die Modellgewichte beim ersten Laden des Modells automatisch in ein lokales Cache-Verzeichnis herunter.
Am Beispiel von `deepseek-ai/deepseek-coder-6.7b-instruct`.
## 5.4 Python-Inferenzcode schreiben
Erstellen Sie eine Python-Datei (z. B. `deepseek_inference.py`) und fügen Sie den folgenden Code hinzu:
```python
import torch
from transformers import AutoTokenizer, AutoModelForCausalLM
# 1. Modellpfad auswählen
# Deepseek-Coder-V1.5 6.7B Instruct
model_name = "deepseek-ai/deepseek-coder-6.7b-instruct"
# Deepseek-V2 (Beachten Sie, dass V2-Modelle normalerweise größer sind und höhere VRAM-Anforderungen haben)
# model_name = "deepseek-ai/DeepSeek-V2"
# 2. Gerät einstellen
# Bevorzugt CUDA (NVIDIA GPU), dann MPS (Apple Silicon), zuletzt CPU
if torch.cuda.is_available():
device = "cuda"
elif torch.backends.mps.is_available():
device = "mps"
else:
device = "cpu"
print(f"Using device: {device}")
# 3. Tokenizer und Modell laden
print(f"Loading tokenizer for {model_name}...")
tokenizer = AutoTokenizer.from_pretrained(model_name)
print(f"Loading model {model_name} to {device}...")
# Für größere Modelle können Sie load_in_8bit oder load_in_4bit zur Quantisierung verwenden, um VRAM zu sparen
# Dies geht jedoch mit geringfügigen Genauigkeits- und Geschwindigkeitsverlusten einher.
# model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype=torch.bfloat16, device_map="auto", load_in_8bit=True)
# Oder direkt auf das angegebene Gerät laden
model = AutoModelForCausalLM.from_pretrained(model_name, torch_dtype=torch.bfloat16).to(device)
model.eval() # In den Evaluationsmodus wechseln
print("Model loaded successfully!")
# 4. Dialogvorlage definieren (Beispiel für Deepseek-Coder-Instruct)
# Deepseek-Modelle haben normalerweise ein spezifisches Dialogformat. Bitte konsultieren Sie deren Hugging Face-Seite.
# Hier ist ein Beispiel für Deepseek-Coder-Instruct
def generate_response(prompt_text):
messages = [
{"role": "user", "content": prompt_text}
]
# Verwenden Sie die apply_chat_template-Methode des Tokenizers, um den Dialog zu formatieren
# add_generation_prompt=True fügt nach der Benutzernachricht einen Prompt für die Modellantwort hinzu
input_ids = tokenizer.apply_chat_template(messages, tokenize=True, add_generation_prompt=True, return_tensors="pt").to(device)
print(f"\nUser: {prompt_text}")
print("Generating response...")
# 5. Text generieren
with torch.no_grad():
outputs = model.generate(
input_ids,
max_new_tokens=512, # Maximale Anzahl neu zu generierender Tokens
do_sample=True,
temperature=0.7, # Abtasttemperatur
top_p=0.9, # Top-p-Abtastung
eos_token_id=tokenizer.eos_token_id,
pad_token_id=tokenizer.pad_token_id # Stellen Sie sicher, dass pad_token_id gesetzt ist
)
# 6. Ergebnis dekodieren und ausgeben
# Beim Dekodieren den Eingabeteil überspringen
response = tokenizer.decode(outputs[0][input_ids.shape[-1]:], skip_special_tokens=True)
print(f"Deepseek: {response.strip()}")
print("-" * 50)
# 7. Interaktiver Dialog
while True:
user_input = input("Enter your prompt (or 'quit' to exit): ")
if user_input.lower() == 'quit':
break
generate_response(user_input)
print("Exiting Deepseek inference.")
```
**Python-Code ausführen:**
1. Speichern Sie den obigen Code als `deepseek_inference.py`.
2. Führen Sie ihn in der aktivierten virtuellen Umgebung aus:
```bash
python deepseek_inference.py
```
Beim ersten Ausführen werden die Modellgewichte automatisch heruntergeladen. Nach Abschluss des Downloads beginnt das Programm mit dem Laden des Modells und wechselt in den interaktiven Modus.
# VI. Häufige Probleme und Fehlerbehebung
* **Speicher-/Videospeicher-Mangel (OOM - Out Of Memory):**
* **Symptome:** Programmabsturz, Fehlermeldungen wie "CUDA out of memory", "MPS out of memory" oder "killed".
* **Lösungen:**
* Wählen Sie eine kleinere Modellversion (z. B. 7B statt 67B).
* Verwenden Sie GGUF-Modelle mit höherer Quantisierung (z. B. Q4_K_M statt Q8_0).
* Versuchen Sie bei Transformers, den Parameter `load_in_8bit=True` oder `load_in_4bit=True` für die Quantisierung zu verwenden.
* Reduzieren Sie den Parameter `max_new_tokens`.
* Schließen Sie andere Programme, die viel Speicher/Videospeicher verbrauchen.
* **Modell-Download fehlgeschlagen oder langsam:**
* Überprüfen Sie die Netzwerkverbindung.
* Für Hugging Face-Modelle können Sie versuchen, die Umgebungsvariable `HF_ENDPOINT=https://hf-mirror.com` zu setzen, um einen Spiegelserver zu verwenden (nur für Benutzer auf dem chinesischen Festland).
* Laden Sie GGUF-Dateien manuell in das angegebene Verzeichnis herunter.
* **llama.cpp-Kompilierungsfehler:**
* Stellen Sie sicher, dass alle Abhängigkeiten (Git, C++-Compiler, CUDA Toolkit usw.) korrekt installiert und die Umgebungsvariablen konfiguriert sind.
* Überprüfen Sie die Fehlermeldung, die normalerweise auf eine fehlende Bibliothek oder Header-Datei hinweist.
* Versuchen Sie, neu zu kompilieren: `make clean && make`.
* **Python-Umgebungsprobleme:**
* Stellen Sie sicher, dass die richtige virtuelle Umgebung aktiviert ist.
* Überprüfen Sie, ob die Python-Version den Anforderungen entspricht.
* Verwenden Sie `pip list`, um zu überprüfen, ob alle Abhängigkeiten korrekt installiert sind.
* Wenn die CUDA-Version von PyTorch nicht übereinstimmt, deinstallieren Sie PyTorch und installieren Sie die richtige Version neu.
* **Ollama-Modell kann nicht gestartet werden:**
* Überprüfen Sie, ob der Ollama-Dienst läuft (`ollama list` oder `ollama ps`).
* Versuchen Sie, den Ollama-Dienst neu zu starten.
* Überprüfen Sie, ob der Modellname korrekt geschrieben ist.
# VII. Zusammenfassung und Ausblick
Dieser Artikel beschreibt detailliert drei Hauptmethoden zur lokalen Bereitstellung von Deepseek-Großmodellen unter macOS, Windows und Linux: Ollama, llama.cpp und Hugging Face Transformers.
* **Ollama** bietet das einfachste Bereitstellungserlebnis und eignet sich für schnelle Tests und den täglichen Gebrauch.
* **llama.cpp** zeichnet sich durch Leistung und Ressourceneffizienz aus und ist die ideale Wahl für die Inferenz von GGUF-Modellen.
* **Hugging Face Transformers** bietet maximale Flexibilität und Kontrolle und eignet sich für tiefgreifende Entwicklung und Anpassung.
Ob Sie Entwickler, Forscher oder KI-Enthusiast sind, die lokale Bereitstellung von Deepseek-Großmodellen wird Ihnen neue Türen zur Erforschung des Potenzials von Großmodellen öffnen. Mit der kontinuierlichen Weiterentwicklung der Open-Source-Community werden in Zukunft weitere effiziente und benutzerfreundliche Tools und Modelle erscheinen. Wir hoffen, dass diese Anleitung Ihnen hilft, den ersten Schritt erfolgreich zu machen und die Bequemlichkeit und den Spaß, den lokale Großmodelle bieten, in vollen Zügen zu genießen!Kommentar
Melde dich an, um Kommentare anzuzeigen und zu veröffentlichen
Zur Anmeldung